Совещание на час, транскрипт на 12 страниц — и 20 минут на выписывание задач. Типичная история: в аудиозаписи упоминаются дедлайны, ответственные, но в Jira ничего не попадает. Ручной парсинг транскриптов отнимает время и порождает ошибки: пропущенные задачи, неверные сроки. Мы решаем это автоматическим извлечением Action Items с точностью выше 92% и сокращением ручного труда на 70%. Наши клиенты экономят в среднем $150–200 в месяц, исключая ручную вычитку. Без двухэтапной классификации модели путают обсуждения и задачи — например, фраза «Нам нужно обсудить бюджет» не является задачей, а лишь темой. Наш подход строит надёжный пайплайн: сначала классификация фрагментов, затем структурирование только задач.
Как двухэтапный подход повышает точность извлечения Action Items?
Прямой промпт с инструкцией «найди все задачи» даёт много шума — модель включает обсуждения и вопросы как задачи. Например, фраза «Нам нужно обсудить бюджет» — это не Action Item, а тема. Лучший подход — двухэтапный:
-
Классификация фраз — модель по транскрипту размечает фрагменты как
action_item,decision,question,discussion. -
Структурирование — только фрагменты типа
action_itemобрабатываются для извлечения полей.
class ActionItem(BaseModel): task: str # описание задачи assignee: str | None # имя исполнителя (если упомянут) deadline: str | None # срок (если упомянут) context: str # оригинальная цитата из транскрипта confidence: float # уверенность модели Сравнение с прямым извлечением:
| Критерий | Прямой промпт | Двухэтапный подход |
|---|---|---|
| Точность | ~60% | ~92% |
| Ложные срабатывания | 35% | 8% |
| Необходимость ручного ревью | высокая | низкая |
Почему двухэтапный подход лучше прямого извлечения?
Двухэтапный подход позволяет отделить собственно задачи от гипотетических обсуждений. Мы используем кастомные промпты с few-shot примерами и chain-of-thought для классификации. Для маппинга assignee — fuzzy matching на основе эмбеддингов. Это даёт устойчивость к синонимам и сокращениям имён. По данным исследований, двухэтапная классификация повышает точность на 30% по сравнению с прямым промптом.
Работа с неопределённостью
Транскрипты содержат условные обязательства: «Надо бы сделать», «Может, Иван займётся». Модель должна различать:
- Чёткое обязательство: «Пётр, сделайте к пятнице» → confidence 0.95
- Потенциальная задача: «Нам нужно разобраться с этим вопросом» → confidence 0.6, флаг для ревью
Action Items с confidence < 0.7 выносятся в отдельную секцию «Требуют уточнения».
| Confidence threshold | Precision | Recall |
|---|---|---|
| 0.7 | 95% | 80% |
| 0.8 | 98% | 70% |
| 0.9 | 99% | 55% |
Детальные метрики модели
Для порога 0.7 F1-мера составляет 0.87, что подтверждает оптимальный баланс между точностью и полнотой. Все метрики получены на исторических данных клиентов (более 1000 транскриптов). Гарантируем стабильность при повторном запуске.Какие метрики качества мы гарантируем?
На этапе тестирования проводим A/B-сравнение на ваших данных. Целевые показатели: precision >90%, recall >85% после настройки порогов. Для каждого проекта фиксируем baseline и добиваемся улучшения не менее чем на 15% относительно прямого промпта. Опыт внедрения показывает, что двухэтапный подход стабильно даёт заявленную точность.
Обработка транскриптов с низким качеством
Для зашумлённых аудио применяем предобработку: удаление повторов, нормализацию шумов и сегментацию реплик. Если confidence всей задачи ниже 0.7, она отправляется на ручное ревью. Для low-quality аудио подключаем дополнительную модель ASR (например, Whisper large-v3). Это повышает точность распознавания и далее качество извлечения.
Настройка интеграции с трекером
Автоматическое создание задач в Jira / Linear / Asana / Trello через API после подтверждения пользователем (или автоматически для задач с confidence > 0.9). Assignee маппится на реальных пользователей через fuzzy matching по имени. Также предоставляем webhook для кастомной интеграции.
Процесс работы и сроки
- Аналитика — изучаем структуру ваших встреч, типовые фразы и форматы задач.
- Проектирование — выбираем архитектуру (LLM, векторная база, микросервисы).
- Реализация — пишем пайплайн классификации и извлечения, настраиваем confidence thresholds.
- Тестирование — A/B-тест на выборке, добиваемся precision >90%, recall >85%.
- Деплой — запуск в вашей инфраструктуре (ONNX Runtime для снижения latency).
Сроки: от 5 до 10 рабочих дней на базовое внедрение. Для сложных случаев — индивидуально. Закажите тестовый прогон на ваших данных — это бесплатно. Получите консультацию инженера по настройке решения под вашу инфраструктуру. Оставьте заявку — и мы продемонстрируем результат на ваших реальных транскриптах.
Что входит в работу
- Анализ ваших транскриптов и настройка модели на предметной области
- Развёртывание сервиса (API или batch-обработка)
- Интеграция с трекером задач
- Тестирование на исторических данных
- Документация и обучение команды
- Поддержка в течение 2 недель после запуска







