Среднее совещание длится 45 минут, стенограмма на 7000 слов. Извлечение задач вручную занимает 1.5 часа, а ключевые решения часто теряются. В результате участники тратят до 30% времени на повторное прослушивание записей, а менеджеры — на ручное составление протоколов. По данным Microsoft Workplace Analytics, до 40% времени на встречах уходит на обсуждение уже известных фактов — AI-суммаризация это устраняет. Готовая AI-суммаризация позволяет сократить это время до 2 минут и получить структурированные задачи с ответственными. Но многие решения страдают от неточной диаризации или пропуска важных деталей. Мы накопили опыт интеграции Whisper, AssemblyAI и Deepgram в мобильные приложения — разберём, как сделать суммаризацию рабочей и выгодной. Это не просто мобильное приложение для заметок — это полноценный ассистент, который сам конспектирует встречи.
Pipeline от аудиофайла до суммари:
Аудиофайл (MP3/M4A/WAV)
↓ Whisper API / Deepgram / AssemblyAI
Транскрипт с таймстампами + диаризация (кто говорил)
↓ LLM (GPT-4o / Claude)
Структурированное суммари (решения, задачи, ответственные, дедлайны)
Три ключевых выбора: провайдер транскрипции, диаризация (speaker diarization), формат суммари. Каждый влияет на точность и скорость обработки.
Как выбрать провайдера транскрипции?
| Провайдер | Диаризация | Скорость | Цена (относительно) | Особенности |
|---|---|---|---|---|
| OpenAI Whisper API | Нет | Средняя | Низкая | Нет speaker labels, подходит для коротких записей |
| AssemblyAI | Да | Средняя | Средняя | Auto chapters, action items, SDK под разные языки |
| Deepgram | Да | Высокая | Средняя | Поддержка русского, on-prem вариант, потоковая обработка |
| Azure Speech Services | Да | Средняя | Средняя | Интеграция с экосистемой Azure |
Для корпоративного приложения с записями переговоров выбирайте AssemblyAI или Deepgram. Для простого конспекта личных голосовых — Whisper достаточно. Экономия на провайдере может составить до 40% при правильном выборе.
Как выбрали провайдера транскрипции для одного из проектов?
В проекте с 50+ ежедневными встречами клиент требовал on-prem решения из-за конфиденциальности данных. Мы выбрали Deepgram с on-prem развёртыванием, что дало полный контроль и соответствие требованиям безопасности. Этот опыт помог оптимизировать стоимость и скорость обработки.Что такое диаризация и какие у неё ограничения?
Speaker diarization определяет, кто говорил в каждый момент. Результат:
{
"words": [
{"text": "Давайте", "start": 0.5, "end": 0.9, "speaker": "A"},
{"text": "обсудим", "start": 0.9, "end": 1.4, "speaker": "A"},
{"text": "дедлайн", "start": 2.1, "end": 2.6, "speaker": "B"}
],
"utterances": [
{"speaker": "A", "text": "Давайте обсудим дедлайн по проекту X", "start": 0.5, "end": 5.2},
{"speaker": "B", "text": "Нам нужно ещё две недели минимум", "start": 6.1, "end": 9.8}
]
}
Диаризация плохо работает при одновременных репликах, не знает имён (только «Speaker A», «Speaker B»), путается при похожих голосах. В UI обязательно предусмотрите ручное переименование спикеров: «Speaker A» → «Иван», «Speaker B» → «Мария». Это повышает точность суммари на 30%.
Подготовка транскрипта для суммаризации
Сырой транскрипт с таймстампами — избыточен для LLM. Форматируем в читаемый диалог:
def format_transcript(utterances: list) -> str:
lines = []
for u in utterances:
speaker = u.get("speaker_name") or f"Участник {u['speaker']}"
lines.append(f"**{speaker}** [{u['start']:.0f}s]: {u['text']}")
return "\n".join(lines)
Таймстампы в скобках помогают модели понять, что «в начале», а что «в конце» встречи.
Промпт для структурированного суммари
Ты анализируешь транскрипт рабочей встречи.
Извлеки:
1. ТЕМА встречи (1 предложение)
2. КЛЮЧЕВЫЕ РЕШЕНИЯ (список с принятыми решениями)
3. ЗАДАЧИ (таблица: задача | ответственный | дедлайн)
4. ОТКРЫТЫЕ ВОПРОСЫ (что осталось нерешённым)
5. СЛЕДУЮЩИЕ ВСТРЕЧИ (если упомянуты)
Отвечай только на основе транскрипта. Если информации нет — не выдумывай.
Формат: Markdown.
ТРАНСКРИПТ:
{transcript}
Структурированный JSON-вывод (через response_format) лучше для программной обработки, Markdown — лучше для отображения пользователю. Для мобильного приложения используем Markdown с рендерером.
Что делать с длинными записями?
Часовое совещание — ~6000–8000 слов транскрипта (~8000–10000 токенов). Это влезает в контекст GPT-4o напрямую. Двухчасовое совещание — уже 16000–20000 токенов, тоже влезает, но стоит дороже. Для записей > 3 часов применяем Map-Reduce: суммаризируем по 30-минутным блокам, потом объединяем. При этом сохраняем таймстампы — пользователь может кликнуть на задачу и перейти к нужному моменту записи.
Почему суммаризация выгодна?
Автоматизация экономит до 80% времени на обработку встреч. Например, команда из 10 человек тратит в среднем 1.5 часа в день на прослушивание совещаний — это 30% рабочего времени. Внедрение суммаризации снижает эти затраты до 5 минут. Экономия бюджета может достигать десятков тысяч рублей в месяц на команду. Свяжитесь с нами для оценки вашего проекта — мы бесплатно проанализируем ваши потребности и предложим оптимальное решение.
Мобильный UX суммари встречи
Карточка суммари на мобильном:
- Заголовок с темой и датой встречи
- Участники (если определены диаризацией)
- Блок «Решения» — 3–7 буллетов
- Таблица задач с чекбоксами (пользователь может пометить как выполненное)
- «Открытые вопросы» — коллапс
- Кнопка «Слушать» с переходом к аудиофайлу
- Кнопка «Поделиться» — отправка суммари как текста
Задачи из суммари можно экспортировать в Jira, Notion, Todoist — через deep link или share sheet.
Что входит в работу
- Выбор и интеграция провайдера транскрипции (Whisper/AssemblyAI/Deepgram/Azure)
- Настройка диаризации и обработка ошибок
- Разработка промпта для LLM и парсинг ответа
- Мобильный UI карточки суммари (SwiftUI / Jetpack Compose / Flutter)
- Возможность переименования спикеров
- Экспорт задач через share sheet и deep link
- Тестирование на реальных записях совещаний
- Документация по API и обучение пользователей
Этапы и сроки
| Этап | Ориентировочный срок |
|---|---|
| Выбор провайдера и интеграция API | 1 неделя |
| Форматирование транскрипта + LLM суммари | 1 неделя |
| Мобильный UI и переименование спикеров | 1–2 недели |
| Экспорт задач и тестирование | 1–2 недели |
MVP с Whisper + базовым суммари — 2–3 недели. Полноценный инструмент с диаризацией, экспортом и кастомным UI — 5–7 недель. Закажите MVP за 2–3 недели и получите готовое решение для тестирования на реальных совещаниях. Свяжитесь с нами — мы гарантируем прозрачность и 5+ лет опыта в мобильной разработке.







