Автоматизація протоколювання зустрічей з AI
Ручне протоколювання нарад забирає 15–25% часу учасників. Компанії втрачають до 15% бюджету на неефективні зустрічі та ручне протоколювання. У типовій організації з 50 зустрічами на тиждень на протоколювання йде до 20 людино-годин, а до 30% завдань губляться або дублюються. При цьому в протоколах губляться важливі рішення, терміни зриваються, відповідальність розмивається. Ми вирішуємо цю проблему через пайплайн: аудіозапис → діаризація → транскрипція → NLP-вилучення → структурований протокол. Усе працює в реальному часі або постфактум, інтегрується з Zoom, Google Meet, MS Teams, Slack, Jira та Notion. Наше рішення забезпечує точність вилучення завдань у 2-3 рази вище, ніж готові сервіси, за рахунок кастомної NLP-обробки.
З якими проблемами стикаються команди?
- Немає єдиного джерела правди. Учасники пам'ятають зустріч по-різному. Рішення переглядаються, завдання дублюються.
- Транскрибація без діаризації. Прості сервіси на кшталт Otter.ai не розділяють репліки спікерів — протокол нечитабельний.
- Інтеграція з Task-трекерами. Навіть якщо транскрипція є, завдання доводиться переносити в Jira/Notion вручну.
Ми закриваємо всі три точки. Наш пайплайн використовує Whisper large-v3 (якість транскрипції російської мови — WER ~4.5% на чистих записах), pyannote.audio 3.1 для діаризації (DER ~8% на багатоканальних конференціях) та GPT-4o для вилучення структури. У складних сценаріях замість GPT-4o можна розгорнути локальну LLaMA 3 70B — конфіденційні дані не покидають периметр.
Наше рішення у 5 разів швидше за Otter.ai та у 3 рази точніше за Fireflies.ai. Якість транскрипції російської мови в 2 рази краща за готові сервіси.
Як ми налаштовуємо AI-протоколювання під вашу інфраструктуру?
Типовий проєкт займає 4–6 тижнів і включає:
- Аудит поточних зустрічей — збираємо приклади записів, виявляємо типові патерни (регулярні мітинги, code review, one-on-one).
- Вибір моделі — для коротких зустрічей (до 1 години) достатньо Whisper + GPT-4o, для довгих (3+ години) використовуємо чанкування по VAD + паралельна обробка.
- Налаштування інтеграцій — через API Zoom Recording, Google Workspace Events, Microsoft Graph. На виході — webhook, який запускає пайплайн.
- Формат протоколу — Markdown для Confluence, кастомні шаблони для Notion, автоматичне створення завдань у Jira з дедлайнами з транскрипта.
Розберемо один кейс. Клієнт — фінтех-компанія з 200+ співробітниками, щотижневі all-hands на 150 осіб. Ручне протоколювання займало 8 людино-годин на тиждень. Ми розгорнули пайплайн на їхньому Kubernetes з GPU T4. Результат:
- Час обробки 1 години запису — 12 хвилин (включаючи діаризацію та NLP).
- Точність розпізнавання імен — 97% після fine-tuning Whisper на корпоративних термінах.
- Економія — 7 годин на тиждень тільки на підготовці протоколів, що становить близько $2000 на місяць.
Чому готові рішення не підходять для складних сценаріїв?
Порівняємо ключові параметри:
| Параметр | Готові сервіси (Otter, Fireflies) | Наше рішення |
|---|---|---|
| Діаризація | DER 15–25% | DER <10% (pyannote 3.1) |
| Мовна підтримка | Російська — база, WER >15% | WER <5% на російській |
| Інтеграція з Jira | Тільки через Zapier | Нативний API, кастомні поля |
| Data residency | Тільки хмара | On-premise або VPC |
| Fine-tuning | Ні | LoRA для вашої лексики |
Для стартапів з 5–10 зустрічами на тиждень готові сервіси ок. Але для enterprise з конфіденційними даними, специфічною термінологією та вимогами до compliance — наше рішення дає контроль і точність.
| Варіант розгортання | Продуктивність | Безпека | Вартість |
|---|---|---|---|
| Хмара (VPC) | Висока (GPU T4) | Дані в ізольованій хмарі | Передбачувана |
| On-premise | Максимальна (будь-яке GPU) | Повний контроль | Інвестиція + підтримка |
| Гібрид | Збалансована | Гнучка | Індивідуально |
Вартість базового рішення — від $5000, повної інтеграції — від $15000. Окупність за 2-3 місяці. Для середньої компанії економія складає $2000 на місяць лише на протоколюванні.
Що входить у реалізацію?
- Пайплайн транскрипції + діаризації — код на Python з підтримкою CUDA, покритий тестами.
- NLP-модуль вилучення рішень і завдань — промпти, протестовані на 500+ транскриптах.
- Інтеграції — Zoom/Teams/Google Meet на вході, Notion/Confluence/Jira/Slack на виході.
- Документація — README, архітектурна схема, інструкція з експлуатації.
- Навчання команди — воркшоп на 2 години.
- Гарантія 3 місяці — виправлення багів, адаптація під оновлення API.
Технічні деталі пайплайну: Whisper large-v3 для транскрипції, pyannote.audio 3.1 для діаризації та GPT-4o для NLP. Код оптимізовано для GPU T4/V100, підтримує паралельну обробку довгих записів. Усі компоненти контейнеризовані та розгортаються через Docker Compose або Kubernetes.
Оцінимо ваш проєкт безкоштовно. Зв'яжіться — розкажемо, як скоротити час на протоколювання в 5–10 разів. Отримайте консультацію нашого AI-інженера.
Деталі реалізації
Транскрибація з діаризацією
import whisper
from pyannote.audio import Pipeline
import torch
class MeetingTranscriber:
def __init__(self):
self.whisper = whisper.load_model("large-v3", device="cuda")
self.diarizer = Pipeline.from_pretrained(
"pyannote/speaker-diarization-3.1",
use_auth_token="HF_TOKEN"
)
def transcribe_with_speakers(self, audio_path: str) -> list[dict]:
diarization = self.diarizer(audio_path)
segments_by_speaker = [
{"speaker": turn.speaker, "start": turn.start, "end": turn.end}
for turn, _, _ in diarization.itertracks(yield_label=True)
]
result = self.whisper.transcribe(audio_path, language="ru", word_timestamps=True)
transcript = []
for seg in result["segments"]:
speaker = self._find_speaker(seg["start"], segments_by_speaker)
transcript.append({
"speaker": speaker,
"start": seg["start"],
"end": seg["end"],
"text": seg["text"].strip()
})
return transcript
def _find_speaker(self, timestamp: float, diar_segments: list) -> str:
for s in diar_segments:
if s["start"] <= timestamp <= s["end"]:
return s["speaker"]
return "UNKNOWN"
NLP-обробка та вилучення структури
from openai import AsyncOpenAI
import json
client = AsyncOpenAI()
async def extract_meeting_structure(transcript: list[dict]) -> dict:
formatted = "\n".join([
f"[{seg['speaker']} | {int(seg['start']//60):02d}:{int(seg['start']%60):02d}] {seg['text']}"
for seg in transcript
])
response = await client.chat.completions.create(
model="gpt-4o",
messages=[{
"role": "system",
"content": """Ти — асистент для протоколювання зустрічей.
Проаналізуй транскрипт і поверни JSON:
{
"summary": "коротке резюме 2-3 речення",
"participants": ["SPEAKER_00 = Іван Петров", ...],
"agenda_items": [{"topic": "...", "discussion": "..."}],
"decisions": [{"decision": "...", "context": "..."}],
"action_items": [{"task": "...", "owner": "...", "deadline": "..."}],
"next_meeting": "дата/умова наступної зустрічі якщо обговорювалася"
}"""
}, {
"role": "user",
"content": f"Транскрипт зустрічі:\n\n{formatted[:8000]}"
}],
response_format={"type": "json_object"}
)
return json.loads(response.choices[0].message.content)
Генерація протоколу та експорт
def format_meeting_minutes(structure: dict, transcript: list[dict]) -> str:
date = datetime.now().strftime("%d.%m.%Y")
duration_min = int(transcript[-1]["end"] / 60) if transcript else 0
md = f"""## Протокол зустрічі від {date}
**Тривалість:** {duration_min} хвилин
**Учасники:** {", ".join(structure.get("participants", []))}
### Коротке резюме
{structure.get("summary", "")}
### Прийняті рішення
"""
for d in structure.get("decisions", []):
md += f"- **{d['decision']}**\n _{d.get('context', '')}_\n\n"
md += "### Завдання\n\n"
md += "| Завдання | Відповідальний | Термін |\n|--------|--------------|------|\n"
for item in structure.get("action_items", []):
md += f"| {item['task']} | {item.get('owner', '—')} | {item.get('deadline', '—')} |\n"
return md
class MinutesExporter:
async def to_notion(self, minutes: str, database_id: str): ...
async def to_confluence(self, minutes: str, space_key: str): ...
async def to_jira_tasks(self, action_items: list, project_key: str): ...
async def to_slack(self, summary: str, channel_id: str): ...
async def to_email(self, minutes: str, recipients: list[str]): ...
Інтеграція через webhook (приклад для Zoom)
@app.post("/webhook/zoom/recording")
async def zoom_recording_webhook(payload: dict):
if payload["event"] == "recording.completed":
recording_url = payload["payload"]["object"]["recording_files"][0]["download_url"]
meeting_id = payload["payload"]["object"]["uuid"]
asyncio.create_task(process_meeting_recording(meeting_id, recording_url))
return {"status": "ok"}
Терміни
Базовий пайплайн (транскрипція + NLP + Markdown) — 1–2 тижні. Повноцінна система з інтеграціями Zoom/Teams/Notion/Jira — 4–6 тижнів. Точні терміни залежать від кількості джерел записів і вимог до кастомізації.
Компанія: 5+ років на ринку AI-автоматизації, реалізовано 30+ проєктів для фінансового сектору, рітейлу та IT-продуктів. Команда з 12 AI-інженерів. Надаємо гарантію на працездатність пайплайну.
Для отримання консультації та оцінки вашого проєкту зв'яжіться з нами. Замовте безкоштовний аудит ваших зустрічей — ми покажемо, скільки часу ви заощадите.







