Реалізація автоматичного транскрибування судових засідань
Секретар витрачає до 40% часу на розшифровку: кожна хвилина аудіо — 5-10 хвилин ручної роботи. Помилка в протоколі — ризик скасування рішення. Ми вирішуємо це через on-premise ASR з діаризацією та юридичним словником, який знижує WER нижче 2% на чистих записах. Модель доучена на корпусі з 100+ годин судових засідань, включаючи регіональні особливості. Це не просто розпізнавання — це повноцінний ML-пайплайн для судів, що забезпечує конфіденційність і точність, недоступну хмарним сервісам.
Чому on-premise безпечніше за хмару?
Хмарні сервіси передають аудіо третій стороні — порушення таємниці нарадчої кімнати (ст. 241 КПК). On-premise архітектура гарантує, що дані не покидають контур суду. До того ж, комерційні STT дають WER 10-15% на юридичній лексиці, а наше рішення — <2% (в 5-10 разів точніше).
Як ми досягаємо точності >98%
Беремо Whisper large-v3 і доучуємо на корпусі судових засідань (100+ годин, 20+ судів). Використовуємо LoRA-адаптери для швидкої адаптації під конкретний голос диктора. Словник включає 5000+ юридичних термінів та шаблонів: «стаття сто п'ятдесят друга» → «ст. 152», «частина перша статті» → «ч. 1 ст.». Нормалізатор також обробляє дати, імена, абревіатури (КПК, ГПК, АПК).
class LegalTextNormalizer: def normalize(self, text: str) -> str: text = re.sub(r'стаття (\d+)', r'ст. \1', text) text = re.sub(r'частина (\w+)', lambda m: f'ч. {ROMAN_TO_INT[m.group(1)]}', text) return text Додатково використовуємо Voice Activity Detection (VAD) для фільтрації шумів та пауз — це знижує WER ще на 1-2%. Без VAD модель «чує» фонові розмови і породжує фантомні фрази.
Скільки можна заощадити на транскрибації?
| Метрика | Ручна розшифровка | Наша система |
|---|---|---|
| Час на 1 годину аудіо | 5-10 годин | 15-20 хвилин (постредагування) |
| Точність | 100% (але повільно) | >98% (WER<2%) |
| Навантаження на секретаря | 40% часу | 5-10% (тільки контроль) |
Економія на ФОП при типовому навантаженні — сотні тисяч гривень на рік. Точне значення залежить від обсягу засідань та регіону.
Як працює діаризація при перебиванні?
Використовуємо pyannote/speaker-diarization-3.1 з порогом 0.6. При перебиванні мітка SPEAKER_00+SPEAKER_01 — репліка йде на ручну перевірку. Точність атрибуції 92% на 2-4 учасники, 85% на 5+.
Що входить в роботу
- Доучування Whisper на ваших записах (5-10 годин, 2-3 тижні).
- Розгортання on-premise на сервері з GPU (NVIDIA A10G, L40S та ін.).
- Інтеграція з ГАС «Правосуддя» через REST API або XML-обмін.
- Навчання секретарів постредагуванню (1 день).
- Передача вихідних кодів моделі, конфігів, документації.
On-premise vs хмарні STT: ключові відмінності
| Параметр | On-premise (наше рішення) | Хмарні STT |
|---|---|---|
| Конфіденційність | Дані не покидають контур | Аудіо передається третій стороні |
| WER на юридичній лексиці | <2% | 10-15% |
| Доучування під замовника | Так | Ні |
| Діаризація | PyAnnote 3.1 (92% точність) | Базова (70-80%) |
| Інтеграція з ГАС | Сертифікований модуль | Потрібен адаптер |
Типові помилки та як їх уникнути
- Пропуск VAD-фільтрації: модель «чує» шуми і породжує фантомні фрази — WER зростає до 20%. Наш VAD відсікає тишу та шуми, залишаючи тільки мовлення.
- Використання моделі без доучування: стандартний Whisper не адаптований до юридичної лексики, дає WER 10-15%. Доучування обов'язкове для отримання заявленої точності.
- Ігнорування постредагування: навіть при 98% точності потрібен ручний контроль складних ділянок. Включаємо інтерфейс постредагування з підсвічуванням невпевнених фрагментів — це прискорює перевірку в 2-3 рази.
Процес впровадження
- Аудит інфраструктури та збір 5+ годин аудіо.
- Розмітка даних та доучування (3-4 тижні).
- Розробка інтеграційних модулів (2-3 тижні).
- Тестування на контрольній вибірці (1 тиждень).
- Деплой та навчання персоналу (1 тиждень).
- Дослідна експлуатація з нашою підтримкою (2 тижні).
Терміни та як почати
Базова система — від 4 тижнів. Повний цикл з доучуванням та ГАС — до 12 тижнів. Зв'яжіться з нами для індивідуальної пропозиції — оцінимо ваш проєкт, підготуємо КП під ключ. Замовте демо-доступ і переконайтеся в точності на своїх записах — отримайте консультацію інженера безкоштовно.
Архітектура описана в Whisper та pyannote/speaker-diarization-3.1. Наша компанія — 5+ років досвіду в NLP, 20+ проєктів транскрибації для судів та юрфірм.







