Автоматичне транскрибування судових засідань: точність >98%

Реалізація автоматичного транскрибування судових засідань

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1003

Реалізація автоматичного транскрибування судових засідань

Секретар витрачає до 40% часу на розшифровку: кожна хвилина аудіо — 5-10 хвилин ручної роботи. Помилка в протоколі — ризик скасування рішення. Ми вирішуємо це через on-premise ASR з діаризацією та юридичним словником, який знижує WER нижче 2% на чистих записах. Модель доучена на корпусі з 100+ годин судових засідань, включаючи регіональні особливості. Це не просто розпізнавання — це повноцінний ML-пайплайн для судів, що забезпечує конфіденційність і точність, недоступну хмарним сервісам.

Чому on-premise безпечніше за хмару?

Хмарні сервіси передають аудіо третій стороні — порушення таємниці нарадчої кімнати (ст. 241 КПК). On-premise архітектура гарантує, що дані не покидають контур суду. До того ж, комерційні STT дають WER 10-15% на юридичній лексиці, а наше рішення — <2% (в 5-10 разів точніше).

Як ми досягаємо точності >98%

Беремо Whisper large-v3 і доучуємо на корпусі судових засідань (100+ годин, 20+ судів). Використовуємо LoRA-адаптери для швидкої адаптації під конкретний голос диктора. Словник включає 5000+ юридичних термінів та шаблонів: «стаття сто п'ятдесят друга» → «ст. 152», «частина перша статті» → «ч. 1 ст.». Нормалізатор також обробляє дати, імена, абревіатури (КПК, ГПК, АПК).

class LegalTextNormalizer: def normalize(self, text: str) -> str: text = re.sub(r'стаття (\d+)', r'ст. \1', text) text = re.sub(r'частина (\w+)', lambda m: f'ч. {ROMAN_TO_INT[m.group(1)]}', text) return text 

Додатково використовуємо Voice Activity Detection (VAD) для фільтрації шумів та пауз — це знижує WER ще на 1-2%. Без VAD модель «чує» фонові розмови і породжує фантомні фрази.

Скільки можна заощадити на транскрибації?

Метрика Ручна розшифровка Наша система
Час на 1 годину аудіо 5-10 годин 15-20 хвилин (постредагування)
Точність 100% (але повільно) >98% (WER<2%)
Навантаження на секретаря 40% часу 5-10% (тільки контроль)

Економія на ФОП при типовому навантаженні — сотні тисяч гривень на рік. Точне значення залежить від обсягу засідань та регіону.

Як працює діаризація при перебиванні?

Використовуємо pyannote/speaker-diarization-3.1 з порогом 0.6. При перебиванні мітка SPEAKER_00+SPEAKER_01 — репліка йде на ручну перевірку. Точність атрибуції 92% на 2-4 учасники, 85% на 5+.

Що входить в роботу

  • Доучування Whisper на ваших записах (5-10 годин, 2-3 тижні).
  • Розгортання on-premise на сервері з GPU (NVIDIA A10G, L40S та ін.).
  • Інтеграція з ГАС «Правосуддя» через REST API або XML-обмін.
  • Навчання секретарів постредагуванню (1 день).
  • Передача вихідних кодів моделі, конфігів, документації.

On-premise vs хмарні STT: ключові відмінності

Параметр On-premise (наше рішення) Хмарні STT
Конфіденційність Дані не покидають контур Аудіо передається третій стороні
WER на юридичній лексиці <2% 10-15%
Доучування під замовника Так Ні
Діаризація PyAnnote 3.1 (92% точність) Базова (70-80%)
Інтеграція з ГАС Сертифікований модуль Потрібен адаптер

Типові помилки та як їх уникнути

  • Пропуск VAD-фільтрації: модель «чує» шуми і породжує фантомні фрази — WER зростає до 20%. Наш VAD відсікає тишу та шуми, залишаючи тільки мовлення.
  • Використання моделі без доучування: стандартний Whisper не адаптований до юридичної лексики, дає WER 10-15%. Доучування обов'язкове для отримання заявленої точності.
  • Ігнорування постредагування: навіть при 98% точності потрібен ручний контроль складних ділянок. Включаємо інтерфейс постредагування з підсвічуванням невпевнених фрагментів — це прискорює перевірку в 2-3 рази.

Процес впровадження

  1. Аудит інфраструктури та збір 5+ годин аудіо.
  2. Розмітка даних та доучування (3-4 тижні).
  3. Розробка інтеграційних модулів (2-3 тижні).
  4. Тестування на контрольній вибірці (1 тиждень).
  5. Деплой та навчання персоналу (1 тиждень).
  6. Дослідна експлуатація з нашою підтримкою (2 тижні).

Терміни та як почати

Базова система — від 4 тижнів. Повний цикл з доучуванням та ГАС — до 12 тижнів. Зв'яжіться з нами для індивідуальної пропозиції — оцінимо ваш проєкт, підготуємо КП під ключ. Замовте демо-доступ і переконайтеся в точності на своїх записах — отримайте консультацію інженера безкоштовно.

Архітектура описана в Whisper та pyannote/speaker-diarization-3.1. Наша компанія — 5+ років досвіду в NLP, 20+ проєктів транскрибації для судів та юрфірм.