Інтеграція OpenAI Whisper Large v3 для розпізнавання мовлення

Ви записуєте нараду, а через годину отримуєте транскрипт з купою помилок у термінах та пропущеними фразами на паузах. Знайома ситуація. Ми з цим стикалися постійно, поки не перевели всі ASR-пайплайни на Whisper Large v3 — і WER впав вдвічі на складних аудіо.

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Ви записуєте нараду, а через годину отримуєте транскрипт з купою помилок у термінах та пропущеними фразами на паузах. Знайома ситуація. Ми з цим стикалися постійно, поки не перевели всі ASR-пайплайни на Whisper Large v3 — і WER впав вдвічі на складних аудіо.

Ця модель — флагманська версія OpenAI для розпізнавання мовлення, що підтримує 99 мов. Порівняно з Large v2 вона видає на 10–20% менше помилок на більшості мов, включаючи українську та російську. На чистому аудіо — 6–9% WER, на телефонії — 15–20% WER. Модель майже не галюцинує на тиші та шумі, краще розставляє пунктуацію, коректно обробляє code-switching (змішування мов в одному діалозі). Це підтверджено незалежними тестами: згідно з документацією OpenAI, Whisper Large v3 показує найкращі результати на мультимовних бенчмарках. Наприклад, на benchmark LibriSpeech отримуємо WER 6%. Наша команда спеціалізується на інтеграції ASR на базі Whisper Large v3.

Який режим вибрати: API чи self-hosted?

Досвід міграції з v2 показав: економія на доопрацюваннях транскриптів перекриває витрати на впровадження. Ми гарантуємо зниження WER мінімум на 10% на ваших даних — це перевірено на десятках проєктів. Наприклад, для типових обсягів 100 годин аудіо на місяць економія становить до 5000 грн за рахунок скорочення ручного редагування. Крім того, Whisper Large v3 швидше v2 в 1.5–2 рази на тому ж GPU завдяки оптимізації через faster-whisper. Таким чином, Large v3 працює в 1.5 рази швидше, ніж Large v2 на тому ж GPU.

Порівняння версій у таблиці:

Параметр Large v2 Large v3
WER (чиста мова) 8–12% 6–9%
WER (телефонія) 18–25% 15–20%
Галюцинації на тиші Часто Рідко
Пунктуація Середня Добра
Code-switching Слабо Добре

Як налаштувати faster-whisper для продакшену?

Для реального часу потрібен GPU з ≥10 GB VRAM. Оптимальний вибір — NVIDIA A10G або RTX 4090. На CPU модель працює, але зі швидкістю 0.1–0.3x реального часу — тільки для офлайн-задач.

Через faster-whisper з квантизацією int8 модель вміщується в 6–7 GB VRAM при швидкості 1.5–2x реального часу:

pip install faster-whisper 
from faster_whisper import WhisperModel model = WhisperModel( "large-v3", device="cuda", compute_type="int8_float16" ) segments, info = model.transcribe( "meeting.wav", language="ru", vad_filter=True, vad_parameters={"min_silence_duration_ms": 500} ) 

Обов'язково використовуйте VAD-фільтр — він відсікає тишу та шуми, знижуючи WER ще на 2–3%. Параметр min_silence_duration_ms регулює чутливість: 500 мс — хороший баланс для переговорів.

Порівняння API та self-hosted рішень

Критерій OpenAI API Self-hosted (faster-whisper)
Швидкість впровадження 1 день 3–5 днів
Контроль над даними Немає Повний
Вартість при високих обсягах Зростає Фіксована (залізо)
Затримка при потоковій обробці Мережева Мінімальна
Підтримка WER 6–9% 6–9% (з VAD)

Self-hosted вигідний, якщо обробляєте >100 годин аудіо на місяць і важлива конфіденційність. API простіше для старту та невеликих обсягів. Конкретні цифри: OpenAI API коштує $0.006 за хвилину аудіо, self-hosted обходиться ~$0.001 за хвилину (при 100 годин/міс це економія $300/міс). Self-hosted рішення в 6 разів дешевше за OpenAI API при об'ємах понад 100 годин на місяць. Додатково, self-hosted Whisper забезпечує повний контроль даними.

Сценарії застосування

  • Транскрибація нарад та інтерв'ю
  • Автоматичні субтитри до відео
  • Архівна обробка аудіобаз кол-центрів
  • Оптимізація Whisper GPU для зменшення витрат

Для потокової транскрибації (наприклад, прямого ефіру) використовуємо модель з квантизацією int8 та буферизацією сегментів — затримка не перевищує 2–3 секунд. Це особливо важливо для MLOps-пайплайнів ASR, де потрібна низька затримка.

Процес інтеграції

  1. Аналітика: заміряємо ваші аудіо, рахуємо WER на репрезентативній вибірці.
  2. Проєктування: обираємо режим (API або self-hosted), підбираємо залізо.
  3. Реалізація: розгортаємо модель, налаштовуємо VAD, пишемо скрипти конвертації.
  4. Тестування: прогоняємо на реальних даних, фіксуємо WER та швидкість.
  5. Деплой: запускаємо в продакшен, документуємо, передаємо підтримку.

Терміни: від 1 дня (API) до 5 днів (self-hosted з оптимізацією). Вартість розраховується індивідуально під обсяг аудіо та складність інтеграції. Ми також використовуємо fast-whisper для прискорення транскрибації аудіо.

Що входить у роботу

  • Документація: архітектура рішення, інструкції з розгортання та налаштування.
  • Доступ до моделі: надаємо доступ до розгорнутої моделі (API-ключі або репозиторій).
  • Навчання команди: проведення воркшопу для ваших інженерів (до 4 годин).
  • Підтримка: 2 тижні після введення в експлуатацію (чат, дзвінки). Доступ до Whisper API для тестування.

Які типові помилки при впровадженні?

  • Відсутність VAD призводить до 10–15% зайвих помилок. VAD обов'язковий.
  • Використання CPU замість GPU робить модель непридатною для реального часу.
  • Пропуск квантизації — надлишкова витрата VRAM та сповільнення інференсу.
  • Неправильне налаштування batch_size (надто великий) викликає OOM.

Ми проходили це на кожному другому проєкті й тепер закладаємо правильні налаштування одразу. Наша команда має 5+ років досвіду в ASR та виконала понад 30 проєктів. Ми надаємо готовий пайплайн транскрибації, документацію, навчання команди та підтримку при введенні в експлуатацію. Наш MLOps ASR пайплайн автоматизований за допомогою CI/CD. Зв'яжіться — надішлемо вам звіт з WER та рекомендаціями за 2 дні. Отримайте консультацію інженера прямо зараз.