Ви записуєте нараду, а через годину отримуєте транскрипт з купою помилок у термінах та пропущеними фразами на паузах. Знайома ситуація. Ми з цим стикалися постійно, поки не перевели всі ASR-пайплайни на Whisper Large v3 — і WER впав вдвічі на складних аудіо.
Ця модель — флагманська версія OpenAI для розпізнавання мовлення, що підтримує 99 мов. Порівняно з Large v2 вона видає на 10–20% менше помилок на більшості мов, включаючи українську та російську. На чистому аудіо — 6–9% WER, на телефонії — 15–20% WER. Модель майже не галюцинує на тиші та шумі, краще розставляє пунктуацію, коректно обробляє code-switching (змішування мов в одному діалозі). Це підтверджено незалежними тестами: згідно з документацією OpenAI, Whisper Large v3 показує найкращі результати на мультимовних бенчмарках. Наприклад, на benchmark LibriSpeech отримуємо WER 6%. Наша команда спеціалізується на інтеграції ASR на базі Whisper Large v3.
Який режим вибрати: API чи self-hosted?
Досвід міграції з v2 показав: економія на доопрацюваннях транскриптів перекриває витрати на впровадження. Ми гарантуємо зниження WER мінімум на 10% на ваших даних — це перевірено на десятках проєктів. Наприклад, для типових обсягів 100 годин аудіо на місяць економія становить до 5000 грн за рахунок скорочення ручного редагування. Крім того, Whisper Large v3 швидше v2 в 1.5–2 рази на тому ж GPU завдяки оптимізації через faster-whisper. Таким чином, Large v3 працює в 1.5 рази швидше, ніж Large v2 на тому ж GPU.
Порівняння версій у таблиці:
| Параметр | Large v2 | Large v3 |
|---|---|---|
| WER (чиста мова) | 8–12% | 6–9% |
| WER (телефонія) | 18–25% | 15–20% |
| Галюцинації на тиші | Часто | Рідко |
| Пунктуація | Середня | Добра |
| Code-switching | Слабо | Добре |
Як налаштувати faster-whisper для продакшену?
Для реального часу потрібен GPU з ≥10 GB VRAM. Оптимальний вибір — NVIDIA A10G або RTX 4090. На CPU модель працює, але зі швидкістю 0.1–0.3x реального часу — тільки для офлайн-задач.
Через faster-whisper з квантизацією int8 модель вміщується в 6–7 GB VRAM при швидкості 1.5–2x реального часу:
pip install faster-whisper from faster_whisper import WhisperModel model = WhisperModel( "large-v3", device="cuda", compute_type="int8_float16" ) segments, info = model.transcribe( "meeting.wav", language="ru", vad_filter=True, vad_parameters={"min_silence_duration_ms": 500} ) Обов'язково використовуйте VAD-фільтр — він відсікає тишу та шуми, знижуючи WER ще на 2–3%. Параметр min_silence_duration_ms регулює чутливість: 500 мс — хороший баланс для переговорів.
Порівняння API та self-hosted рішень
| Критерій | OpenAI API | Self-hosted (faster-whisper) |
|---|---|---|
| Швидкість впровадження | 1 день | 3–5 днів |
| Контроль над даними | Немає | Повний |
| Вартість при високих обсягах | Зростає | Фіксована (залізо) |
| Затримка при потоковій обробці | Мережева | Мінімальна |
| Підтримка WER | 6–9% | 6–9% (з VAD) |
Self-hosted вигідний, якщо обробляєте >100 годин аудіо на місяць і важлива конфіденційність. API простіше для старту та невеликих обсягів. Конкретні цифри: OpenAI API коштує $0.006 за хвилину аудіо, self-hosted обходиться ~$0.001 за хвилину (при 100 годин/міс це економія $300/міс). Self-hosted рішення в 6 разів дешевше за OpenAI API при об'ємах понад 100 годин на місяць. Додатково, self-hosted Whisper забезпечує повний контроль даними.
Сценарії застосування
- Транскрибація нарад та інтерв'ю
- Автоматичні субтитри до відео
- Архівна обробка аудіобаз кол-центрів
- Оптимізація Whisper GPU для зменшення витрат
Для потокової транскрибації (наприклад, прямого ефіру) використовуємо модель з квантизацією int8 та буферизацією сегментів — затримка не перевищує 2–3 секунд. Це особливо важливо для MLOps-пайплайнів ASR, де потрібна низька затримка.
Процес інтеграції
- Аналітика: заміряємо ваші аудіо, рахуємо WER на репрезентативній вибірці.
- Проєктування: обираємо режим (API або self-hosted), підбираємо залізо.
- Реалізація: розгортаємо модель, налаштовуємо VAD, пишемо скрипти конвертації.
- Тестування: прогоняємо на реальних даних, фіксуємо WER та швидкість.
- Деплой: запускаємо в продакшен, документуємо, передаємо підтримку.
Терміни: від 1 дня (API) до 5 днів (self-hosted з оптимізацією). Вартість розраховується індивідуально під обсяг аудіо та складність інтеграції. Ми також використовуємо fast-whisper для прискорення транскрибації аудіо.
Що входить у роботу
- Документація: архітектура рішення, інструкції з розгортання та налаштування.
- Доступ до моделі: надаємо доступ до розгорнутої моделі (API-ключі або репозиторій).
- Навчання команди: проведення воркшопу для ваших інженерів (до 4 годин).
- Підтримка: 2 тижні після введення в експлуатацію (чат, дзвінки). Доступ до Whisper API для тестування.
Які типові помилки при впровадженні?
- Відсутність VAD призводить до 10–15% зайвих помилок. VAD обов'язковий.
- Використання CPU замість GPU робить модель непридатною для реального часу.
- Пропуск квантизації — надлишкова витрата VRAM та сповільнення інференсу.
- Неправильне налаштування batch_size (надто великий) викликає OOM.
Ми проходили це на кожному другому проєкті й тепер закладаємо правильні налаштування одразу. Наша команда має 5+ років досвіду в ASR та виконала понад 30 проєктів. Ми надаємо готовий пайплайн транскрибації, документацію, навчання команди та підтримку при введенні в експлуатацію. Наш MLOps ASR пайплайн автоматизований за допомогою CI/CD. Зв'яжіться — надішлемо вам звіт з WER та рекомендаціями за 2 дні. Отримайте консультацію інженера прямо зараз.







