У міжнародному кол-центрі операторам доводиться обробляти запити російською, англійською та німецькою. Стандартний Whisper large-v3 показує WER 8-10%, але code-switching — перемикання мов усередині фрази — суттєво знижує точність до 15-20% на фрагментах зі змішуванням мов. Проблема посилюється latency p99, яка при маршрутизації між моделями може перевищувати 500 мс, що критично для real-time застосунків. Ми вирішили цю проблему за допомогою гібридної архітектури, яка комбінує швидкий детектор мови (Whisper tiny або langid) і спеціалізовані моделі, донавчені на цільових мовах за допомогою LoRA. На практиці це дає середній WER 4-9% при latency p99 не більше 200 мс, що дозволяє обробляти до 1000 паралельних сесій на одному інстансі з 4 GPU.
Чому багатомовний STT — це складно?
Основні технічні виклики:
- Code-switching — перемикання мов усередині однієї фрази (наприклад, російська з англійськими технічними термінами). Моделі часто втрачають контекст, що призводить до зростання WER на 30-50% на таких ділянках.
- Latency p99 — час відповіді при маршрутизації між моделями може перевищувати 500 мс, що критично для real-time застосунків. Стандартний каскад детектор+модель додає 100-200 мс на кожному кроці.
- Якість на low-resource мовах — WER для російської близько 7-10%, для арабської до 12%. Стандартні рішення дають високий відсоток помилок на нюансах вимови та діалектах, особливо при малому обсязі навчальних даних.
Як ми вирішуємо ці проблеми
Гібридна архітектура — основа наших проєктів. Швидкий детектор мови (Whisper tiny або langid) відправляє аудіофрагмент до спеціалізованої моделі. Якщо якість падає нижче порогу (confidence < 0.8), запускається fallback — універсальна multilingual модель.
Приклад із практики: для ритейл-мережі з аудиторією з 12 країн ми впровадили систему з 5 моделями, донавченими на локальних корпусах (fine-tuning з LoRA). Результат — зниження WER в середньому на 15% порівняно з out-of-the-box Whisper, а latency p99 не перевищує 200 мс. Модель Whisper large-v3 підтримує 99 мов, але точність на рідкісних мовах падає — ми компенсуємо це донавчанням та гібридною маршрутизацією.
Стек:
- Base model: Whisper large-v3, fine-tuned на російській, англійській, німецькій, французькій, іспанській.
- Детектор мови:
langid+ кастомний евристичний фільтр (на основі частотності N-грам). - Оптимізація: INT8 quantization для прискорення інференсу, Triton Inference Server для керування навантаженням.
- Балансування: залежно від мови та часу доби автоматично виділяється до 16 GPU.
Як працює гібридна архітектура на практиці?
Гібридна архітектура обробляє запити в 2 рази швидше, ніж послідовний запуск спеціалізованих моделей для кожної мови. При цьому точність залишається на рівні 90-95% від спеціалізованих рішень. Ми використовуємо каскад: детектор мови → primary model → fallback. Додатково застосовуємо INT8 quantization, що знижує вимоги до GPU на 40%.
Порівняння WER до та після fine-tuning для різних мов
| Мова | WER out-of-the-box Whisper | WER після fine-tuning | Зниження WER |
|---|---|---|---|
| Російська | 8.5% | 5.2% | 39% |
| Англійська | 7.0% | 4.5% | 36% |
| Німецька | 9.0% | 6.0% | 33% |
| Арабська | 12.5% | 8.5% | 32% |
| Французька | 8.5% | 5.5% | 35% |
Таблиця показує, що fine-tuning дає стійке покращення, особливо на складних мовах.
Процес реалізації багатомовного STT під ключ
- Аналітика — визначаємо цільові мови, обсяг аудіоданих, вимоги щодо latency та accuracy.
- Проєктування — обираємо архітектуру (гібрид/один двигун), проєктуємо pipeline з оцінкою cost per hour.
- Реалізація — тренінг/донавчання моделей, інтеграція з вашим бекендом (REST/WebSocket/gRPC).
- Тестування — прогоняємо на ваших даних: вимірюємо WER, confusion matrix, тестуємо code-switching сценарії.
- Deploy — контейнеризація (Docker), розгортання у вашому хмарі або on-premise, моніторинг (prometheus + grafana).
Що входить в результат
- Готова модель або pipeline з підтримкою ваших мов.
- Документація з API та архітектури.
- Навчання вашої команди.
- Пост-релізна підтримка 6 місяців.
Порівняння підходів до багатомовного STT
| Підхід | Точність (середній WER) | Latency p99 | Вартість GPU |
|---|---|---|---|
| Один multilingual двигун | 7-12% | 150 мс | 1 карта |
| Language-specific моделі | 3-8% | 300 мс | 5 карт |
| Гібрид (наш) | 4-9% | 200 мс | 2-3 карти |
Гібрид дає найкращий баланс: точність близька до спеціалізованих моделей, а latency та вартість — як у одного двигуна.
Скільки часу займає впровадження?
- Базова інтеграція з автовизначенням мови — від 2 днів.
- Повноцінна багатомовна система з маршрутизацією та донавчанням — від 1 тижня до 3 тижнів, залежно від кількості мов та необхідної якості.
- Fine-tuning на ваших даних — від 5 робочих днів на мову.
Вартість розраховується індивідуально після аналізу ваших вимог та обсягів. За 5+ років ми реалізували понад 50 STT-проєктів, і кожен гарантовано проходить load-testing з вашими реальними сценаріями.
Отримайте тестовий доступ до нашої системи — ми допоможемо підібрати оптимальне рішення для вашого завдання. Зв'яжіться з нами для консультації.







