Multilingual STT: гібридне розпізнавання мовлення з автовизначенням мови

У міжнародному кол-центрі операторам доводиться обробляти запити російською, англійською та німецькою. Стандартний Whisper large-v3 показує WER 8-10%, але code-switching — перемикання мов усередині фрази — суттєво знижує точність до 15-20% на фрагментах зі змішуванням мов. Проблема посилюється laten

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

У міжнародному кол-центрі операторам доводиться обробляти запити російською, англійською та німецькою. Стандартний Whisper large-v3 показує WER 8-10%, але code-switching — перемикання мов усередині фрази — суттєво знижує точність до 15-20% на фрагментах зі змішуванням мов. Проблема посилюється latency p99, яка при маршрутизації між моделями може перевищувати 500 мс, що критично для real-time застосунків. Ми вирішили цю проблему за допомогою гібридної архітектури, яка комбінує швидкий детектор мови (Whisper tiny або langid) і спеціалізовані моделі, донавчені на цільових мовах за допомогою LoRA. На практиці це дає середній WER 4-9% при latency p99 не більше 200 мс, що дозволяє обробляти до 1000 паралельних сесій на одному інстансі з 4 GPU.

Чому багатомовний STT — це складно?

Основні технічні виклики:

  • Code-switching — перемикання мов усередині однієї фрази (наприклад, російська з англійськими технічними термінами). Моделі часто втрачають контекст, що призводить до зростання WER на 30-50% на таких ділянках.
  • Latency p99 — час відповіді при маршрутизації між моделями може перевищувати 500 мс, що критично для real-time застосунків. Стандартний каскад детектор+модель додає 100-200 мс на кожному кроці.
  • Якість на low-resource мовах — WER для російської близько 7-10%, для арабської до 12%. Стандартні рішення дають високий відсоток помилок на нюансах вимови та діалектах, особливо при малому обсязі навчальних даних.

Як ми вирішуємо ці проблеми

Гібридна архітектура — основа наших проєктів. Швидкий детектор мови (Whisper tiny або langid) відправляє аудіофрагмент до спеціалізованої моделі. Якщо якість падає нижче порогу (confidence < 0.8), запускається fallback — універсальна multilingual модель.

Приклад із практики: для ритейл-мережі з аудиторією з 12 країн ми впровадили систему з 5 моделями, донавченими на локальних корпусах (fine-tuning з LoRA). Результат — зниження WER в середньому на 15% порівняно з out-of-the-box Whisper, а latency p99 не перевищує 200 мс. Модель Whisper large-v3 підтримує 99 мов, але точність на рідкісних мовах падає — ми компенсуємо це донавчанням та гібридною маршрутизацією.

Стек:

  • Base model: Whisper large-v3, fine-tuned на російській, англійській, німецькій, французькій, іспанській.
  • Детектор мови: langid + кастомний евристичний фільтр (на основі частотності N-грам).
  • Оптимізація: INT8 quantization для прискорення інференсу, Triton Inference Server для керування навантаженням.
  • Балансування: залежно від мови та часу доби автоматично виділяється до 16 GPU.

Як працює гібридна архітектура на практиці?

Гібридна архітектура обробляє запити в 2 рази швидше, ніж послідовний запуск спеціалізованих моделей для кожної мови. При цьому точність залишається на рівні 90-95% від спеціалізованих рішень. Ми використовуємо каскад: детектор мови → primary model → fallback. Додатково застосовуємо INT8 quantization, що знижує вимоги до GPU на 40%.

Порівняння WER до та після fine-tuning для різних мов

Мова WER out-of-the-box Whisper WER після fine-tuning Зниження WER
Російська 8.5% 5.2% 39%
Англійська 7.0% 4.5% 36%
Німецька 9.0% 6.0% 33%
Арабська 12.5% 8.5% 32%
Французька 8.5% 5.5% 35%

Таблиця показує, що fine-tuning дає стійке покращення, особливо на складних мовах.

Процес реалізації багатомовного STT під ключ

  1. Аналітика — визначаємо цільові мови, обсяг аудіоданих, вимоги щодо latency та accuracy.
  2. Проєктування — обираємо архітектуру (гібрид/один двигун), проєктуємо pipeline з оцінкою cost per hour.
  3. Реалізація — тренінг/донавчання моделей, інтеграція з вашим бекендом (REST/WebSocket/gRPC).
  4. Тестування — прогоняємо на ваших даних: вимірюємо WER, confusion matrix, тестуємо code-switching сценарії.
  5. Deploy — контейнеризація (Docker), розгортання у вашому хмарі або on-premise, моніторинг (prometheus + grafana).

Що входить в результат

  • Готова модель або pipeline з підтримкою ваших мов.
  • Документація з API та архітектури.
  • Навчання вашої команди.
  • Пост-релізна підтримка 6 місяців.

Порівняння підходів до багатомовного STT

Підхід Точність (середній WER) Latency p99 Вартість GPU
Один multilingual двигун 7-12% 150 мс 1 карта
Language-specific моделі 3-8% 300 мс 5 карт
Гібрид (наш) 4-9% 200 мс 2-3 карти

Гібрид дає найкращий баланс: точність близька до спеціалізованих моделей, а latency та вартість — як у одного двигуна.

Скільки часу займає впровадження?

  • Базова інтеграція з автовизначенням мови — від 2 днів.
  • Повноцінна багатомовна система з маршрутизацією та донавчанням — від 1 тижня до 3 тижнів, залежно від кількості мов та необхідної якості.
  • Fine-tuning на ваших даних — від 5 робочих днів на мову.

Вартість розраховується індивідуально після аналізу ваших вимог та обсягів. За 5+ років ми реалізували понад 50 STT-проєктів, і кожен гарантовано проходить load-testing з вашими реальними сценаріями.

Отримайте тестовий доступ до нашої системи — ми допоможемо підібрати оптимальне рішення для вашого завдання. Зв'яжіться з нами для консультації.