Автоматичне визначення мови мовлення (LID)
У кол-центрах на 500 операторів ручний вибір мови займає до 30 секунд на сесію — при 10 000 дзвінків на день це години втраченого часу. Автоматичне визначення мови мовлення (LID) скорочує цю затримку до мілісекунд та виключає помилки маршрутизації. За 5 років роботи ми впровадили LID у більш ніж 20 проектах — від банківських IVR до голосових помічників.
LID вирішує три ключові завдання: зниження latency при виборі мови, підвищення точності транскрибації (CER падає з 70% до 5%) та обробка code-switching — перемикання мов всередині одного діалогу. Без LID мультимовний пайплайн STT стає вузьким горлечком. Ми використовуємо дві основні архітектури: Whisper для максимальної точності та SpeechBrain VoxLingua107 для завдань із жорстким latency. Нижче розберемо, як кожна працює та коли їх застосовувати.
Які проблеми вирішує автоматичне визначення мови?
- Висока затримка при ручному виборі — до 30 секунд на кожен сегмент. LID знижує до 5-50 мс.
- Невірна маршрутизація STT — акустична модель, не навчена на цільовій мові, дає CER 70% замість 5%. LID спрямовує аудіо до правильного en/decoder.
- Складність обробки code-switching — перемикання всередині одного діалогу. Вирішуємо фреймворками з сегментацією за фразами.
Як працює LID на Whisper та SpeechBrain?
Whisper-based LID — наш основний інструмент для high-accuracy сценаріїв. Використовуємо модель small (244M параметрів), яка на перших секундах аудіо видає ймовірність мови з cost не вище 50мс на GPU:
from faster_whisper import WhisperModel model = WhisperModel("small", device="cuda") def detect_language(audio_path: str) -> tuple[str, float]: _, info = model.transcribe(audio_path, language=None, task="transcribe") return info.language, info.language_probability Для завдань із жорстким latency (p99 < 200 мс) використовуємо SpeechBrain VoxLingua107 — ECAPA-TDNN модель, навчена на 107 мовах. Точність 93% на 1-секундних фрагментах:
from speechbrain.pretrained import EncoderClassifier classifier = EncoderClassifier.from_hparams( source="speechbrain/lang-id-voxlingua107-ecapa", savedir="tmp_langid" ) signal = classifier.load_audio("speech.wav") prediction = classifier.classify_batch(signal) lang_id = prediction[3][0] confidence = float(prediction[1].exp()) VoxLingua107 працює в 10 разів швидше за Whisper на CPU при точності 93% проти 99% — обирайте модель під свою метрику. Згідно з дослідженням VoxLingua107, модель виділяє embedding фіксованої розмірності (256-dim) та класифікує за допомогою ECAPA-TDNN.
Досвід впровадження в продакшн — на одному проекті (кол-центр на 500 ліній) ми замінили монолітну STT на мультимовний пайплайн: Whisper LID → сегментація (2с вікна) → паралельна транскрибація. Latency знизився з 2.5с до 1.1с. Гарантуємо, що рішення під ключ проходить навантажувальне тестування при 1000 RPS.
Порівняння моделей LID
| Модель | Точність | Latency (GPU) | Мов | Сценарій |
|---|---|---|---|---|
| Whisper small | 99% | 50 мс | 99 | Транскрибація + LID |
| VoxLingua107 | 93% | 10 мс | 107 | Швидка класифікація |
| Кастомна (ECAPA) | 95%+ | 15 мс | до 20 | Специфічні мови |
Практичні пороги та рекомендації
| Confidence | Дія | Приклад сценарію |
|---|---|---|
| ≥ 0.95 | Автоматичний вибір STT | Чисте аудіо, одна мова |
| 0.7–0.95 | Використовувати з валідацією | Шумне аудіо, акцент |
| < 0.7 | Запросити ручний вибір або запустити heavy модель | Code-switching, короткі фрази |
Процес роботи
- Аналітика: вивчаємо ваше аудіо-середовище (шум, мови, тривалість записів).
- Вибір моделі: порівняння Whisper vs SpeechBrain vs кастомної (якщо мов <10).
- Інтеграція в пайплайн: Docker-контейнер, REST API, gRPC, батчинг.
- Тестування: A/B на тестовій вибірці >1000 годин, заміри latency та accuracy.
- Деплой: Kubernetes, автоскалінг, моніторинг через Prometheus/Grafana.
Що входить в нашу роботу (deliverables)
- Документація: API-специфікація, конфіги, інструкція з експлуатації.
- Модель: квантизована (INT8) версія для CPU/GPU — економія FLOPS до 40% без втрати якості.
- Доступи: приватний Docker Registry, Git-репозиторій з code та model card.
- Навчання: 4 години відео+сесія Q&A для ваших інженерів.
- Підтримка: 3 місяці моніторингу та консультацій.
Типові помилки та як їх уникнути
- Неправильний вибір порогу confidence → веде до miss-класифікації. Рекомендуємо емпірично підбирати на validation set.
- Нехтування квантизацією → latency на CPU до 2с. Використовуйте
torch.quantizationабо TensorRT. - Відсутність fallback → при збої моделі втрачаєте всі сесії. Робимо резервування з простим heuristics.
Строки орієнтовно
- Інтеграція готового LID-класифікатора (Whisper/VoxLingua107): 1–3 дні.
- Кастомна модель під 5–20 мов: 1–2 тижні.
- Повний пайплайн з multi-nodes та моніторингом: 3–5 тижнів.
Вартість розраховується індивідуально — оцінимо проект безкоштовно. Для уточнення деталей зв'яжіться з нами — ми підготуємо прототип під ваш сценарій. Отримайте консультацію, щоб обговорити вашу задачу та демо-доступ до робочого прототипу.







