Ми часто стикаємося з ситуацією: компанія вже використовує SaluteSpeech, але інтеграція зроблена «на колінці» — токен прострочується посеред діалогу, аудіо не проходить за тривалістю, діаризація не налаштована. Клієнт втрачає до 25% стенограм через помилки в конвеєрі. Завдання — вибудувати надійний пайплайн розпізнавання з гарантованою якістю. Ми спеціалізуємося на вбудовуванні SaluteSpeech у високонавантажені системи: кол-центри, голосові асистенти, автоматичне розшифрування нарад. Наш досвід — понад 30 проєктів з інтеграції мовленнєвих технологій. Пропонуємо готові модулі для Python, Go, Java з підтримкою асинхронного та потокового режимів.
Що SaluteSpeech дає російськомовному STT
SaluteSpeech від Сбера — не просто «ще один» розпізнавач. Це повноцінна платформа з сертифікацією ФСТЕК, придатна для критичної інфраструктури. Основні сильні сторони:
- WER на розмовному мовленні: 10–14%. Для порівняння: у відкритих моделей (Vosk, Coqui) WER 20–25%, у Yandex SpeechKit — 12–16%. SaluteSpeech точніший за Vosk вдвічі на російській розмовній мові.
- Затримка потокового розпізнавання: 200–400 мс (p99 <500 мс) — підходить для real-time діалогів.
- Діаризація: до 10 мовців з точністю 85–90%.
- On-premise розгортання: без передачі даних назовні, повний контроль.
- Підтримка 8 і 16 кГц, одноканального аудіо, а також контейнерів WAV, MP3, Ogg.
| Параметр | SaluteSpeech | Yandex SpeechKit | Vosk (open-source) |
|---|---|---|---|
| WER (рос. розм.) | 10–14% | 12–16% | 20–25% |
| Латенсі (stream) | 200–400 мс | 300–600 мс | 800–1500 мс |
| On-premise | Так | Ні | Так |
| Діаризація | До 10 | До 5 | До 2 (експерим.) |
Порівняйте: затримка SaluteSpeech у 3–7 разів менша, ніж у Vosk, а точність вища вдвічі. SaluteSpeech стає популярною альтернативою Yandex SpeechKit для завдань, що потребують on-premise та високої точності.
Як ми інтегруємо SaluteSpeech: реальний кейс
Клієнт — великий банк. Потрібно було розпізнавати записи розмов операторів кол-центру і в реальному часі підказувати відповіді. Ми обрали SaluteSpeech з двох причин: on-premise (конфіденційність) і WER <12% на банківській лексиці.
Архітектура рішення:
- Вхідний потік: аудіо з ATS (Avaya) через SIP-транк, конвертація в PCM 16 кГц.
- Backend: Python aiohttp + gRPC streaming. Токен оновлюється за 5 секунд до закінчення (таймер 25 хв) — реалізовано автоматичне оновлення токена авторизації.
- Векторна база: pgvector для зберігання embeddings ключових фраз (RAG для підказок).
- Моніторинг: Prometheus + Grafana — метрики latency, WER, кількість діаризованих спікерів.
Результат: точність розпізнавання 93% на діловій лексиці, затримка <300 мс, система працює без збоїв. Скоротили час на пошук інформації операторами на 40%.
«Система працює без збоїв уже півроку, точність влаштовує» — відгук керівника проєкту.
Чому варто обрати on-premise розгортання?
По-перше, дані залишаються в контурі компанії — немає ризику витоку через хмару. По-друге, не потрібно платити за кожен запит (ліцензія безстрокова). При переході на on-premise ви економите до 40% на транскрибації в довгостроковій перспективі. On-premise розгортання окупається за 6–12 місяців завдяки фіксованій вартості ліцензії. І нарешті, повний контроль над версіями моделей — можна оновлювати за власним графіком. Для держсектора та фінансів це часто обов'язкова вимога.
Як ми забезпечуємо точність розпізнавання?
Ми використовуємо адаптацію моделі під предметну область: fine-tuning на ваших даних (за наявності) або калібрування словника. Для ключових термінів і власних назв додаємо custom vocabulary. Постобробка включає нормалізацію чисел, дат та абревіатур. Все це дозволяє знизити WER додатково на 2–3 процентні пункти. Ми також допомагаємо оптимізувати вартість транскрибації за рахунок правильного вибору режиму (offline/online).
Приклад конфігурації для gRPC streaming
import grpc import audio_stream_pb2_grpc stub = audio_stream_pb2_grpc.SpeechToTextStub(channel) responses = stub.StreamingRecognize(iter(audio_chunks)) for response in responses: if response.result.is_final: print(response.result.alternatives[0].transcript) Процес роботи: від запиту до деплою
- Аналітика: аудит поточної інфраструктури (телефонія, аудіоформати, навантаження). Визначаємо сценарії: offline транскрибація, real-time асистент, пошук по архіву.
- Проектування: обираємо API (REST або gRPC), спосіб авторизації, схему auto-refresh токенів. Проектуємо відмовостійкий пайплайн (retry, circuit breaker).
- Реалізація: пишемо модуль інтеграції на Python/Go — буферизація, відправка чанків, обробка відповідей. Налаштовуємо діаризацію та постобробку.
- Тестування: вимірюємо WER на тестовому датасеті (1000+ фраз), перевіряємо latency p99 під навантаженням. Порівнюємо з альтернативами.
- Деплой: розгортаємо у вашому контурі (on-premise або VPC), налаштовуємо моніторинг, CI/CD, документацію.
Що входить у роботу
- Аналітичний звіт з вибором режиму (offline/online) та рекомендаціями щодо архітектури.
- Готовий код інтеграції (Python, Go, Java) з підтримкою auto-refresh токенів, retry-логіки та діаризації.
- Docker-образи для розгортання в Kubernetes або bare-metal.
- Postman-колекція для REST API та тестовий скрипт для gRPC.
- Документація з експлуатації (runbook).
- Підтримка протягом 3 місяців: допомога при інцидентах, оновлення бібліотек.
| Режим | Затримка | Застосування |
|---|---|---|
| Offline (REST) | 1–10 сек | Розшифрування записів, аналітика |
| Online (gRPC) | 200–400 мс | Голосові асистенти, live-підказки |
Терміни та вартість
Терміни: від 3 до 10 робочих днів залежно від складності (базовий REST — 3 дні, gRPC streaming з діаризацією — 7–10 днів). Вартість розраховується індивідуально після аналізу вашої інфраструктури.
Оцінимо ваш проєкт за 1 день — достатньо надіслати опис завдання. Ми надаємо гарантію якості: якщо WER не досягне обумовленого порогу, доопрацюємо безкоштовно.
Замовте безкоштовну оцінку вашого проєкту — ми підготуємо прототип за 1 день. Зв'яжіться з нами, щоб отримати приклад коду інтеграції.
Рекомендація: ознайомтеся з вікіпедійною статтею про розпізнавання мовлення для розуміння термінології.







