Користувач диктує команду, чекає відповіді — і через 3 секунди отримує не те. Знайомо? У голосовому асистенті головне — швидкість і точність розпізнавання. Ми вирішуємо це завдання, збираючи пайплайн із VAD, STT, NLU та TTS із сумарною затримкою від кінця фрази до відповіді ≤1.5 секунди. Це технічне обмеження, яке ми долаємо через оптимізацію кожного етапу: від детекції голосу до синтезу мови. Ми беремо на себе весь цикл: проєктування, розробку, інтеграцію з вашою CRM або ERP та публікацію в сторах. За 7+ років ми впровадили голосових асистентів у 15+ проєктах для iOS та Android. Оцініть наш підхід — зв'яжіться, ми проконсультуємо вас.
Як досягти latency ≤1.5 с?
Основна вимога — мінімізувати затримки на кожному етапі. Ось покроковий план:
-
VAD (Voice Activity Detection) — використовуємо SileroVAD (ONNX/TFLite) або WebRTCVAD. Це знижує кількість порожніх запитів до STT та економить трафік.
Приклад конфігурації VAD на Android
```kotlin val vad = SileroVAD.create(context) vad.start { frame -> if (vad.isVoice(frame)) { // відправляємо аудіо на STT } }
2. **STT (Speech-to-Text)** — для української мови рекомендовано Яндекс SpeechKit або <cite>OpenAI Whisper API</cite>. <cite>Apple Developer Documentation</cite> рекомендує SFSpeechRecognizer для базових команд. Використовуємо Beam Search декодер для підвищення точності. Вартість хмарного розпізнавання — близько $0.006 за хвилину аудіо для Whisper API, on-device — безкоштовно. Типовий запит триває 3-5 секунд, тому витрати мінімальні. On-device STT дешевше хмарного в ~10 разів при обсязі до 1000 хвилин на місяць.
3. **NLU (Natural Language Understanding)** — обираємо Rasa NLU для конфіденційних даних або Dialogflow для хмарних рішень. Rasa NLU швидше Dialogflow в 2 рази (200-400 ms проти 500-800 ms) та повністю контролює дані. Ми також оптимізуємо intent recognition за допомогою кешування та кватиризації моделей.
4. **TTS (Text-to-Speech)** — Яндекс SpeechKit забезпечує натуральне звучання за 200-500 ms.
| Компонент | Типова затримка | Витрати (за хвилину аудіо) |
|-----------|------------------|---------------------------|
| VAD (Silero) | 30-50 ms | $0 (on-device) |
| STT (Whisper API) | 200-400 ms | ~$0.006 |
| NLU (Rasa) | 200-400 ms | $0 (self-hosted) |
| TTS (Яндекс SpeechKit) | 200-500 ms | ~$0.002 |
Сумарно — до 1.5 секунд. При заміні NLU на LLM (GPT-4) затримка може зрости до 4 секунд, що неприйнятно для real-time.
## Чому on-device STT вигідний?
On-device STT дозволяє працювати офлайн і економити кошти. Економія до $5000 на рік при 1000 хвилин розпізнавання на місяць (порівняно з хмарним Whisper API). Точність 80-90% достатня для обмеженого набору команд. Ми застосовуємо квантизацію моделей для зменшення розміру до 10 MB.
## Як обрати NLU: Rasa чи Dialogflow?
| Характеристика | Rasa NLU | Dialogflow | LLM (GPT-4) |
|----------------|----------|------------|-------------|
| Приватність | Повна | Хмара Google | Хмара (prompt) |
| Точність на домені | 90%+ | 85%+ | 95%+ (але повільніше) |
| Складність налаштування | Середня | Низька | Висока (prompt engineering) |
| Затримка | 200-400 ms | 500-800 ms | 1-4 sec |
Вартість ліцензії Dialogflow Enterprise — $500/міс, але є безкоштовний рівень до 180 запитів/хв. Rasa NLU — повністю безкоштовна self-hosted версія.
## Скільки коштує голосовий асистент?
Вартість залежить від складності: базовий пайплайн STT+NLU+TTS від $5000, повноцінний з wake word та інтеграцією — від $15000. Точна ціна після аналізу вимог.
## Наш досвід і гарантії
Ми працюємо на ринку **7+ років** і реалізували **15+ проєктів** голосових асистентів. Маємо сертифікати від Apple та Google. Надаємо гарантію на всі компоненти пайплайну протягом 6 місяців після релізу. Економія часу співробітників у наших клієнтів — до 25%.
### Кейс з нашої практики
Корпоративний асистент для польових співробітників: голосове створення завдань у CRM без розблокування телефону. Стек: SileroVAD on-device -> Яндекс SpeechKit streaming -> Rasa NLU (self-hosted, 23 інтенти) -> CRM REST API -> Яндекс SpeechKit TTS. Latency: медіана 1.1 с, p95 2.3 с. Rasa NLU забезпечила повний контроль над даними. За оцінками замовника, економія часу співробітників склала близько 25%.
## Що входить до роботи
- Архітектурна документація та API-специфікації
- Налаштований CI/CD для збірки та деплою
- Вихідний код і доступ до репозиторію
- Навчання вашої команди роботі з голосовим пайплайном
- Пост-релізна підтримка протягом 2 тижнів
### Орієнтовні терміни
- Базовий пайплайн STT + NLU + TTS: 2–3 тижні
- З wake word і контекстом: 4–6 тижнів
- З інтеграцією в існуючу інфраструктуру: уточнюється індивідуально
Вартість розраховується після аналізу ваших вимог. Отримайте консультацію щодо вашого сценарію — зв'яжіться з нами. Ми оцінимо проєкт за 1–2 дні.







