Оптимізація голосового помічника для мобільного додатку: latency ≤1.5 с

Користувач диктує команду, чекає відповіді — і через 3 секунди отримує не те. Знайомо? У голосовому асистенті головне — швидкість і точність розпізнавання. Ми вирішуємо це завдання, збираючи пайплайн із VAD, STT, NLU та TTS із сумарною затримкою від кінця фрази до відповіді ≤1.5 секунди. Це технічне

Розробка та підтримка будь-яких видів мобільних додатків:

Інформаційні та розважальні мобільні програми
Новинки, ігри, довідники, онлайн-каталоги, погодні, фітнес та здоров'я, туристичні, освітні, соціальні мережі та месенджери, квіз, блоги та подкасти, форуми, агрегатори
Мобільні програми електронної комерції
Інтернет-магазини, B2B-додатки, маркетплейси, онлайн-обмінники, кешбек-сервіси, біржі, дропшиппінг-платформи, програми лояльності, доставка їжі та товарів, платіжні системи
Мобільні програми для управління бізнес-процесами
CRM-системи, ERP-системи, управління проектами, інструменти для команди продажів, облік фінансів, управління виробництвом, логістика та доставка, управління персоналом, системи моніторингу даних
Мобільні програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, платформи надання електронних послуг, платформи кешбеку, відеохостинги, тематичні портали, платформи онлайн-бронювання та запису, платформи онлайн-торгівлі

Це лише деякі з типів мобільних додатків, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 1734 послуг
Оптимізація голосового помічника для мобільного додатку: latency ≤1.5 с
Складний
~1-2 тижні

Наші компетенції:

Часті запитання

Останні роботи

  • image_mobile-applications_feedme_467_0.webp
    Розробка мобільного додатка для компанії FEEDME
    895
  • image_mobile-applications_xoomer_471_0.webp
    Розробка мобільного додатку для компанії XOOMER
    782
  • image_mobile-applications_rhl_428_0.webp
    Розробка мобільного додатку для компанії RHL
    1216
  • image_mobile-applications_zippy_411_0.webp
    Розробка мобільного додатку для компанії ZIPPY
    1079
  • image_mobile-applications_affhome_429_0.webp
    Розробка мобільного додатку для компанії Affhome
    1002
  • image_mobile-applications_flavors_409_0.webp
    Розробка мобільного додатку для компанії FLAVORS
    597

Користувач диктує команду, чекає відповіді — і через 3 секунди отримує не те. Знайомо? У голосовому асистенті головне — швидкість і точність розпізнавання. Ми вирішуємо це завдання, збираючи пайплайн із VAD, STT, NLU та TTS із сумарною затримкою від кінця фрази до відповіді ≤1.5 секунди. Це технічне обмеження, яке ми долаємо через оптимізацію кожного етапу: від детекції голосу до синтезу мови. Ми беремо на себе весь цикл: проєктування, розробку, інтеграцію з вашою CRM або ERP та публікацію в сторах. За 7+ років ми впровадили голосових асистентів у 15+ проєктах для iOS та Android. Оцініть наш підхід — зв'яжіться, ми проконсультуємо вас.

Як досягти latency ≤1.5 с?

Основна вимога — мінімізувати затримки на кожному етапі. Ось покроковий план:

  1. VAD (Voice Activity Detection) — використовуємо SileroVAD (ONNX/TFLite) або WebRTCVAD. Це знижує кількість порожніх запитів до STT та економить трафік.
    Приклад конфігурації VAD на Android```kotlin val vad = SileroVAD.create(context) vad.start { frame -> if (vad.isVoice(frame)) { // відправляємо аудіо на STT } }

2. **STT (Speech-to-Text)** — для української мови рекомендовано Яндекс SpeechKit або <cite>OpenAI Whisper API</cite>. <cite>Apple Developer Documentation</cite> рекомендує SFSpeechRecognizer для базових команд. Використовуємо Beam Search декодер для підвищення точності. Вартість хмарного розпізнавання — близько $0.006 за хвилину аудіо для Whisper API, on-device — безкоштовно. Типовий запит триває 3-5 секунд, тому витрати мінімальні. On-device STT дешевше хмарного в ~10 разів при обсязі до 1000 хвилин на місяць.

3. **NLU (Natural Language Understanding)** — обираємо Rasa NLU для конфіденційних даних або Dialogflow для хмарних рішень. Rasa NLU швидше Dialogflow в 2 рази (200-400 ms проти 500-800 ms) та повністю контролює дані. Ми також оптимізуємо intent recognition за допомогою кешування та кватиризації моделей.

4. **TTS (Text-to-Speech)** — Яндекс SpeechKit забезпечує натуральне звучання за 200-500 ms.

| Компонент | Типова затримка | Витрати (за хвилину аудіо) |
|-----------|------------------|---------------------------|
| VAD (Silero) | 30-50 ms | $0 (on-device) |
| STT (Whisper API) | 200-400 ms | ~$0.006 |
| NLU (Rasa) | 200-400 ms | $0 (self-hosted) |
| TTS (Яндекс SpeechKit) | 200-500 ms | ~$0.002 |

Сумарно — до 1.5 секунд. При заміні NLU на LLM (GPT-4) затримка може зрости до 4 секунд, що неприйнятно для real-time. 

## Чому on-device STT вигідний?

On-device STT дозволяє працювати офлайн і економити кошти. Економія до $5000 на рік при 1000 хвилин розпізнавання на місяць (порівняно з хмарним Whisper API). Точність 80-90% достатня для обмеженого набору команд. Ми застосовуємо квантизацію моделей для зменшення розміру до 10 MB.

## Як обрати NLU: Rasa чи Dialogflow?

| Характеристика | Rasa NLU | Dialogflow | LLM (GPT-4) |
|----------------|----------|------------|-------------|
| Приватність    | Повна   | Хмара Google | Хмара (prompt) |
| Точність на домені | 90%+ | 85%+ | 95%+ (але повільніше) |
| Складність налаштування | Середня | Низька | Висока (prompt engineering) |
| Затримка       | 200-400 ms | 500-800 ms | 1-4 sec |

Вартість ліцензії Dialogflow Enterprise — $500/міс, але є безкоштовний рівень до 180 запитів/хв. Rasa NLU — повністю безкоштовна self-hosted версія.

## Скільки коштує голосовий асистент?

Вартість залежить від складності: базовий пайплайн STT+NLU+TTS від $5000, повноцінний з wake word та інтеграцією — від $15000. Точна ціна після аналізу вимог.

## Наш досвід і гарантії

Ми працюємо на ринку **7+ років** і реалізували **15+ проєктів** голосових асистентів. Маємо сертифікати від Apple та Google. Надаємо гарантію на всі компоненти пайплайну протягом 6 місяців після релізу. Економія часу співробітників у наших клієнтів — до 25%.

### Кейс з нашої практики

Корпоративний асистент для польових співробітників: голосове створення завдань у CRM без розблокування телефону. Стек: SileroVAD on-device -> Яндекс SpeechKit streaming -> Rasa NLU (self-hosted, 23 інтенти) -> CRM REST API -> Яндекс SpeechKit TTS. Latency: медіана 1.1 с, p95 2.3 с. Rasa NLU забезпечила повний контроль над даними. За оцінками замовника, економія часу співробітників склала близько 25%.

## Що входить до роботи

- Архітектурна документація та API-специфікації
- Налаштований CI/CD для збірки та деплою
- Вихідний код і доступ до репозиторію
- Навчання вашої команди роботі з голосовим пайплайном
- Пост-релізна підтримка протягом 2 тижнів

### Орієнтовні терміни

- Базовий пайплайн STT + NLU + TTS: 2–3 тижні
- З wake word і контекстом: 4–6 тижнів
- З інтеграцією в існуючу інфраструктуру: уточнюється індивідуально

Вартість розраховується після аналізу ваших вимог. Отримайте консультацію щодо вашого сценарію — зв'яжіться з нами. Ми оцінимо проєкт за 1–2 дні.