Розробка голосового AI на Voximplant: інтеграція VoxEngine, STT/TTS

Вихідний обдзвін на 500 контактів — бот відповідає із затримкою 4 секунди, клієнти скидають дзвінок. Ми зіткнулися з цим, коли клієнт-рієлторська компанія втрачала 30% лідів через паузи. Після інтеграції Voximplant з AI-бекендом latency знизили до 600 мс, конверсія в розмову зросла на 40%. Один із п

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1003

Вихідний обдзвін на 500 контактів — бот відповідає із затримкою 4 секунди, клієнти скидають дзвінок. Ми зіткнулися з цим, коли клієнт-рієлторська компанія втрачала 30% лідів через паузи. Після інтеграції Voximplant з AI-бекендом latency знизили до 600 мс, конверсія в розмову зросла на 40%. Один із проєктів приніс замовнику значну економію за рахунок скорочення штату операторів.

Російська платформа Voximplant з VoxEngine дає повний контроль над дзвінком, але її інтеграція з AI-моделями потребує тонкого налаштування потокового аудіо, VAD та управління чергами. За 5 років роботи ми реалізували понад 30 голосових AI-рішень на Voximplant. Наші інженери сертифіковані Voximplant Developer і знають, як вичавити мінімум 200 мс latency на етапі STT.

Які проблеми вирішуємо

Висока затримка відповіді — головний біль. При послідовній обробці аудіо (дзвінок → запис → розпізнавання → відповідь) latency досягає 3–5 секунд. Пауза в 1.5 секунди вже помітна користувачеві. Рішення — потокова обробка через WebSocket: аудіо передається фреймами по 30 мс, паралельно запускається голосовий VAD.

Нестабільне розпізнавання при фоновому шумі або швидкому мовцеві. Ми використовуємо моделі з адаптивним шумопригніченням (наприклад, Silero VAD) та налаштовуємо чутливість для кожного каналу.

Проблеми масштабування — VoxEngine сценарії працюють в одному потоці, а при 100+ одночасних дзвінках легко впертися в ліміти. Ми проєктуємо архітектуру з чергою повідомлень (RabbitMQ/NATS) і пулом AI-воркерів, розподіляючи навантаження.

Як влаштована інтеграція Voximplant з AI?

Основний патерн — VoxEngine відкриває WebSocket-з'єднання з нашим Python-бекендом при кожному дзвінку. Весь аудіопотік іде через нього, керований подіями.

// VoxEngine сценарій (JavaScript) VoxEngine.addEventListener(AppEvents.CallAlerting, (e) => { const call = e.call; call.answer(); // Створюємо WebSocket з'єднання з нашим AI-бекендом const wsConn = VoxEngine.createWSClient(`wss://api.yourapp.com/voxi-stream`); // Прив'язуємо аудіо дзвінка до WebSocket call.sendMediaTo(wsConn); wsConn.sendMediaTo(call); wsConn.addEventListener(WSClientEvents.ConnectionClosed, () => { call.hangup(); }); call.addEventListener(CallEvents.Disconnected, () => { wsConn.close(); }); }); 

На бекенді FastAPI приймає потік, накопичує аудіо в буфер, виявляє кінець фрази (VAD) і відправляє в ASR-модель. Результат — в TTS, синтезована мова повертається назад.

from fastapi import FastAPI, WebSocket import asyncio @app.websocket("/voxi-stream") async def voximplant_stream(websocket: WebSocket): await websocket.accept() session = VoiceSession() # Відправляємо привітання greeting_audio = await tts.synthesize("Доброго дня! Чим можу допомогти?") await websocket.send_bytes(greeting_audio) audio_buffer = bytearray() silence_frames = 0 async for chunk in websocket.iter_bytes(): audio_buffer.extend(chunk) silence_frames = 0 # скидаємо при отриманні аудіо # Обробляємо кожні 1.5 секунди накопиченого аудіо if len(audio_buffer) >= 24000 * 2: # 1.5 sec @ 16kHz 16-bit response = await process_utterance(bytes(audio_buffer), session) if response: audio_response = await tts.synthesize(response) await websocket.send_bytes(audio_response) audio_buffer = bytearray() 

Докладніше про протокол WebSocket. Зв'яжіться з нами, щоб обговорити ваш сценарій та отримати демонстрацію потокової обробки.

Що дає використання VoxEngine?

VoxEngine — це не проксі, а повноцінний JavaScript-двигун всередині дзвінка. Він дозволяє гнучко керувати медіа-потоком: мікшувати аудіо, перемикати канали, додавати тоновий набір. Для AI-сценаріїв це означає, що ми можемо відтворювати пререкорди (наприклад, «Зачекайте, будь ласка»), поки AI-модель обробляє запит, — без затримки.

Порівняння підходів VoxEngine + WebSocket REST API (виклик-відповідь)
Latency (p99) 400–800 мс 2–5 с
Масштабування 500+ одночасних дзвінків 50–100 дзвінків
Вартість інфраструктури Помірна (один WebSocket-сервер) Висока (залежить від кількості HTTP-воркерів)
Гнучкість діалогу Режим реального часу, переривання Тільки послідовні запити

З таблиці видно, що VoxEngine + WebSocket забезпечує latency у 400–800 мс, що в 5–10 разів швидше, ніж REST API.

Порівняння популярних моделей ASR/TTS

Модель Latency (p50) Точність (WER) Мови
Whisper (large) 300 мс 5% 99
Silero 150 мс 8% 2
Google STT 200 мс 6% 125
Yandex SpeechKit 250 мс 7% ru/en

Вибір моделі залежить від необхідної точності та бюджету. Для російської мови часто рекомендуємо Yandex SpeechKit або Whisper.

Чому Voximplant краще для голосового AI?

Документація Voximplant підтверджує: платформа спочатку проєктувалася для real-time комунікацій. На відміну від звичайних SIP-транків, VoxEngine дозволяє обробляти аудіо на рівні JavaScript, що дає sub-секундні затримки при правильній інтеграції.

Як знизити latency до 200 мс?

Досягти 200 мс на етапі STT можна лише при комплексному підході:

  • Використовувати VAD з низьким порогом (Silero VAD з threshold 0.3)
  • Попередньо завантажувати ASR-модель у GPU-пам'ять
  • Застосовувати streaming ASR (наприклад, Whisper cpp у real-time режимі)
  • Оптимізувати розмір аудіофреймів (30–50 мс)
Детальніше про налаштування VAD VAD (Voice Activity Detection) критичний для зниження latency. Рекомендуємо використовувати Silero VAD з параметром threshold 0.3 та min_silence_duration_ms 150. Це дозволяє відсікати паузи і не витрачати час на передачу тиші.

Вихідний обдзвін: як автоматизувати масові кампанії

Для вихідних дзвінків Voximplant надає API StartScenarios. Ми запускаємо кампанії з персоналізацією: передаємо в сценарій ім'я клієнта, контекст попередніх звернень.

import requests def start_outbound_campaign(contacts: list[dict]): """Запускаємо масовий обдзвін через Voximplant API""" for contact in contacts: response = requests.post( "https://api.voximplant.com/platform_api/StartScenarios/", data={ "account_name": VOXI_ACCOUNT, "api_key": VOXI_API_KEY, "rule_name": "outbound_bot", "script_custom_data": json.dumps({ "phone": contact["phone"], "customer_name": contact["name"], "context": contact.get("context", {}) }), "reference_to_call_id": contact["phone"] } ) 

Типові помилки: не обробляти зайняті лінії/недоступність — ми додаємо повторний дзвінок з експоненціальною затримкою та логуванням причин скидання.

Що входить у роботу

  • Аудит поточної телефонії та вимог до AI-сценарію.
  • Проєктування архітектури: вибір ASR/TTS, VAD, налаштування WebSocket-з'єднань.
  • Розробка VoxEngine-сценарію та Python-бекенду (FastAPI, asyncio).
  • Інтеграція з CRM та системами обліку (за потреби).
  • Навантажувальне тестування (1000+ віртуальних дзвінків).
  • Документація по сценарію та API.
  • Навчання операторів та підтримка 3 місяці після запуску.

Процес роботи

  1. Аналітика — вивчаємо ваші діалоги, визначаємо інтенти та слоти.
  2. Прототип — за 5 днів робимо MVP на одному сценарії (наприклад, відповіді на часті питання).
  3. Розробка — пишемо VoxEngine-код, підключаємо обрані ASR/TTS, налаштовуємо VAD.
  4. Тестування — прогоняємо 100+ тестових дзвінків, заміряємо latency та якість розпізнавання.
  5. Промисловий запуск — розгортаємо продакшен-інфраструктуру, налаштовуємо моніторинг (grafana, alertmanager).
  6. Підтримка — моніторинг, донавчання моделей, доопрацювання сценаріїв за статистикою.

Терміни орієнтовно

  • Базова інтеграція (один сценарій, ASR/TTS «з коробки») — від 1 до 2 тижнів.
  • Повноцінний production з вихідним обдзвоном, 3+ інтентами, інтеграцією CRM — від 1.5 до 2 місяців.
  • Вартість розраховується індивідуально, залежно від складності діалогів та вимог до latency.

Опишіть задачу — за 1 день підготуємо комерційну пропозицію з архітектурою та термінами. Гарантуємо SLA 99.9% та зниження часу відповіді бота до 200 мс. Замовте консультацію прямо зараз та отримайте аналіз вашої поточної схеми телефонії. Для оперативного старту зв'яжіться з нами через форму на сайті.