Вихідний обдзвін на 500 контактів — бот відповідає із затримкою 4 секунди, клієнти скидають дзвінок. Ми зіткнулися з цим, коли клієнт-рієлторська компанія втрачала 30% лідів через паузи. Після інтеграції Voximplant з AI-бекендом latency знизили до 600 мс, конверсія в розмову зросла на 40%. Один із проєктів приніс замовнику значну економію за рахунок скорочення штату операторів.
Російська платформа Voximplant з VoxEngine дає повний контроль над дзвінком, але її інтеграція з AI-моделями потребує тонкого налаштування потокового аудіо, VAD та управління чергами. За 5 років роботи ми реалізували понад 30 голосових AI-рішень на Voximplant. Наші інженери сертифіковані Voximplant Developer і знають, як вичавити мінімум 200 мс latency на етапі STT.
Які проблеми вирішуємо
Висока затримка відповіді — головний біль. При послідовній обробці аудіо (дзвінок → запис → розпізнавання → відповідь) latency досягає 3–5 секунд. Пауза в 1.5 секунди вже помітна користувачеві. Рішення — потокова обробка через WebSocket: аудіо передається фреймами по 30 мс, паралельно запускається голосовий VAD.
Нестабільне розпізнавання при фоновому шумі або швидкому мовцеві. Ми використовуємо моделі з адаптивним шумопригніченням (наприклад, Silero VAD) та налаштовуємо чутливість для кожного каналу.
Проблеми масштабування — VoxEngine сценарії працюють в одному потоці, а при 100+ одночасних дзвінках легко впертися в ліміти. Ми проєктуємо архітектуру з чергою повідомлень (RabbitMQ/NATS) і пулом AI-воркерів, розподіляючи навантаження.
Як влаштована інтеграція Voximplant з AI?
Основний патерн — VoxEngine відкриває WebSocket-з'єднання з нашим Python-бекендом при кожному дзвінку. Весь аудіопотік іде через нього, керований подіями.
// VoxEngine сценарій (JavaScript)
VoxEngine.addEventListener(AppEvents.CallAlerting, (e) => {
const call = e.call;
call.answer();
// Створюємо WebSocket з'єднання з нашим AI-бекендом
const wsConn = VoxEngine.createWSClient(`wss://api.yourapp.com/voxi-stream`);
// Прив'язуємо аудіо дзвінка до WebSocket
call.sendMediaTo(wsConn);
wsConn.sendMediaTo(call);
wsConn.addEventListener(WSClientEvents.ConnectionClosed, () => {
call.hangup();
});
call.addEventListener(CallEvents.Disconnected, () => {
wsConn.close();
});
});
На бекенді FastAPI приймає потік, накопичує аудіо в буфер, виявляє кінець фрази (VAD) і відправляє в ASR-модель. Результат — в TTS, синтезована мова повертається назад.
from fastapi import FastAPI, WebSocket
import asyncio
@app.websocket("/voxi-stream")
async def voximplant_stream(websocket: WebSocket):
await websocket.accept()
session = VoiceSession()
# Відправляємо привітання
greeting_audio = await tts.synthesize("Доброго дня! Чим можу допомогти?")
await websocket.send_bytes(greeting_audio)
audio_buffer = bytearray()
silence_frames = 0
async for chunk in websocket.iter_bytes():
audio_buffer.extend(chunk)
silence_frames = 0 # скидаємо при отриманні аудіо
# Обробляємо кожні 1.5 секунди накопиченого аудіо
if len(audio_buffer) >= 24000 * 2: # 1.5 sec @ 16kHz 16-bit
response = await process_utterance(bytes(audio_buffer), session)
if response:
audio_response = await tts.synthesize(response)
await websocket.send_bytes(audio_response)
audio_buffer = bytearray()
Докладніше про протокол WebSocket. Зв'яжіться з нами, щоб обговорити ваш сценарій та отримати демонстрацію потокової обробки.
Що дає використання VoxEngine?
VoxEngine — це не проксі, а повноцінний JavaScript-двигун всередині дзвінка. Він дозволяє гнучко керувати медіа-потоком: мікшувати аудіо, перемикати канали, додавати тоновий набір. Для AI-сценаріїв це означає, що ми можемо відтворювати пререкорди (наприклад, «Зачекайте, будь ласка»), поки AI-модель обробляє запит, — без затримки.
| Порівняння підходів | VoxEngine + WebSocket | REST API (виклик-відповідь) |
|---|---|---|
| Latency (p99) | 400–800 мс | 2–5 с |
| Масштабування | 500+ одночасних дзвінків | 50–100 дзвінків |
| Вартість інфраструктури | Помірна (один WebSocket-сервер) | Висока (залежить від кількості HTTP-воркерів) |
| Гнучкість діалогу | Режим реального часу, переривання | Тільки послідовні запити |
З таблиці видно, що VoxEngine + WebSocket забезпечує latency у 400–800 мс, що в 5–10 разів швидше, ніж REST API.
Порівняння популярних моделей ASR/TTS
| Модель | Latency (p50) | Точність (WER) | Мови |
|---|---|---|---|
| Whisper (large) | 300 мс | 5% | 99 |
| Silero | 150 мс | 8% | 2 |
| Google STT | 200 мс | 6% | 125 |
| Yandex SpeechKit | 250 мс | 7% | ru/en |
Вибір моделі залежить від необхідної точності та бюджету. Для російської мови часто рекомендуємо Yandex SpeechKit або Whisper.
Чому Voximplant краще для голосового AI?
Документація Voximplant підтверджує: платформа спочатку проєктувалася для real-time комунікацій. На відміну від звичайних SIP-транків, VoxEngine дозволяє обробляти аудіо на рівні JavaScript, що дає sub-секундні затримки при правильній інтеграції.
Як знизити latency до 200 мс?
Досягти 200 мс на етапі STT можна лише при комплексному підході:
- Використовувати VAD з низьким порогом (Silero VAD з threshold 0.3)
- Попередньо завантажувати ASR-модель у GPU-пам'ять
- Застосовувати streaming ASR (наприклад, Whisper cpp у real-time режимі)
- Оптимізувати розмір аудіофреймів (30–50 мс)
Детальніше про налаштування VAD
VAD (Voice Activity Detection) критичний для зниження latency. Рекомендуємо використовувати Silero VAD з параметром threshold 0.3 та min_silence_duration_ms 150. Це дозволяє відсікати паузи і не витрачати час на передачу тиші.Вихідний обдзвін: як автоматизувати масові кампанії
Для вихідних дзвінків Voximplant надає API StartScenarios. Ми запускаємо кампанії з персоналізацією: передаємо в сценарій ім'я клієнта, контекст попередніх звернень.
import requests
def start_outbound_campaign(contacts: list[dict]):
"""Запускаємо масовий обдзвін через Voximplant API"""
for contact in contacts:
response = requests.post(
"https://api.voximplant.com/platform_api/StartScenarios/",
data={
"account_name": VOXI_ACCOUNT,
"api_key": VOXI_API_KEY,
"rule_name": "outbound_bot",
"script_custom_data": json.dumps({
"phone": contact["phone"],
"customer_name": contact["name"],
"context": contact.get("context", {})
}),
"reference_to_call_id": contact["phone"]
}
)
Типові помилки: не обробляти зайняті лінії/недоступність — ми додаємо повторний дзвінок з експоненціальною затримкою та логуванням причин скидання.
Що входить у роботу
- Аудит поточної телефонії та вимог до AI-сценарію.
- Проєктування архітектури: вибір ASR/TTS, VAD, налаштування WebSocket-з'єднань.
- Розробка VoxEngine-сценарію та Python-бекенду (FastAPI, asyncio).
- Інтеграція з CRM та системами обліку (за потреби).
- Навантажувальне тестування (1000+ віртуальних дзвінків).
- Документація по сценарію та API.
- Навчання операторів та підтримка 3 місяці після запуску.
Процес роботи
- Аналітика — вивчаємо ваші діалоги, визначаємо інтенти та слоти.
- Прототип — за 5 днів робимо MVP на одному сценарії (наприклад, відповіді на часті питання).
- Розробка — пишемо VoxEngine-код, підключаємо обрані ASR/TTS, налаштовуємо VAD.
- Тестування — прогоняємо 100+ тестових дзвінків, заміряємо latency та якість розпізнавання.
- Промисловий запуск — розгортаємо продакшен-інфраструктуру, налаштовуємо моніторинг (grafana, alertmanager).
- Підтримка — моніторинг, донавчання моделей, доопрацювання сценаріїв за статистикою.
Терміни орієнтовно
- Базова інтеграція (один сценарій, ASR/TTS «з коробки») — від 1 до 2 тижнів.
- Повноцінний production з вихідним обдзвоном, 3+ інтентами, інтеграцією CRM — від 1.5 до 2 місяців.
- Вартість розраховується індивідуально, залежно від складності діалогів та вимог до latency.
Опишіть задачу — за 1 день підготуємо комерційну пропозицію з архітектурою та термінами. Гарантуємо SLA 99.9% та зниження часу відповіді бота до 200 мс. Замовте консультацію прямо зараз та отримайте аналіз вашої поточної схеми телефонії. Для оперативного старту зв'яжіться з нами через форму на сайті.







