Клієнт витрачає хвилини, пробираючись через 5 рівнів тонального меню: «натисніть 1 для... натисніть 2, якщо...». 30% дзвінків скидаються на другому кроці. Роздратування зростає, бізнес втрачає ліди. AI IVR вирішує це: користувач каже «хочу підключити інтернет» і одразу потрапляє до потрібного фахівця. Ми робимо такі системи під ключ за 2–6 тижнів. Підхід базується на технології інтерактивного голосового меню (IVR). В одному з проектів для телеком-оператора економія на операторах становила 500 000 грн на місяць при навантаженні 5000 дзвінків — за рахунок скорочення часу діалогу та автоматизації простих запитів. Вартість розробки AI IVR починається від $5,000 за базову версію.
Порівняння AI IVR та DTMF
| Параметр | DTMF IVR | AI IVR |
|---|---|---|
| Навігація | 3–5 рівнів меню | 1–2 питання |
| Час до оператора | 60–120 сек | 10–20 сек |
| Caller experience | Низьке | Високе |
| Точність маршрутизації | ~90% (при правильних кнопках) | 85–95% |
| Вартість розробки | Низька | Середня |
AI IVR не просто копіює дерево меню — він розуміє природну мову. Клієнт формулює запит своїми словами, а NLU-модель класифікує намір і направляє в потрібний відділ. Навіть якщо користувач плутається в термінах, система перепитає — як живий оператор. Порівняння з DTMF: час обробки запиту скорочується в 6 разів, а точність маршрутизації вища на 10% — AI IVR в 6 разів швидше та на 10% точніше за традиційне тональне меню.
Як працює AI IVR?
В основі лежить мовна модель, яка розрізняє наміри (intents). Ми налаштовуємо її під бізнес-логіку: технічна підтримка, біллінг, підключення послуг, загальна інформація. Використовуємо нейронні мережі (трансформери) для векторизації запитів та контекстного розуміння. Обробка природної мови (NLU) дозволяє розуміти синоніми та варіації фраз.
Приклад маршрутизації дзвінка
ROUTING_DESTINATIONS = {
"technical_support": [
"не работает", "сломалось", "ошибка", "проблема с", "техподдержка"
],
"billing": [
"оплата", "счёт", "задолженность", "списание", "тариф", "деньги"
],
"new_connection": [
"подключить", "новый договор", "тариф", "оформить", "заявка"
],
"general_info": [
"информация", "узнать", "как работает", "что такое"
]
}
async def route_call(user_text: str) -> str:
"""Определяем направление маршрутизации"""
response = await client.chat.completions.create(
model="gpt-4o-mini",
messages=[{
"role": "system",
"content": f"""Маршрутизируй звонок. Направления: {list(ROUTING_DESTINATIONS.keys())}.
Верни JSON: {{"destination": "...", "confidence": 0.0-1.0}}"""
}, {"role": "user", "content": user_text}],
response_format={"type": "json_object"}
)
result = json.loads(response.choices[0].message.content)
if result["confidence"] < 0.7:
return "clarification_needed"
return result["destination"]
Якщо впевненість нижче 0.7, модель перепитує: «Уточніть, будь ласка: вам потрібна підтримка по обладнанню чи по оплаті?» — так знижується ризик хибної маршрутизації.
Чи можлива інтеграція з існуючою CRM?
Так, ми забезпечуємо інтеграцію з Twilio, Voximplant та Asterisk IVR. Голосовий AI-бот отримує аудіопотік через WebSocket, виконує розпізнавання мови за допомогою Whisper або Google STT, а потім NLU маршрутизація визначає наступний крок. Для підвищення точності використовується fine-tuning моделі на ваших даних.
Збір даних в IVR
Часто IVR має зібрати номер замовлення або код підтвердження. Ми витягуємо цифри з мовлення — і слова «три чотири п'ять шість» перетворюються на рядок «3456»:
DATA_COLLECTION_PROMPTS = {
"phone_verification": "Назовите последние 4 цифры вашего номера телефона.",
"order_number": "Назовите номер вашего заказа.",
"date_of_birth": "Назовите дату вашего рождения для верификации."
}
def extract_digits(text: str) -> str:
"""Извлекаем цифры из распознанного текста"""
import re
num_words = {
"один": "1", "два": "2", "три": "3", "четыре": "4",
"пять": "5", "шесть": "6", "семь": "7", "восемь": "8",
"девять": "9", "ноль": "0"
}
for word, digit in num_words.items():
text = text.replace(word, digit)
return re.sub(r'[^\d]', '', text)
Порівняння STT-провайдерів для AI IVR
| Модель | WER (російська) | Затримка (p50) | Відносна вартість |
|---|---|---|---|
| Whisper (large-v3) | 8% | 800 мс | Низька |
| Google STT | 10% | 600 мс | Середня |
| Yandex STT | 9% | 700 мс | Висока |
Вибір залежить від бюджету та вимог до латентності. Для real-time IVR ми рекомендуємо комбінацію Whisper (точність) + Google STT (швидкість) з динамічним перемиканням.
Тестування AI IVR
Ми проводимо A/B-експеримент: спочатку AI IVR обробляє 10% дзвінків, порівнюємо конверсію та CSAT з DTMF-групою. Критерій успіху — час до оператора менше 20 сек і точність маршрутизації вище 90%. При перевищенні порогів збільшуємо частку до 100%. Моніторинг в Grafana: latency p99, кількість перепитувань, confidence distribution.
Забезпечення якості розпізнавання включає фільтр шумів на основі WebRTC, нормалізацію гучності LRUCache та fallback-моделі: якщо Whisper дає confidence < 0.5, підключаємо Google STT. В production застосовуємо багатомовні моделі з підтримкою російськомовних акцентів. У документації Twilio зазначається, що Media Streams дозволяють передавати аудіо в реальному часі через WebSocket, що критично для low-latency IVR. Twilio Media Streams documentation
Процес реалізації AI IVR
- Аналітика та збір сценаріїв — записуємо реальні діалоги, виявляємо часті запити, будуємо граф намірів.
- Проектування NLU-пайплайну — вибираємо LLM (зазвичай GPT-4o-mini для швидкості та ціни), налаштовуємо few-shot приклади, підбираємо threshold для перепитування.
- Інтеграція з телефонією — підключаємо WebSocket до Twilio або Asterisk. Голосовий потік передається в STT, потім в NLU.
- Розробка сценаріїв та збір даних — налаштовуємо промпти для збору номера замовлення, дати, коду верифікації. Додаємо підтримку багаторазових спроб введення.
- Тестування та A/B-експеримент — порівнюємо з DTMF.
- Деплой та моніторинг — розгортаємо на Kubernetes з auto-scaling, логуємо кожен намір і впевненість. Налаштовуємо алерти на падіння confidence.
Що входить в роботу
- Документація: опис intents, схеми інтеграції, регламент оновлення моделі.
- Вихідний код NLU-модуля, промпти та конфіги деплою.
- Доступ до demo-стенду для приймання замовником.
- Навчання команди: як поповнювати сценарії, перенавчати модель у разі дрейфу намірів.
- Гарантія на NLU-модуль: підтримуємо точність класифікації не нижче 90% протягом 6 місяців після запуску.
Терміни та як оцінити проект
Базовий AI IVR на 5 напрямків — від 2 до 3 тижнів. Повна заміна DTMF з аналітикою, інференсом на GPU та інтеграцією з CRM — до 6 тижнів. Вартість розраховується індивідуально. Зв'яжіться з нами — ми зафіксуємо ваші сценарії та надішлемо оцінку за 1–2 дні.
Наш досвід: понад 5 років у розробці голосових асистентів, більше 50 проектів у ритейлі, телекомі та фінансах. Гарантуємо, що користувач не помітить підміни живого оператора — або доопрацюємо модель безкоштовно. Замовте demo-стенд для ваших сценаріїв.







