Голосовий AI-бот для IVR: заміна тонального меню

Клієнт витрачає хвилини, пробираючись через 5 рівнів тонального меню: «натисніть 1 для... натисніть 2, якщо...». 30% дзвінків скидаються на другому кроці. Роздратування зростає, бізнес втрачає ліди. AI IVR вирішує це: користувач каже «хочу підключити інтернет» і одразу потрапляє до потрібного фахівц

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1003

Клієнт витрачає хвилини, пробираючись через 5 рівнів тонального меню: «натисніть 1 для... натисніть 2, якщо...». 30% дзвінків скидаються на другому кроці. Роздратування зростає, бізнес втрачає ліди. AI IVR вирішує це: користувач каже «хочу підключити інтернет» і одразу потрапляє до потрібного фахівця. Ми робимо такі системи під ключ за 2–6 тижнів. Підхід базується на технології інтерактивного голосового меню (IVR). В одному з проектів для телеком-оператора економія на операторах становила 500 000 грн на місяць при навантаженні 5000 дзвінків — за рахунок скорочення часу діалогу та автоматизації простих запитів. Вартість розробки AI IVR починається від $5,000 за базову версію.

Порівняння AI IVR та DTMF

Параметр DTMF IVR AI IVR
Навігація 3–5 рівнів меню 1–2 питання
Час до оператора 60–120 сек 10–20 сек
Caller experience Низьке Високе
Точність маршрутизації ~90% (при правильних кнопках) 85–95%
Вартість розробки Низька Середня

AI IVR не просто копіює дерево меню — він розуміє природну мову. Клієнт формулює запит своїми словами, а NLU-модель класифікує намір і направляє в потрібний відділ. Навіть якщо користувач плутається в термінах, система перепитає — як живий оператор. Порівняння з DTMF: час обробки запиту скорочується в 6 разів, а точність маршрутизації вища на 10% — AI IVR в 6 разів швидше та на 10% точніше за традиційне тональне меню.

Як працює AI IVR?

В основі лежить мовна модель, яка розрізняє наміри (intents). Ми налаштовуємо її під бізнес-логіку: технічна підтримка, біллінг, підключення послуг, загальна інформація. Використовуємо нейронні мережі (трансформери) для векторизації запитів та контекстного розуміння. Обробка природної мови (NLU) дозволяє розуміти синоніми та варіації фраз.

Приклад маршрутизації дзвінка
ROUTING_DESTINATIONS = { "technical_support": [ "не работает", "сломалось", "ошибка", "проблема с", "техподдержка" ], "billing": [ "оплата", "счёт", "задолженность", "списание", "тариф", "деньги" ], "new_connection": [ "подключить", "новый договор", "тариф", "оформить", "заявка" ], "general_info": [ "информация", "узнать", "как работает", "что такое" ] } async def route_call(user_text: str) -> str: """Определяем направление маршрутизации""" response = await client.chat.completions.create( model="gpt-4o-mini", messages=[{ "role": "system", "content": f"""Маршрутизируй звонок. Направления: {list(ROUTING_DESTINATIONS.keys())}. Верни JSON: {{"destination": "...", "confidence": 0.0-1.0}}""" }, {"role": "user", "content": user_text}], response_format={"type": "json_object"} ) result = json.loads(response.choices[0].message.content) if result["confidence"] < 0.7: return "clarification_needed" return result["destination"] 

Якщо впевненість нижче 0.7, модель перепитує: «Уточніть, будь ласка: вам потрібна підтримка по обладнанню чи по оплаті?» — так знижується ризик хибної маршрутизації.

Чи можлива інтеграція з існуючою CRM?

Так, ми забезпечуємо інтеграцію з Twilio, Voximplant та Asterisk IVR. Голосовий AI-бот отримує аудіопотік через WebSocket, виконує розпізнавання мови за допомогою Whisper або Google STT, а потім NLU маршрутизація визначає наступний крок. Для підвищення точності використовується fine-tuning моделі на ваших даних.

Збір даних в IVR

Часто IVR має зібрати номер замовлення або код підтвердження. Ми витягуємо цифри з мовлення — і слова «три чотири п'ять шість» перетворюються на рядок «3456»:

DATA_COLLECTION_PROMPTS = { "phone_verification": "Назовите последние 4 цифры вашего номера телефона.", "order_number": "Назовите номер вашего заказа.", "date_of_birth": "Назовите дату вашего рождения для верификации." } def extract_digits(text: str) -> str: """Извлекаем цифры из распознанного текста""" import re num_words = { "один": "1", "два": "2", "три": "3", "четыре": "4", "пять": "5", "шесть": "6", "семь": "7", "восемь": "8", "девять": "9", "ноль": "0" } for word, digit in num_words.items(): text = text.replace(word, digit) return re.sub(r'[^\d]', '', text) 

Порівняння STT-провайдерів для AI IVR

Модель WER (російська) Затримка (p50) Відносна вартість
Whisper (large-v3) 8% 800 мс Низька
Google STT 10% 600 мс Середня
Yandex STT 9% 700 мс Висока

Вибір залежить від бюджету та вимог до латентності. Для real-time IVR ми рекомендуємо комбінацію Whisper (точність) + Google STT (швидкість) з динамічним перемиканням.

Тестування AI IVR

Ми проводимо A/B-експеримент: спочатку AI IVR обробляє 10% дзвінків, порівнюємо конверсію та CSAT з DTMF-групою. Критерій успіху — час до оператора менше 20 сек і точність маршрутизації вище 90%. При перевищенні порогів збільшуємо частку до 100%. Моніторинг в Grafana: latency p99, кількість перепитувань, confidence distribution.

Забезпечення якості розпізнавання включає фільтр шумів на основі WebRTC, нормалізацію гучності LRUCache та fallback-моделі: якщо Whisper дає confidence < 0.5, підключаємо Google STT. В production застосовуємо багатомовні моделі з підтримкою російськомовних акцентів. У документації Twilio зазначається, що Media Streams дозволяють передавати аудіо в реальному часі через WebSocket, що критично для low-latency IVR. Twilio Media Streams documentation

Процес реалізації AI IVR

  1. Аналітика та збір сценаріїв — записуємо реальні діалоги, виявляємо часті запити, будуємо граф намірів.
  2. Проектування NLU-пайплайну — вибираємо LLM (зазвичай GPT-4o-mini для швидкості та ціни), налаштовуємо few-shot приклади, підбираємо threshold для перепитування.
  3. Інтеграція з телефонією — підключаємо WebSocket до Twilio або Asterisk. Голосовий потік передається в STT, потім в NLU.
  4. Розробка сценаріїв та збір даних — налаштовуємо промпти для збору номера замовлення, дати, коду верифікації. Додаємо підтримку багаторазових спроб введення.
  5. Тестування та A/B-експеримент — порівнюємо з DTMF.
  6. Деплой та моніторинг — розгортаємо на Kubernetes з auto-scaling, логуємо кожен намір і впевненість. Налаштовуємо алерти на падіння confidence.

Що входить в роботу

  • Документація: опис intents, схеми інтеграції, регламент оновлення моделі.
  • Вихідний код NLU-модуля, промпти та конфіги деплою.
  • Доступ до demo-стенду для приймання замовником.
  • Навчання команди: як поповнювати сценарії, перенавчати модель у разі дрейфу намірів.
  • Гарантія на NLU-модуль: підтримуємо точність класифікації не нижче 90% протягом 6 місяців після запуску.

Терміни та як оцінити проект

Базовий AI IVR на 5 напрямків — від 2 до 3 тижнів. Повна заміна DTMF з аналітикою, інференсом на GPU та інтеграцією з CRM — до 6 тижнів. Вартість розраховується індивідуально. Зв'яжіться з нами — ми зафіксуємо ваші сценарії та надішлемо оцінку за 1–2 дні.

Наш досвід: понад 5 років у розробці голосових асистентів, більше 50 проектів у ритейлі, телекомі та фінансах. Гарантуємо, що користувач не помітить підміни живого оператора — або доопрацюємо модель безкоштовно. Замовте demo-стенд для ваших сценаріїв.