Голосовой AI-бот для IVR: замена тонального меню

Клиент тратит минуты, пробираясь через 5 уровней тонального меню: «нажмите 1 для... нажмите 2, если...». 30% звонков сбрасываются на втором шаге. Раздражение растёт, бизнес теряет лиды. AI IVR решает это: пользователь говорит «хочу подключить интернет» и сразу попадает к нужному специалисту. Мы дела

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1003

Клиент тратит минуты, пробираясь через 5 уровней тонального меню: «нажмите 1 для... нажмите 2, если...». 30% звонков сбрасываются на втором шаге. Раздражение растёт, бизнес теряет лиды. AI IVR решает это: пользователь говорит «хочу подключить интернет» и сразу попадает к нужному специалисту. Мы делаем такие системы под ключ за 2–6 недель. Подход основан на технологии интерактивного голосового меню (IVR). В одном из проектов для телеком-оператора экономия на операторах составила до нескольких сотен тысяч долларов в месяц при нагрузке 5000 звонков — за счёт сокращения времени диалога и автоматизации простых запросов.

Сравнение AI IVR и DTMF

Параметр DTMF IVR AI IVR
Навигация 3–5 уровней меню 1–2 вопроса
Время до оператора 60–120 сек 10–20 сек
Caller experience Низкое Высокое
Точность маршрутизации ~90% (при правильных кнопках) 85–95%
Стоимость разработки Низкая Средняя

AI IVR не просто копирует дерево меню — он понимает естественный язык. Клиент формулирует запрос своими словами, а NLU-модель классифицирует намерение и направляет в нужный отдел. Даже если пользователь путается в терминах, система переспросит — как живой оператор. Сравнение с DTMF: время обработки запроса сокращается в 6 раз, а точность маршрутизации выше на 5–15%.

Как AI IVR понимает естественный язык?

В основе лежит языковая модель, которая различает намерения (intents). Мы настраиваем её под бизнес-логику: техническая поддержка, биллинг, подключение услуг, общая информация.

Пример маршрутизации звонка
ROUTING_DESTINATIONS = { "technical_support": [ "не работает", "сломалось", "ошибка", "проблема с", "техподдержка" ], "billing": [ "оплата", "счёт", "задолженность", "списание", "тариф", "деньги" ], "new_connection": [ "подключить", "новый договор", "тариф", "оформить", "заявка" ], "general_info": [ "информация", "узнать", "как работает", "что такое" ] } async def route_call(user_text: str) -> str: """Определяем направление маршрутизации""" response = await client.chat.completions.create( model="gpt-4o-mini", messages=[{ "role": "system", "content": f"""Маршрутизируй звонок. Направления: {list(ROUTING_DESTINATIONS.keys())}. Верни JSON: {{"destination": "...", "confidence": 0.0-1.0}}""" }, {"role": "user", "content": user_text}], response_format={"type": "json_object"} ) result = json.loads(response.choices[0].message.content) if result["confidence"] < 0.7: return "clarification_needed" return result["destination"] 

Если уверенность ниже 0.7, модель переспрашивает: «Уточните, пожалуйста: вам нужна поддержка по оборудованию или по оплате?» — так снижается риск ложной маршрутизации.

Зачем нужен сбор данных в IVR?

Часто IVR должен собрать номер заказа или код подтверждения. Мы извлекаем цифры из речи — и слова «три четыре пять шесть» превращаются в строку «3456»:

DATA_COLLECTION_PROMPTS = { "phone_verification": "Назовите последние 4 цифры вашего номера телефона.", "order_number": "Назовите номер вашего заказа.", "date_of_birth": "Назовите дату вашего рождения для верификации." } def extract_digits(text: str) -> str: """Извлекаем цифры из распознанного текста""" import re num_words = { "один": "1", "два": "2", "три": "3", "четыре": "4", "пять": "5", "шесть": "6", "семь": "7", "восемь": "8", "девять": "9", "ноль": "0" } for word, digit in num_words.items(): text = text.replace(word, digit) return re.sub(r'[^\d]', '', text) 

Сравнение STT-провайдеров для AI IVR

Модель WER (русский) Задержка (p50) Относительная стоимость
Whisper (large-v3) 8% 800 мс Низкая
Google STT 10% 600 мс Средняя
Yandex STT 9% 700 мс Высокая

Выбор зависит от бюджета и требований к латентности. Для real-time IVR мы рекомендуем комбинацию Whisper (точность) + Google STT (скорость) с динамическим переключением.

Как мы тестируем AI IVR?

Мы проводим A/B-эксперимент: сначала AI IVR обрабатывает 10% звонков, сравниваем конверсию и CSAT с DTMF-группой. Критерий успеха — время до оператора менее 20 сек и точность маршрутизации выше 90%. При превышении порогов увеличиваем долю до 100%. Мониторинг в Grafana: latency p99, количество переспросов, confidence distribution.

Обеспечение качества распознавания включает фильтр шумов на основе WebRTC, нормализацию громкости LRUCache и fallback-модели: если Whisper даёт confidence < 0.5, подключаем Google STT. В production применяем многоязычные модели с поддержкой русскоязычных акцентов. В документации Twilio отмечается, что Media Streams позволяют передавать аудио в реальном времени через WebSocket, что критично для low-latency IVR. Twilio Media Streams documentation

Процесс реализации AI IVR

  1. Аналитика и сбор сценариев — записываем реальные диалоги, выявляем частые запросы, строим граф намерений.
  2. Проектирование NLU-пайплайна — выбираем LLM (обычно GPT-4o-mini для скорости и цены), настраиваем few-shot примеры, подбираем threshold для переспроса.
  3. Интеграция с телефонией — подключаем WebSocket к Twilio или Asterisk. Голосовой поток передаётся в STT, затем в NLU.
  4. Разработка сценариев и сбор данных — настраиваем промпты для сбора номера заказа, даты, кода верификации. Добавляем поддержку многократных попыток ввода.
  5. Тестирование и A/B-эксперимент — сравниваем с DTMF.
  6. Деплой и мониторинг — разворачиваем на Kubernetes с auto-scaling, логируем каждое намерение и уверенность. Настраиваем алерты на падение confidence.

Что входит в работу

  • Документация: описание intents, схемы интеграции, регламент обновления модели.
  • Исходный код NLU-модуля, промпты и конфиги деплоя.
  • Доступ к demo-стенду для приёмки заказчиком.
  • Обучение команды: как пополнять сценарии, переобучать модель в случае дрейфа намерений.
  • Гарантия на NLU-модуль: поддерживаем точность классификации не ниже 90% в течение 6 месяцев после запуска.

Сроки и как оценить проект

Базовый AI IVR на 5 направлений — от 2 до 3 недель. Полная замена DTMF с аналитикой, инференсом на GPU и интеграцией с CRM — до 6 недель. Стоимость рассчитывается индивидуально. Свяжитесь с нами — мы зафиксируем ваши сценарии и пришлём оценку за 1–2 дня.

Наш опыт: 5+ лет в разработке голосовых ассистентов, более 50 проектов в ритейле, телекоме и финансах. Гарантируем, что пользователь не заметит подмены живого оператора — или доработаем модель бесплатно. Закажите demo-стенд для ваших сценариев.