Клиент тратит минуты, пробираясь через 5 уровней тонального меню: «нажмите 1 для... нажмите 2, если...». 30% звонков сбрасываются на втором шаге. Раздражение растёт, бизнес теряет лиды. AI IVR решает это: пользователь говорит «хочу подключить интернет» и сразу попадает к нужному специалисту. Мы делаем такие системы под ключ за 2–6 недель. Подход основан на технологии интерактивного голосового меню (IVR). В одном из проектов для телеком-оператора экономия на операторах составила до нескольких сотен тысяч долларов в месяц при нагрузке 5000 звонков — за счёт сокращения времени диалога и автоматизации простых запросов.
Сравнение AI IVR и DTMF
| Параметр | DTMF IVR | AI IVR |
|---|---|---|
| Навигация | 3–5 уровней меню | 1–2 вопроса |
| Время до оператора | 60–120 сек | 10–20 сек |
| Caller experience | Низкое | Высокое |
| Точность маршрутизации | ~90% (при правильных кнопках) | 85–95% |
| Стоимость разработки | Низкая | Средняя |
AI IVR не просто копирует дерево меню — он понимает естественный язык. Клиент формулирует запрос своими словами, а NLU-модель классифицирует намерение и направляет в нужный отдел. Даже если пользователь путается в терминах, система переспросит — как живой оператор. Сравнение с DTMF: время обработки запроса сокращается в 6 раз, а точность маршрутизации выше на 5–15%.
Как AI IVR понимает естественный язык?
В основе лежит языковая модель, которая различает намерения (intents). Мы настраиваем её под бизнес-логику: техническая поддержка, биллинг, подключение услуг, общая информация.
Пример маршрутизации звонка
ROUTING_DESTINATIONS = { "technical_support": [ "не работает", "сломалось", "ошибка", "проблема с", "техподдержка" ], "billing": [ "оплата", "счёт", "задолженность", "списание", "тариф", "деньги" ], "new_connection": [ "подключить", "новый договор", "тариф", "оформить", "заявка" ], "general_info": [ "информация", "узнать", "как работает", "что такое" ] } async def route_call(user_text: str) -> str: """Определяем направление маршрутизации""" response = await client.chat.completions.create( model="gpt-4o-mini", messages=[{ "role": "system", "content": f"""Маршрутизируй звонок. Направления: {list(ROUTING_DESTINATIONS.keys())}. Верни JSON: {{"destination": "...", "confidence": 0.0-1.0}}""" }, {"role": "user", "content": user_text}], response_format={"type": "json_object"} ) result = json.loads(response.choices[0].message.content) if result["confidence"] < 0.7: return "clarification_needed" return result["destination"] Если уверенность ниже 0.7, модель переспрашивает: «Уточните, пожалуйста: вам нужна поддержка по оборудованию или по оплате?» — так снижается риск ложной маршрутизации.
Зачем нужен сбор данных в IVR?
Часто IVR должен собрать номер заказа или код подтверждения. Мы извлекаем цифры из речи — и слова «три четыре пять шесть» превращаются в строку «3456»:
DATA_COLLECTION_PROMPTS = { "phone_verification": "Назовите последние 4 цифры вашего номера телефона.", "order_number": "Назовите номер вашего заказа.", "date_of_birth": "Назовите дату вашего рождения для верификации." } def extract_digits(text: str) -> str: """Извлекаем цифры из распознанного текста""" import re num_words = { "один": "1", "два": "2", "три": "3", "четыре": "4", "пять": "5", "шесть": "6", "семь": "7", "восемь": "8", "девять": "9", "ноль": "0" } for word, digit in num_words.items(): text = text.replace(word, digit) return re.sub(r'[^\d]', '', text) Сравнение STT-провайдеров для AI IVR
| Модель | WER (русский) | Задержка (p50) | Относительная стоимость |
|---|---|---|---|
| Whisper (large-v3) | 8% | 800 мс | Низкая |
| Google STT | 10% | 600 мс | Средняя |
| Yandex STT | 9% | 700 мс | Высокая |
Выбор зависит от бюджета и требований к латентности. Для real-time IVR мы рекомендуем комбинацию Whisper (точность) + Google STT (скорость) с динамическим переключением.
Как мы тестируем AI IVR?
Мы проводим A/B-эксперимент: сначала AI IVR обрабатывает 10% звонков, сравниваем конверсию и CSAT с DTMF-группой. Критерий успеха — время до оператора менее 20 сек и точность маршрутизации выше 90%. При превышении порогов увеличиваем долю до 100%. Мониторинг в Grafana: latency p99, количество переспросов, confidence distribution.
Обеспечение качества распознавания включает фильтр шумов на основе WebRTC, нормализацию громкости LRUCache и fallback-модели: если Whisper даёт confidence < 0.5, подключаем Google STT. В production применяем многоязычные модели с поддержкой русскоязычных акцентов. В документации Twilio отмечается, что Media Streams позволяют передавать аудио в реальном времени через WebSocket, что критично для low-latency IVR. Twilio Media Streams documentation
Процесс реализации AI IVR
- Аналитика и сбор сценариев — записываем реальные диалоги, выявляем частые запросы, строим граф намерений.
- Проектирование NLU-пайплайна — выбираем LLM (обычно GPT-4o-mini для скорости и цены), настраиваем few-shot примеры, подбираем threshold для переспроса.
- Интеграция с телефонией — подключаем WebSocket к Twilio или Asterisk. Голосовой поток передаётся в STT, затем в NLU.
- Разработка сценариев и сбор данных — настраиваем промпты для сбора номера заказа, даты, кода верификации. Добавляем поддержку многократных попыток ввода.
- Тестирование и A/B-эксперимент — сравниваем с DTMF.
- Деплой и мониторинг — разворачиваем на Kubernetes с auto-scaling, логируем каждое намерение и уверенность. Настраиваем алерты на падение confidence.
Что входит в работу
- Документация: описание intents, схемы интеграции, регламент обновления модели.
- Исходный код NLU-модуля, промпты и конфиги деплоя.
- Доступ к demo-стенду для приёмки заказчиком.
- Обучение команды: как пополнять сценарии, переобучать модель в случае дрейфа намерений.
- Гарантия на NLU-модуль: поддерживаем точность классификации не ниже 90% в течение 6 месяцев после запуска.
Сроки и как оценить проект
Базовый AI IVR на 5 направлений — от 2 до 3 недель. Полная замена DTMF с аналитикой, инференсом на GPU и интеграцией с CRM — до 6 недель. Стоимость рассчитывается индивидуально. Свяжитесь с нами — мы зафиксируем ваши сценарии и пришлём оценку за 1–2 дня.
Наш опыт: 5+ лет в разработке голосовых ассистентов, более 50 проектов в ритейле, телекоме и финансах. Гарантируем, что пользователь не заметит подмены живого оператора — или доработаем модель бесплатно. Закажите demo-стенд для ваших сценариев.







