AI-чат-бот для підтримки: RAG, інтеграції та ескалація
Уявіть: ви — оператор підтримки, і 80% запитів однотипні: "де моє замовлення" або "як повернути". На них іде 70% часу. Ми будуємо AI-чат-ботів, які вирішують реальні завдання — не просто відповідають, а змінюють замовлення, оформлюють повернення, перевіряють статус. Різниця — в інтеграції з вашими системами та RAG.
Як інтегрувати AI-бота з CRM?
Безкорисний бот відповідає "Перевірте особистий кабінет", не бачачи даних. Ми підключаємо бота до CRM через REST API: він отримує історію, статус замовлень, звернення. Кожна дія авторизована — змінити адресу може лише верифікований користувач. Реалізуємо OAuth 2.0 або JWT.
Приклад із практики: для інтернет-магазину з 50 000 замовлень на місяць ми впровадили інтеграцію з 1С-Бітрікс. Бот перевіряє статус за номером телефону та оформлює повернення без оператора. Containment rate виріс з 20% до 65%.
Чому RAG — ключ до точних відповідей?
Зберігати всі відповіді в промпті LLM неефективно — контекстне вікно обмежене, знання старіють. RAG додає пошук по базі знань: семантичне кешування, векторні представлення, ранжування. Використовуємо Pinecone або Qdrant для ембеддингів, модель — GPT-4 або LLaMA 3.
Деталі RAG-пайплайну
- Документи розбиваються на чанки (256–512 токенів).
- Кожен чанк індексується за допомогою ембеддинг-моделі (text-embedding-ada-002).
- При запиті обчислюється косинусна близькість, повертаються top-5 чанків.
- LLM формує відповідь з урахуванням знайдених контекстів та історії діалогу.
Архітектура production-чат-бота
[Клієнт] → [Омніканальний інтерфейс] → [NLP Engine: Intent + Entity] → [Dialog Manager] ├── RAG: відповіді з бази знань ├── Action Engine: інтеграції з CRM/ERP └── Escalation: передача оператору → [Response Generator] → [Analytics & Logging] Ядро: класифікація та слот-філінг
Порівняємо класичний підхід (Rasa) з LLM + function calling:
| Параметр | Intent + Slots (Rasa) | LLM + Function Calling |
|---|---|---|
| Точність інтентів | 90–95% | 95–98% |
| Складність налаштування | Вимагає розмітки прикладів | Достатньо опису tools |
| Гнучкість | Низька при нових сценаріях | Висока — LLM розуміє переформулювання |
LLM з function calling скорочує час налаштування нових сценаріїв в 3 рази порівняно з Rasa. Приклад конфігурації tools:
tools = [ { "name": "check_order_status", "description": "Перевірити статус замовлення за номером", "parameters": {"order_id": {"type": "string"}} }, { "name": "initiate_return", "description": "Оформити повернення товару", "parameters": { "order_id": {"type": "string"}, "reason": {"type": "string"} } } ] Ескалація до оператора
Тригери передачі живій людині: клієнт явно просить оператора, негативний sentiment, бот не вирішив задачу за 3 спроби, VIP-клієнт, юридичні претензії. При ескалації оператор отримує повний контекст діалогу — не потрібно просити клієнта повторювати.
Метрики та якість
- Containment rate: ціль 50–70%.
- CSAT (bot): >4.0/5.0.
- Resolution rate: % проблем, дійсно вирішених.
- Escalation rate: баланс — не вище 30%, не нижче 10%.
| Етап | Час | Результат |
|---|---|---|
| MVP | 4–6 тижнів | Базові інтенти + CRM інтеграція |
| Повний функціонал | 3–4 місяці | RAG, омніканальність, всі сценарії |
Що входить в роботу
- Аудит бізнес-процесів та підготовка бази знань.
- Проектування діалогового сценарію (до 50 інтентів).
- Розробка інтеграцій з CRM/ERP/білінгом.
- Розгортання на інфраструктурі (Kubernetes, AWS або self-hosted).
- Навчання моделі на історичних діалогах (fine-tuning LoRA).
- Моніторинг та підтримка 3 місяці.
Терміни та вартість
- MVP: 4–6 тижнів.
- Повнофункціональний бот з інтеграціями: 3–4 місяці.
- Економія на операторах — до 70% витрат, окупність — 6–12 місяців.
Омніканальність: Telegram, WhatsApp, веб-віджет
Бот розгортається одразу на кількох каналах через єдине API. Архітектура передбачає channel-агностичний Dialog Manager: один раз налаштували сценарій — отримали бота в Telegram, WhatsApp Business API та на сайті через веб-віджет. Історичні дані зберігаються в єдиній CRM-прив'язці: якщо клієнт почав діалог у Telegram і продовжив на сайті, оператор бачить повний ланцюжок.
Для омніканального бота використовуємо черги RabbitMQ або Kafka: це забезпечує відмовостійкість при пікових навантаженнях та дозволяє обробляти до 500 одночасних діалогів на одному інстансі. Горизонтальне масштабування досягається додаванням воркерів без зміни архітектури.
Ми на ринку, розробили 40+ чат-ботів для e-commerce, fintech, логістики. Гарантуємо containment rate не нижче 50% після 3 місяців експлуатації. Оцініть ваш проект: надішлемо кейси та запропонуємо архітектуру під ключ. Зв'яжіться з нами для консультації та отримайте детальну оцінку термінів.







