Вы запустили live-чат на сайте, клиенты задают одни и те же вопросы, а операторы тонут в рутине. Мы столкнулись с этим в десятках проектов: AI-бот берёт на себя 70-80% первой линии, оставляя сложные задачи людям. Интеграция с Jivo, LiveChat или Carrot Quest — не просто «прикрутить» API, а выстроить конвейер: от приёма сообщения до осмысленного ответа с учётом истории и бизнес-правил. У нас за плечами 5 лет AI-интеграций и более 100 реализованных проектов.
Проблемы, которые решаем
Контекст теряется при передаче оператору
Клиент общался с ботом 10 минут — тот знает всю историю. При эскалации оператору бот отправляет краткий саммари, а не сырой лог. Мы реализуем это через LangChain: ConversationSummaryMemory сжимает диалог в 3-4 предложения. Без этой механики оператор тратит время на чтение лога, и NPS падает на 15-20%.
Latency p99 выше 3 секунд
Если модель отвечает дольше 2.5 с, клиент уходит. Решение — квантизация до INT4 и использование vLLM с continuous batching. На тестах с LLaMA 3 70B p99 опустился с 4.2 с до 1.2 с — vLLM обеспечивает в 3 раза меньшую latency по сравнению со стандартным инференсом. Для Carrot Quest мы дополнительно кешируем частые запросы через Redis (TTL 30 минут) — покрывает 40% диалогов без вызова LLM.
Сложные правила эскалации
Нельзя просто передавать всё. У нас система правил: если пользователь трижды спросил «Где мой заказ?» — эскалация сразу, даже при высокой уверенности. Или если sentiment отрицательный (библиотека cardiffnlp/twitter-roberta-base-sentiment), бот отвечает максимально вежливо и предлагает оператора. Итог — оператор получает только 20% клиентов, причём уже с контекстом.
Как мы интегрируем AI-бота с Jivo, LiveChat и CarrotQuest?
Из нашей практики: для одного интернет-магазина мы развернули бота на FastAPI внутри Kubernetes. Стек:
- Model: OpenAI GPT-4o (temperature 0.3) с системным промптом, описывающим ассортимент
- Embeddings:
text-embedding-3-small(1536-dim) для RAG по каталогу (ChromaDB) - Escalation: правила на базе
langchainс порогом уверенности 0.7 и стоп-словами - Deploy: SageMaker с Triton Inference Server под две модели (LLM + embedding)
Jivo присылает вебхук (см. ниже), FastAPI обрабатывает, вызывает цепочку LangChain. Ответ — JSON с полями event, chat_id, message. Время обработки — 1.8 с в p95.
from fastapi import FastAPI
app = FastAPI()
@app.post("/jivo-webhook")
async def handle_jivo(data: dict):
event = data.get("event")
if event == "client_message":
client_message = data["message"]["text"]
chat_id = data["chat_id"]
response = await ai_bot.process(client_message)
return {
"event": "bot_message",
"chat_id": chat_id,
"message": {"type": "text", "text": response}
}
return {"event": "ignore"}
Jivo поддерживает кнопки быстрых ответов, передачу оператору (escalation), статусы «печатает». AI-бот работает до тех пор, пока не сработает условие эскалации.
Carrot Quest API
Carrot Quest — более функциональная платформа с собственным no-code конструктором ботов и Python SDK. Для кастомной логики: Webhook Triggers + API для отправки сообщений.
Особенность Carrot Quest: богатые данные о пользователе — история просмотров, события на сайте. AI-бот может учитывать: «Вы смотрели продукт X несколько раз — хотите задать вопрос?»
Режимы работы AI в live chat
| Режим | Как работает | Когда подходит |
|---|---|---|
| Bot-first | AI отвечает первым, передаёт оператору при необходимости | Высокая нагрузка на поддержку (10+ запросов/день) |
| Operator-assist | Оператор пишет ответ, AI предлагает варианты | Сложные консультации, где нужно знание продуктов |
| After-hours bot | AI включён только вне рабочего времени | Клиенты в разных часовых поясах, ожидаемость падает |
Правило перехода к оператору: explicit request + низкая уверенность AI + отрицательный sentiment + VIP-клиент по тегу в CRM.
Сравнение моделей для live-чата
| Модель | Качество ответа | Latency p99 (средняя) | Стоимость за токен |
|---|---|---|---|
| GPT-4o | Высокое | 1.8 с | Средняя |
| Claude 3.5 | Высокое | 2.0 с | Выше средней |
| LLaMA 3 70B (INT4) | Среднее | 1.2 с | Низкая |
| Mistral Large | Среднее | 1.5 с | Низкая |
Выбор модели зависит от ваших приоритетов: максимальное качество или конфиденциальность данных. Для конфиденциальных данных используем open-source модели с локальным развёртыванием.
Как AI-бот определяет, когда передать оператору?
Используется система скоринга: модель возвращает уверенность ответа (logprobs). Если ниже 0.7 — эскалация. Дополнительно: стоп-слова («оператор», «живой человек»), негативный sentiment (модель nlptown/bert-base-multilingual-uncased-sentiment), больше двух повторных вопросов от клиента. Всё настраивается под ваши правила.
Какие модели LLM вы используете и почему?
Проприетарные (GPT-4o, Claude 3.5) — для максимального качества. Open-source (LLaMA 3 70B, Mistral Large) — для конфиденциальных данных или снижения стоимости. В production ставим через vLLM с INT4-квантизацией: latency p99 ниже 1.5 с на 70B модели. Если нужен fine-tuning под конкретную доменную область — используем LoRA на 2-3 эпохах. На практике GPT-4o справляется с 90% запросов без эскалации, в то время как LLaMA 3 — только с 75%.
Как работает RAG в нашем боте?
RAG (Retrieval-Augmented Generation) — это механизм, который дополняет ответ модели фактами из вашей базы знаний. Мы используем ChromDB для векторного поиска: все документы (FAQ, статьи, каталог) разбиваются на чанки, каждый чанк превращается в embedding (вектор) размерностью 1536 через text-embedding-3-small. Входящий запрос тоже векторизуется, ищутся ближайшие чанки (top-k=5), и они подставляются в промпт вместе с вопросом. Это даёт актуальные ответы без переобучения модели.
Процесс работы
- Аналитика и архитектура — разбираем вашу базу знаний, настраиваем RAG, проектируем цепочки LangChain.
- Разработка — пишем код интеграции, настраиваем модели (fine-tuning или LoRA, если надо), тестируем на исторических диалогах.
- Тестирование — A/B тест AI против операторов (метрики: разрешённые диалоги, CSAT, среднее время).
- Деплой — на ваш сервер или наш облачный кластер, настройка CI/CD pipeline через GitHub Actions.
- Обучение — инструкция для операторов, как перехватывать чат и как AI меняет стандартные ответы.
Сроки ориентировочно
Базовая интеграция (один канал, одна модель) — от 2 недель. Если нужен RAG по каталогу, две модели, несколько каналов — до 4 недель. Стоимость рассчитывается индивидуально, исходя из сложности и объёма данных. Мы даём гарантию на код (30 дней бесплатной поддержки) и сертификат на используемые решения, а также гарантируем SLA (время ответа p99 < 2 с, доступность 99.9%).
Что входит в работу
- Архитектурная схема решения (PDF)
- Исходный код бота с комментариями
- Инструкция по развёртыванию (Docker Compose, Kubernetes)
- Дашборд метрик (Grafana + Prometheus) — обработано/эскалировано/среднее время
- 30 дней поддержки после запуска
Хотите автоматизировать поддержку? Свяжитесь с нами — получите консультацию и примерную оценку вашего проекта. Закажите пилот на одном канале за 2 недели.







