Интеграция AI-чат-бота с Jivo, LiveChat и Carrot Quest

Вы запустили live-чат на сайте, клиенты задают одни и те же вопросы, а операторы тонут в рутине. Мы столкнулись с этим в десятках проектов: AI-бот берёт на себя 70-80% первой линии, оставляя сложные задачи людям. Интеграция с Jivo, LiveChat или Carrot Quest — не просто «прикрутить» API, а выстроить

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1006

Вы запустили live-чат на сайте, клиенты задают одни и те же вопросы, а операторы тонут в рутине. Мы столкнулись с этим в десятках проектов: AI-бот берёт на себя 70-80% первой линии, оставляя сложные задачи людям. Интеграция с Jivo, LiveChat или Carrot Quest — не просто «прикрутить» API, а выстроить конвейер: от приёма сообщения до осмысленного ответа с учётом истории и бизнес-правил. У нас за плечами 5 лет AI-интеграций и более 100 реализованных проектов.

Проблемы, которые решаем

Контекст теряется при передаче оператору

Клиент общался с ботом 10 минут — тот знает всю историю. При эскалации оператору бот отправляет краткий саммари, а не сырой лог. Мы реализуем это через LangChain: ConversationSummaryMemory сжимает диалог в 3-4 предложения. Без этой механики оператор тратит время на чтение лога, и NPS падает на 15-20%.

Latency p99 выше 3 секунд

Если модель отвечает дольше 2.5 с, клиент уходит. Решение — квантизация до INT4 и использование vLLM с continuous batching. На тестах с LLaMA 3 70B p99 опустился с 4.2 с до 1.2 с — vLLM обеспечивает в 3 раза меньшую latency по сравнению со стандартным инференсом. Для Carrot Quest мы дополнительно кешируем частые запросы через Redis (TTL 30 минут) — покрывает 40% диалогов без вызова LLM.

Сложные правила эскалации

Нельзя просто передавать всё. У нас система правил: если пользователь трижды спросил «Где мой заказ?» — эскалация сразу, даже при высокой уверенности. Или если sentiment отрицательный (библиотека cardiffnlp/twitter-roberta-base-sentiment), бот отвечает максимально вежливо и предлагает оператора. Итог — оператор получает только 20% клиентов, причём уже с контекстом.

Как мы интегрируем AI-бота с Jivo, LiveChat и CarrotQuest?

Из нашей практики: для одного интернет-магазина мы развернули бота на FastAPI внутри Kubernetes. Стек:

  • Model: OpenAI GPT-4o (temperature 0.3) с системным промптом, описывающим ассортимент
  • Embeddings: text-embedding-3-small (1536-dim) для RAG по каталогу (ChromaDB)
  • Escalation: правила на базе langchain с порогом уверенности 0.7 и стоп-словами
  • Deploy: SageMaker с Triton Inference Server под две модели (LLM + embedding)

Jivo присылает вебхук (см. ниже), FastAPI обрабатывает, вызывает цепочку LangChain. Ответ — JSON с полями event, chat_id, message. Время обработки — 1.8 с в p95.

from fastapi import FastAPI app = FastAPI() @app.post("/jivo-webhook") async def handle_jivo(data: dict): event = data.get("event") if event == "client_message": client_message = data["message"]["text"] chat_id = data["chat_id"] response = await ai_bot.process(client_message) return { "event": "bot_message", "chat_id": chat_id, "message": {"type": "text", "text": response} } return {"event": "ignore"} 

Jivo поддерживает кнопки быстрых ответов, передачу оператору (escalation), статусы «печатает». AI-бот работает до тех пор, пока не сработает условие эскалации.

Carrot Quest API

Carrot Quest — более функциональная платформа с собственным no-code конструктором ботов и Python SDK. Для кастомной логики: Webhook Triggers + API для отправки сообщений.

Особенность Carrot Quest: богатые данные о пользователе — история просмотров, события на сайте. AI-бот может учитывать: «Вы смотрели продукт X несколько раз — хотите задать вопрос?»

Режимы работы AI в live chat

Режим Как работает Когда подходит
Bot-first AI отвечает первым, передаёт оператору при необходимости Высокая нагрузка на поддержку (10+ запросов/день)
Operator-assist Оператор пишет ответ, AI предлагает варианты Сложные консультации, где нужно знание продуктов
After-hours bot AI включён только вне рабочего времени Клиенты в разных часовых поясах, ожидаемость падает

Правило перехода к оператору: explicit request + низкая уверенность AI + отрицательный sentiment + VIP-клиент по тегу в CRM.

Сравнение моделей для live-чата

Модель Качество ответа Latency p99 (средняя) Стоимость за токен
GPT-4o Высокое 1.8 с Средняя
Claude 3.5 Высокое 2.0 с Выше средней
LLaMA 3 70B (INT4) Среднее 1.2 с Низкая
Mistral Large Среднее 1.5 с Низкая

Выбор модели зависит от ваших приоритетов: максимальное качество или конфиденциальность данных. Для конфиденциальных данных используем open-source модели с локальным развёртыванием.

Как AI-бот определяет, когда передать оператору?

Используется система скоринга: модель возвращает уверенность ответа (logprobs). Если ниже 0.7 — эскалация. Дополнительно: стоп-слова («оператор», «живой человек»), негативный sentiment (модель nlptown/bert-base-multilingual-uncased-sentiment), больше двух повторных вопросов от клиента. Всё настраивается под ваши правила.

Какие модели LLM вы используете и почему?

Проприетарные (GPT-4o, Claude 3.5) — для максимального качества. Open-source (LLaMA 3 70B, Mistral Large) — для конфиденциальных данных или снижения стоимости. В production ставим через vLLM с INT4-квантизацией: latency p99 ниже 1.5 с на 70B модели. Если нужен fine-tuning под конкретную доменную область — используем LoRA на 2-3 эпохах. На практике GPT-4o справляется с 90% запросов без эскалации, в то время как LLaMA 3 — только с 75%.

Как работает RAG в нашем боте?

RAG (Retrieval-Augmented Generation) — это механизм, который дополняет ответ модели фактами из вашей базы знаний. Мы используем ChromDB для векторного поиска: все документы (FAQ, статьи, каталог) разбиваются на чанки, каждый чанк превращается в embedding (вектор) размерностью 1536 через text-embedding-3-small. Входящий запрос тоже векторизуется, ищутся ближайшие чанки (top-k=5), и они подставляются в промпт вместе с вопросом. Это даёт актуальные ответы без переобучения модели.

Процесс работы

  1. Аналитика и архитектура — разбираем вашу базу знаний, настраиваем RAG, проектируем цепочки LangChain.
  2. Разработка — пишем код интеграции, настраиваем модели (fine-tuning или LoRA, если надо), тестируем на исторических диалогах.
  3. Тестирование — A/B тест AI против операторов (метрики: разрешённые диалоги, CSAT, среднее время).
  4. Деплой — на ваш сервер или наш облачный кластер, настройка CI/CD pipeline через GitHub Actions.
  5. Обучение — инструкция для операторов, как перехватывать чат и как AI меняет стандартные ответы.

Сроки ориентировочно

Базовая интеграция (один канал, одна модель) — от 2 недель. Если нужен RAG по каталогу, две модели, несколько каналов — до 4 недель. Стоимость рассчитывается индивидуально, исходя из сложности и объёма данных. Мы даём гарантию на код (30 дней бесплатной поддержки) и сертификат на используемые решения, а также гарантируем SLA (время ответа p99 < 2 с, доступность 99.9%).

Что входит в работу

  • Архитектурная схема решения (PDF)
  • Исходный код бота с комментариями
  • Инструкция по развёртыванию (Docker Compose, Kubernetes)
  • Дашборд метрик (Grafana + Prometheus) — обработано/эскалировано/среднее время
  • 30 дней поддержки после запуска

Хотите автоматизировать поддержку? Свяжитесь с нами — получите консультацию и примерную оценку вашего проекта. Закажите пилот на одном канале за 2 недели.