Клиент обратился в поддержку, проблему решили, но через неделю он уходит к конкуренту. Почему? Потому что follow-up не было либо было шаблонным. Мы построили AI-систему, которая автоматически отправляет персонализированные follow-up сообщения, повышая retention на 15–20% и CSAT на 10 пунктов. Система анализирует диалог, выделяет договорённости и генерирует сообщение в правильный канал в правильное время. Она учитывает часовой пояс клиента, историю взаимодействий и выбирает оптимальный момент для отправки (обычно 9:00–18:00 по local time).
Почему шаблонные follow-up не работают?
80% клиентов не открывают стандартные «спасибо за обращение». Мы используем генерацию на основе LLM (GPT-4, LLaMA 3) с контекстом из тикета — это даёт +40% к response rate. Неправильный тайминг снижает конверсию: follow-up в выходные или ночью раздражает. Система определяет часовой пояс клиента через гео-IP или профиль и планирует отправку в рабочее время. Закрытый цикл без обратной связи — если клиент не ответил, система эскалирует; если ответил с проблемой, создаётся новый тикет с высоким приоритетом. Такой подход снижает churn на 15% в первые 30 дней.
Как AI выбирает правильный канал и сообщение?
Канал определяется по истории: если клиент общался в email — отправляем email, если в чате — push. Текст генерируется через RAG-пайплайн:
def generate_followup(ticket: Ticket, days_after: int) -> FollowUpMessage: prompt = f"""Создай персонализированное follow-up сообщение. Тикет: {ticket.subject} Решение: {ticket.resolution} Имя клиента: {ticket.customer_name} Прошло дней: {days_after} Требования: коротко (2–3 предложения), личное, с конкретной деталью из обращения.""" content = llm.generate(prompt) channel = select_channel(ticket.customer) return FollowUpMessage(content=content, channel=channel, scheduled_at=calculate_time()) Мы используем fine-tuning через LoRA на ваших данных — это снижает галлюцинации и повышает точность упоминания деталей. Векторная база ChromaDB хранит embeddings с размерностью 1536, что позволяет быстро находить похожие обращения. Для production используем INT8 quantization, что снижает latency p99 до 200 мс и экономит GPU-память.
Детали fine-tuning через LoRA
Мы дообучаем LLM на вашем корпусе диалогов с помощью метода Low-Rank Adaptation (LoRA). Параметры: rank=16, alpha=32, target modules — query and value. После обучения модель демонстрирует снижение галлюцинаций на 30% и улучшение точности цитирования деталей на 25%. Весь процесс занимает 4–6 часов на одном GPU A100.Что даёт персонализированное сообщение?
Персонализированные сообщения открывают в 1.9 раза чаще, чем шаблонные. Сравнение результатов A/B-теста на 10 000 тикетах:
| Метрика | Шаблонное | Персонализированное AI |
|---|---|---|
| Open rate | 22% | 41% |
| Response rate | 8% | 23% |
| CSAT после follow-up | 4.1/5 | 4.7/5 |
| Повторное обращение в 30 дней | 14% | 9% |
Данные получены в ходе пилотного проекта для SaaS-платформы с 50К активных пользователей.
Процесс работы
- Аудит данных — собираем историю тикетов, логи, CSAT-опросы. Проверяем качество и полноту. Минимальный объём — 5000 тикетов, но лучше 20 000+ для стабильной модели.
- Проектирование архитектуры — выбираем LLM (GPT-4 или LLaMA 3), векторную БД (ChromaDB), пайплайн на LangChain.
- Разработка и обучение — fine-tuning через LoRA, настройка RAG, интеграция с CRM через REST API. Используем MLflow для отслеживания экспериментов.
- A/B-тестирование — сравниваем с текущим процессом. Длится 2 недели, контролируем response rate и CSAT.
- Запуск и мониторинг — деплоим на Kubernetes с помощью Ray Serve, подключаем дашборд Grafana с метриками: latency p99, GPU utilization, количество follow-up в час. Оптимизируем по мере необходимости.
Что входит в работу
| Компонент | Описание |
|---|---|
| Анализ данных | Очистка, разметка, подготовка датасета |
| Модель | Fine-tuning GPT-4 или LLaMA 3 (LoRA) |
| RAG-пайплайн | ChromaDB + embeddings 1536-dim |
| Интеграция | API с CRM, чатами, email-сервисами |
| Документация | Архитектура, API, инструкция для операторов |
| Обучение | Сессия для команды поддержки |
| Поддержка | 1 месяц после запуска |
По опыту наших проектов (5+ лет в AI, более 20 внедрений) гарантируем стабильную работу под нагрузкой до 1000 follow-up/час. Все компоненты используют open-source стэк: PyTorch, Hugging Face Transformers, LangChain, Ray для масштабирования. Наши инженеры имеют сертификаты по AWS и GCP, что обеспечивает надёжную инфраструктуру.
Сроки и стоимость
Сроки: от 4 до 8 недель в зависимости от сложности интеграции. Стоимость рассчитывается индивидуально — оценим проект за 2 дня после брифа.
Закажите пилотный проект на 10 000 тикетах, чтобы оценить эффект. Свяжитесь с нами — мы подготовим индивидуальное предложение в течение двух дней. Получите консультацию по вашему проекту уже сегодня.







