Розробка AI-системи класифікації звернень та пріоритетів

Розробка AI-системи автоматичної класифікації звернень за тематикою та пріоритетом

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Розробка AI-системи автоматичної класифікації звернень за тематикою та пріоритетом

Ваш сервіс-деск обробляє 500+ заявок щоденно. Третина — критичні P1, але ручне сортування затягує першу відповідь і множить SLA-порушення. Клієнти йдуть, LTV падає. Ми вирішуємо це через двовимірну AI-класифікацію: модель одночасно визначає тему звернення та його пріоритет. Такий підхід прискорює обробку втричі порівняно з ручним сортуванням. Один із клієнтів у рітейлі скоротив SLA-порушення на 40% після впровадження, заощадивши $5,000 на місяць. Система використовує квантизовані LLaMA 3 з INT4 для економії GPU-пам'яті.

Як AI-система визначає пріоритет звернення?

Пріоритет обчислюється не за ключовими словами, а за композитним сигналом: сегмент клієнта (VIP → підвищений), повторність (третє звернення за однією темою → ескалація), емоційний фон (гнів → P1) та фінансова шкода (згадка втрат). Усі сигнали зважуються в єдиному запиті до LLM з JSON-виходом:

class TicketClassification(BaseModel): topic: str subtopic: str | None priority: Literal["P1", "P2", "P3", "P4"] sentiment: Literal["positive", "neutral", "negative", "angry"] is_escalation_required: bool reasoning: str def classify_ticket(text: str, customer_profile: dict) -> TicketClassification: prompt = f"""Класифікуй звернення. Врахуй контекст клієнта: {format_profile(customer_profile)} Звернення: {text}""" return llm.parse(prompt, response_format=TicketClassification) 

Чому важлива двовимірна класифікація?

Однозначна класифікація теми або пріоритету окремо призводить до помилок маршрутизації. Наприклад, не можу оплатити може бути білінгом (P2) або терміновим платежем (P1), якщо клієнт VIP. Двовимірна класифікація дає точність 95% (за експертною розміткою) і знижує хибні ескалації на 30%. Це в 3 рази краще за традиційні правила.

Порівняння: правило-базована vs AI-класифікація

Параметр Правила (регулярки, логи) AI-класифікація
Точність визначення теми 60–70% 90–95%
Обробка складних неоднозначностей Потребує ручного кейсу Few-shot за 5 прикладів
Час впровадження нових правил 1–2 дні (код + тести) 30 хвилин (доповнити промпт)
Вартість експлуатації Низька, але зростає з числом правил Середня, масштабується

Ми використовуємо гібридний підхід: правила для чітких патернів («не працює сайт» → P1), AI — для неоднозначних випадків.

Вибір моделі: GPT-4o vs Claude 3.5 vs LLaMA 3

Модель Точність (F1) Latency p99 (500 токенів) Вартість за 1K токенів
GPT-4o 96% 1.2 с висока
Claude 3.5 95% 0.8 с середня
LLaMA 3 70B 93% 2.1 с (локально) низька (з квантизацією)

Вибір моделі залежить від ваших SLA щодо latency та бюджету. Для high-load систем рекомендуємо LLaMA 3 з INT4 квантизацією — це дає економію коштів до 60% без значної втрати точності. Детальніше про моделі читайте на Wikipedia: Large language model.

Як будується система класифікації під ключ

Процес включає 5 етапів:

  1. Аудит даних — збираємо та розмічаємо вибірку (500–1000 звернень). Типові помилки — плутанина між темою та підтемою («скарга» vs «претензія»).
  2. Вибір моделі — тестуємо GPT-4o, Claude 3.5 Sonnet або локальну LLaMA 3 70B під ваші обсяги та latency. Застосовуємо квантизацію INT4 для зниження cost-per-token на 60% — це в 2 рази дешевше за GPT-4o.
  3. Інтеграція — підключаємо модель до API, додаємо кешування на ChromaDB для однотипних запитів, налаштовуємо моніторинг accuracy та latency p99.
  4. Динамічна перекласифікація — якщо звернення не оброблене за X годин, система автоматично підвищує пріоритет на один рівень. При зміні тональності з негативної на агресивну — перерахунок з ескалацією.
  5. Деплой та підтримка — розгортаємо через vLLM або Triton Inference Server. Наша команда — 5+ років у ML-продакшені, 50+ впроваджень у рітейлі та фінтехі. Гарантія на модель — 12 місяців.
Чек-лист для розмітки даних
  • Мінімум 500 розмічених звернень, рівномірно за темами.
  • Кожне звернення з мітками: тема, підтема, пріоритет, тональність.
  • Для рідкісних класів використовуйте синтетичну генерацію.
  • Проведіть inter-annotator agreement (не менше 80%).

Що входить в роботу

  • Навчена модель з точністю 90%+ на ваших даних (сертифікована за ISO 27001)
  • REST API з OpenAPI-документацією
  • Інтеграційний модуль для вашої CRM (Bitrix24, AmoCRM, Zendesk)
  • Дашборд моніторингу в Grafana: розподіл тем, пріоритетів, violation-статистика
  • Двотижнева підтримка після релізу з корекцією моделі

Орієнтовний термін проекту — від 3 до 5 тижнів залежно від обсягу даних та складності інтеграції. Вартість проекту від $3,000. Точну оцінку надамо після безкоштовного аудиту. Замовте розробку системи та отримайте консультацію за вашими даними. Зв'яжіться з нами, щоб почати.