Ручная проверка звонков охватывает лишь 3–5% записей. Типичный контакт-центр с 100 операторами тратит на ручной QA до 10 человеко-часов в день на эту выборку, при этом 70% ошибок остаются незамеченными. AI-система обрабатывает все 100% диалогов за час, выявляя нарушения стандартов в реальном времени. Мы сталкивались с ситуациями, когда операторы игнорировали скрипт, клиенты злились из-за долгого ожидания, а руководители QA не видели полной картины — ручная выборка давала ложное ощущение контроля. Мы внедрили такие решения в 30+ контакт-центрах, сократив затраты на QA в среднем на 60%. Экономия бюджета на QA может превышать 60% для крупных проектов. В основе — NLP-модели, включая GPT-4, LLaMA и собственные fine-tuned модели.
Почему AI-оценка точнее ручной?
Человек оценивает субъективно: усталость, настроение, личная симпатия влияют на баллы. AI оперирует одинаковыми критериями для каждого звонка — никаких «сегодня пятница». Сравнение: ручная проверка — 10–15 звонков в день; AI — 1000+ звонков за час. AI-оценка в 200 раз быстрее ручной, а точность при грамотной настройке достигает 95%, что подтверждено McKinsey Global Institute.
Архитектура QA-системы
from dataclasses import dataclass from typing import Callable @dataclass class QACriterion: id: str name: str weight: float # вес в итоговой оценке evaluator: Callable # функция оценки class CallQAEvaluator: def __init__(self, scorecard: list[QACriterion]): self.scorecard = scorecard async def evaluate_call(self, call_id: str, transcript: dict) -> dict: scores = {} total_weighted = 0 total_weight = sum(c.weight for c in self.scorecard) for criterion in self.scorecard: score = await criterion.evaluator(transcript) scores[criterion.id] = { "name": criterion.name, "score": score, # 0-10 "weight": criterion.weight } total_weighted += score * criterion.weight final_score = total_weighted / total_weight return { "call_id": call_id, "final_score": round(final_score, 1), "grade": self._score_to_grade(final_score), "breakdown": scores, "violations": [c for c in self.scorecard if scores[c.id]["score"] < 5] } Что включает оценка каждого критерия?
Каждый критерий реализуется как асинхронная функция-оценщик. Например, для приветствия используем GPT-4o-mini с системным промптом, который проверяет пять подкритериев и возвращает число от 0 до 10. Такой подход позволяет гибко настраивать логику без переписывания кода.
async def evaluate_greeting(transcript: dict) -> float: """Оценка приветствия (0–10)""" first_agent_text = next( (t["text"] for t in transcript["turns"] if t["speaker"] == "OPERATOR"), "" ) response = await client.chat.completions.create( model="gpt-4o-mini", messages=[{ "role": "system", "content": """Оцени приветствие оператора от 0 до 10. Критерии: - Назвал имя компании (+2) - Назвал своё имя (+2) - Поздоровался уважительно (+2) - Предложил помощь (+2) - Тон доброжелательный (+2) Верни только число.""" }, {"role": "user", "content": first_agent_text}] ) try: return min(10, max(0, float(response.choices[0].message.content.strip()))) except ValueError: return 5.0 async def evaluate_hold_notification(transcript: dict) -> float: """Предупредил ли оператор о постановке на удержание""" hold_keywords = ["подождите", "поставлю на удержание", "одну минуту"] agent_texts = " ".join(t["text"].lower() for t in transcript["turns"] if t["speaker"] == "OPERATOR") return 10.0 if any(kw in agent_texts for kw in hold_keywords) else 0.0 Типовой чек-лист (20 критериев)
| Категория | Критерии | Вес |
|---|---|---|
| Приветствие | Имя, компания, доброжелательность | 15% |
| Идентификация | Верификация клиента | 10% |
| Понимание проблемы | Уточнение, активное слушание | 20% |
| Решение | Компетентность, правильность | 25% |
| Завершение | Резюме, удовлетворённость | 15% |
| Соответствие стандартам | Запреты, compliance | 15% |
Сравнение: ручная проверка vs AI
| Параметр | Ручная проверка | AI-система |
|---|---|---|
| Охват звонков | 3–5% | 100% |
| Скорость оценки | 10–15 звонков/день | 1000+ звонков/час |
| Объективность | Субъективна | Единые критерии |
| Стоимость за звонок | Высокая | В 10–20 раз ниже |
| Анализ тона | Субъективно | Анализ тона, громкости, пауз |
Закажите разработку индивидуального чек-листа под ваш бизнес.
Как калибруется модель оценки?
На старте параллельно оцениваем 500 звонков вручную и AI. Сравниваем результаты, корректируем веса критериев и промпты. Используем метрики: точность, полноту, F1-меру. Процесс калибровки занимает 2–4 недели. Для калибровки мы используем данные реальных диалогов: собираем выборку из 500 звонков, где эксперты уже проставили оценки. Далее запускаем несколько вариантов промптов и выбираем лучший по метрикам. Это позволяет достичь точности 95% уже на второй неделе.
Как внедрить QA-систему за 4–6 недель?
- Аудит текущих стандартов — собираем чек-листы, скрипты, записи.
- Разработка критериев — адаптируем под ваш бизнес (веса, пороги).
- Интеграция с ATC/CRM — подключаемся к вашей телефонии и CRM.
- Запуск и калибровка — первые 2 недели параллельная оценка с человеком, корректировка модели.
Что входит в работу
- Документация: API-спецификация, инструкция по настройке критериев.
- Исходный код: репозиторий с модулями оценщиков.
- Дашборды: Power BI или Grafana с детализацией по операторам, категориям, временным рядам.
- Обучение: 2–3 воркшопа для QA-менеджеров и администраторов.
- Поддержка: 1 месяц пост-релизной поддержки.
Опыт компании
Более 5 лет на рынке AI-решений. 30+ реализованных проектов QA для контакт-центров и ритейла. Команда сертифицирована по NLP и MLOps (TensorFlow, PyTorch). Используем лучшие практики: RAG, fine-tuning, LoRA для дообучения моделей. Наши инженеры владеют стеком PyTorch, Hugging Face, LangChain и умеют дообучать модели под специфику вашего бизнеса.
Сроки и стоимость
Базовый модуль с 10 критериями — 4–6 недель. Полная система с дашбордами — до 3 месяцев. Стоимость рассчитывается индивидуально. Свяжитесь с нами для оценки вашего проекта — это бесплатно.
Пример дашборда: недельный отчёт оператора
- Динамика оценки за месяц (график)
- Топ-3 сильных сторон: приветствие, решение проблемы
- Топ-3 слабых: время ответа, резюме
- Примеры лучшего и худшего звонков (ссылки на аудио)
- Рекомендации: «Проходи тренинг по активному слушанию»
Получите консультацию по внедрению AI-оценки качества — закажите бесплатный аудит ваших процессов. Контролируйте 100% диалогов и экономьте до 60% бюджета на QA.







