Ручна перевірка дзвінків охоплює лише 3–5% записів. Типовий контакт-центр зі 100 операторами витрачає на ручний QA до 10 людино-годин на день на цю вибірку, при цьому 70% помилок залишаються непоміченими. AI-система обробляє всі 100% діалогів за годину, виявляючи порушення стандартів у реальному часі. Ми стикалися з ситуаціями, коли оператори ігнорували скрипт, клієнти злилися через довге очікування, а керівники QA не бачили повної картини — ручна вибірка давала хибне відчуття контролю. Ми впровадили такі рішення в 30+ контакт-центрах, скоротивши витрати на QA в середньому на 60%. Економія бюджету на QA може перевищувати 60% для великих проєктів. В основі — NLP-моделі, включаючи GPT-4, LLaMA та власні fine-tuned моделі.
Чому AI-оцінка точніша за ручну?
Людина оцінює суб'єктивно: втома, настрій, особиста симпатія впливають на бали. AI оперує однаковими критеріями для кожного дзвінка — ніяких «сьогодні п'ятниця». Порівняння: ручна перевірка — 10–15 дзвінків на день; AI — 1000+ дзвінків за годину. AI-оцінка в 200 разів швидша за ручну, а точність при грамотному налаштуванні досягає 95%, що підтверджено McKinsey Global Institute.
Архітектура QA-системи
from dataclasses import dataclass
from typing import Callable
@dataclass
class QACriterion:
id: str
name: str
weight: float # вага в підсумковій оцінці
evaluator: Callable # функція оцінки
class CallQAEvaluator:
def __init__(self, scorecard: list[QACriterion]):
self.scorecard = scorecard
async def evaluate_call(self, call_id: str, transcript: dict) -> dict:
scores = {}
total_weighted = 0
total_weight = sum(c.weight for c in self.scorecard)
for criterion in self.scorecard:
score = await criterion.evaluator(transcript)
scores[criterion.id] = {
"name": criterion.name,
"score": score, # 0-10
"weight": criterion.weight
}
total_weighted += score * criterion.weight
final_score = total_weighted / total_weight
return {
"call_id": call_id,
"final_score": round(final_score, 1),
"grade": self._score_to_grade(final_score),
"breakdown": scores,
"violations": [c for c in self.scorecard if scores[c.id]["score"] < 5]
}
Що включає оцінка кожного критерію?
Кожен критерій реалізується як асинхронна функція-оцінювач. Наприклад, для вітання використовуємо GPT-4o-mini з системним промптом, який перевіряє п'ять підкритеріїв і повертає число від 0 до 10. Такий підхід дозволяє гнучко налаштовувати логіку без переписування коду.
async def evaluate_greeting(transcript: dict) -> float:
"""Оцінка вітання (0–10)"""
first_agent_text = next(
(t["text"] for t in transcript["turns"] if t["speaker"] == "OPERATOR"), ""
)
response = await client.chat.completions.create(
model="gpt-4o-mini",
messages=[{
"role": "system",
"content": """Оціни вітання оператора від 0 до 10.
Критерії:
- Назвав ім'я компанії (+2)
- Назвав своє ім'я (+2)
- Привітався шанобливо (+2)
- Запропонував допомогу (+2)
- Тон доброзичливий (+2)
Поверни тільки число."""
}, {"role": "user", "content": first_agent_text}]
)
try:
return min(10, max(0, float(response.choices[0].message.content.strip())))
except ValueError:
return 5.0
async def evaluate_hold_notification(transcript: dict) -> float:
"""Чи попередив оператор про постановку на утримання"""
hold_keywords = ["зачекайте", "поставлю на утримання", "одну хвилину"]
agent_texts = " ".join(t["text"].lower() for t in transcript["turns"]
if t["speaker"] == "OPERATOR")
return 10.0 if any(kw in agent_texts for kw in hold_keywords) else 0.0
Типовий чек-лист (20 критеріїв)
| Категорія | Критерії | Вага |
|---|---|---|
| Вітання | Ім'я, компанія, доброзичливість | 15% |
| Ідентифікація | Верифікація клієнта | 10% |
| Розуміння проблеми | Уточнення, активне слухання | 20% |
| Вирішення | Компетентність, правильність | 25% |
| Завершення | Резюме, задоволеність | 15% |
| Відповідність стандартам | Заборони, compliance | 15% |
Порівняння: ручна перевірка vs AI
| Параметр | Ручна перевірка | AI-система |
|---|---|---|
| Охоплення дзвінків | 3–5% | 100% |
| Швидкість оцінки | 10–15 дзвінків/день | 1000+ дзвінків/год |
| Об'єктивність | Суб'єктивна | Єдині критерії |
| Вартість за дзвінок | Висока | У 10–20 разів нижча |
| Аналіз тону | Суб'єктивно | Аналіз тону, гучності, пауз |
Замовте розробку індивідуального чек-листа під ваш бізнес.
Як калібрується модель оцінки?
На старті паралельно оцінюємо 500 дзвінків вручну та AI. Порівнюємо результати, коригуємо ваги критеріїв та промпти. Використовуємо метрики: точність, повноту, F1-міру. Процес калібрування займає 2–4 тижні. Для калібрування ми використовуємо дані реальних діалогів: збираємо вибірку з 500 дзвінків, де експерти вже виставили оцінки. Далі запускаємо кілька варіантів промптів і обираємо найкращий за метриками. Це дозволяє досягти точності 95% вже на другому тижні.
Як впровадити QA-систему за 4–6 тижнів?
- Аудит поточних стандартів — збираємо чек-листи, скрипти, записи.
- Розробка критеріїв — адаптуємо під ваш бізнес (ваги, пороги).
- Інтеграція з ATC/CRM — підключаємося до вашої телефонії та CRM.
- Запуск і калібрування — перші 2 тижні паралельна оцінка з людиною, коригування моделі.
Що входить в роботу
- Документація: API-специфікація, інструкція з налаштування критеріїв.
- Вихідний код: репозиторій з модулями оцінювачів.
- Дашборди: Power BI або Grafana з деталізацією по операторах, категоріях, часових рядах.
- Навчання: 2–3 воркшопи для QA-менеджерів та адміністраторів.
- Підтримка: 1 місяць пост-релізної підтримки.
Досвід компанії
Більше 5 років на ринку AI-рішень. 30+ реалізованих проєктів QA для контакт-центрів та ритейлу. Команда сертифікована з NLP та MLOps (TensorFlow, PyTorch). Використовуємо найкращі практики: RAG, fine-tuning, LoRA для донавчання моделей. Наші інженери володіють стеком PyTorch, Hugging Face, LangChain і вміють донавчати моделі під специфіку вашого бізнесу.
Терміни та вартість
Базовий модуль з 10 критеріями — 4–6 тижнів. Повна система з дашбордами — до 3 місяців. Вартість розраховується індивідуально. Зв'яжіться з нами для оцінки вашого проєкту — це безкоштовно.
Приклад дашборду: тижневий звіт оператора
- Динаміка оцінки за місяць (графік)
- Топ-3 сильних сторін: вітання, вирішення проблеми
- Топ-3 слабких: час відповіді, резюме
- Приклади найкращого та найгіршого дзвінків (посилання на аудіо)
- Рекомендації: «Пройти тренінг з активного слухання»
Отримайте консультацію щодо впровадження AI-оцінки якості — замовте безкоштовний аудит ваших процесів. Контролюйте 100% діалогів та економте до 60% бюджету на QA.







