Оператор тратит до 30% времени на поиск ответов во время звонка. Клиент ждёт, растёт AHT, падает FCR. При ручном поиске сотрудник переключается между системами, тратит 15–30 секунд на запрос, клиент слышит паузу и теряет терпение. AI-система подсказок решает эту проблему: она слушает разговор, определяет намерение клиента и выводит релевантную информацию за доли секунды. Результат – звонки становятся короче, клиенты довольнее, а операторы работают увереннее.
Мы разрабатываем Agent Assist — AI-систему, которая слушает разговор и мгновенно выдаёт рекомендации: готовые ответы, следующий шаг по скрипту, предупреждение о негативной тональности. Результат: снижение AHT на 15–25%, рост FCR на 8–12%, повышение NPS.
Как работает AI-помощник в реальном времени?
Аудиопоток с микрофона захватывается, преобразуется в текст (STT) за 100–300 мс. Далее NLU-пайплайн определяет намерение клиента, извлекает сущности и обращается к векторной базе знаний. Сформированные подсказки отображаются в UI оператора. Всё — в реальном времени с задержкой менее 500 мс.
Call Audio → STT (Streaming) → NLU Pipeline → Suggestions Engine → Operator UI
↓ ↓ ↓
Live Transcript Intent/Entities Knowledge Base
(100–300ms) CRM Context
Script State
Согласно документации, streaming speech recognition обеспечивает задержку менее 300 мс Google Cloud STT.
Почему Agent Assist повышает NPS?
Клиент получает быстрые и точные ответы — без переключений и музыкальных пауз. Оператор чувствует поддержку AI и реже ошибается. Наши пилоты показали: AI-ассистент лучше ручного поиска в 5 раз по скорости реакции и на 12% снижает повторные обращения. Это напрямую влияет на лояльность.
Real-time NLU pipeline
Мы используем streaming ASR (Google Speech-to-Text или Whisper) и кастомный модуль детекции вопросов и сентимента. LLM (GPT-4o или LLaMA 3) подключается для сложных сценариев. Пример реализации на Python:
import asyncio
from dataclasses import dataclass
@dataclass
class AssistSuggestion:
type: str # answer | next_step | warning | document | offer
content: str
confidence: float
source: str = None # knowledge base URL, CRM field, etc.
class AgentAssistProcessor:
def __init__(self):
self.kb = KnowledgeBase()
self.crm = CRMConnector()
self.llm = AsyncOpenAI()
async def process_utterance(
self,
speaker: str, # "customer" | "agent"
text: str,
session: dict
) -> list[AssistSuggestion]:
suggestions = []
if speaker == "customer":
# Клиент задал вопрос — ищем ответ
if "?" in text or await self.is_question(text):
kb_results = await self.kb.search(text, top_k=3)
if kb_results:
suggestions.append(AssistSuggestion(
type="answer",
content=kb_results[0]["answer"],
confidence=kb_results[0]["score"],
source=kb_results[0]["url"]
))
# Детектируем жалобу
sentiment = await self.analyze_sentiment(text)
if sentiment["label"] == "negative" and sentiment["score"] > 0.8:
suggestions.append(AssistSuggestion(
type="warning",
content="Клиент выражает недовольство. Рекомендуется эмпатийная реакция.",
confidence=sentiment["score"]
))
# Следующий шаг по скрипту
next_step = await self.get_next_script_step(session)
if next_step:
suggestions.append(AssistSuggestion(
type="next_step",
content=next_step,
confidence=1.0
))
return suggestions
База знаний с семантическим поиском
Векторная база строится на embeddings модели intfloat/multilingual-e5-large. Поиск по Faiss возвращает топ-3 статьи с порогом 0.7. Код:
from sentence_transformers import SentenceTransformer
import faiss
import numpy as np
class KnowledgeBase:
def __init__(self):
self.encoder = SentenceTransformer("intfloat/multilingual-e5-large")
self.index = faiss.IndexFlatIP(1024)
self.articles = []
def add_article(self, question: str, answer: str, url: str = None):
embedding = self.encoder.encode(
f"query: {question}", normalize_embeddings=True
)
self.index.add(embedding.reshape(1, -1))
self.articles.append({"question": question, "answer": answer, "url": url})
async def search(self, query: str, top_k: int = 3) -> list[dict]:
embedding = self.encoder.encode(
f"query: {query}", normalize_embeddings=True
)
scores, indices = self.index.search(embedding.reshape(1, -1), top_k)
results = []
for score, idx in zip(scores[0], indices[0]):
if score > 0.7 and idx >= 0:
results.append({**self.articles[idx], "score": float(score)})
return results
UI для оператора (React)
Подсказки передаются по WebSocket и рендерятся как карточки.
const AgentAssistPanel: React.FC<{sessionId: string}> = ({sessionId}) => {
const [suggestions, setSuggestions] = useState<Suggestion[]>([]);
useEffect(() => {
const ws = new WebSocket(`wss://assist.api/session/${sessionId}`);
ws.onmessage = (e) => setSuggestions(JSON.parse(e.data));
return () => ws.close();
}, [sessionId]);
return (
<aside className="agent-assist-panel">
<h3>Подсказки AI</h3>
{suggestions.map(s => <SuggestionCard key={s.id} suggestion={s} />)}
</aside>
);
};
Сравнение: традиционный поиск vs Agent Assist
| Критерий | Ручной поиск по базе | Agent Assist |
|---|---|---|
| Время поиска | 15–30 с | 300–500 мс |
| Точность ответа | 70% (зависит от оператора) | 90%+ (семантический поиск) |
| Нагрузка на оператора | Высокая | Низкая |
| Влияние на AHT | +20% | −15–25% |
AI-ассистент лучше ручного поиска в 5 раз по скорости и даёт прирост FCR на 8–12%.
Типичные метрики до/после внедрения:
| Метрика | До внедрения | После внедрения |
|---|---|---|
| AHT | 6 мин | 4.5 мин |
| FCR | 70% | 82% |
| CSAT | 3.8 | 4.5 |
Эти цифры — средние по нашим проектам. Ваши результаты могут отличаться в зависимости от текущих процессов.
Технические детали пайплайна
- STT: Google Cloud Speech-to-Text (streaming) или Whisper (локально).
- NLU: кастомный классификатор на базе BERT + LLM для сложных сценариев.
- Векторная БД: Faiss (FlatIP) или Qdrant для масштабирования.
- UI: React + WebSocket; latency p99 < 500 мс.
- A/B-тесты: встроенный механизм для сравнения версий.
Что входит в работу
Мы предоставляем Agent Assist под ключ. В объём входят:
- аудит текущих процессов колл-центра;
- разработка и обучение NLU-моделей (под ваш скрипт);
- интеграция с CRM и базой знаний;
- UI-панель для оператора;
- нагрузочное тестирование (p99 latency < 500 мс);
- A/B-тестирование (2 недели);
- документация и обучение команды;
- техническая поддержка на 1 месяц после внедрения.
Получите консультацию инженера по AI, чтобы оценить эффект для вашего колл-центра.
Этапы внедрения
- Аналитика (1–2 недели): сбор логов, замер метрик, подготовка скриптов.
- Проектирование (1 неделя): архитектура, выбор стека (LLM, векторная БД, STT).
- Разработка (3–4 недели): кастомный NLU, интеграция с KB и CRM, UI.
- Тестирование и A/B (2–3 недели): нагрузка, UAT, замер AHT/FCR.
- Деплой и обучение (1 неделя): развёртывание, обучение операторов, передача документации.
Ориентировочные сроки: базовая версия — 6–8 недель. С полной CRM-интеграцией и A/B‑тестами — до 4 месяцев. Стоимость рассчитывается индивидуально, зависит от объёма сущностей, количества скриптов и требований к латентности.
У нас за плечами 5+ лет опыта в AI/ML для колл-центров и более 30 внедрённых проектов. Гарантируем качество — каждое решение проходит ревью и нагрузочное тестирование. Закажите внедрение Agent Assist и получите консультацию — свяжитесь с нами.







