Детекція стресу та агресії в голосі: AI-модель

Класичні аналізатори кол-центру покладаються на стоп-слова та тональність — це не рятує, коли клієнт уже на взводі. Ми розробляємо AI-системи, які детектують стрес і агресію за акустикою голосу за 2–3 секунди, до того як людина вимовить загрозу або кине трубку. За більш ніж 5 років ми реалізували 15

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    998
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1267
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1006

Класичні аналізатори кол-центру покладаються на стоп-слова та тональність — це не рятує, коли клієнт уже на взводі. Ми розробляємо AI-системи, які детектують стрес і агресію за акустикою голосу за 2–3 секунди, до того як людина вимовить загрозу або кине трубку. За більш ніж 5 років ми реалізували 15+ проєктів для рітейлу, банків та логістики під ключ — від збору датасету до інтеграції через API. Економія на ескалаціях конфліктів сягає 15–20% бюджету на підтримку.

Чому це важливо? Кожен пропущений агресивний дзвінок може обернутися втратою клієнта та репутаційними ризиками. За статистикою, 30% ескалацій у кол-центрах відбуваються через несвоєчасну реакцію на емоційний накал. Наша модель дозволяє перехоплювати такі моменти на ранній стадії, даючи оператору або супервізору підказку за долі секунди.

Проблеми, які вирішуємо

  • Запізнення реакції оператора. Людина витрачає 5–10 секунд, щоб усвідомити агресивний тон. Система видає алерт миттєво, дозволяючи підключити супервізора.
  • Суб'єктивна оцінка. Різні оператори по-різному трактують емоції. Наша модель дає об'єктивний score (0–1) за кожним класом.
  • Високе навантаження при ручному моніторингу. Прослуховувати всі дзвінки неможливо. AI-модель сканує 100% записів у реальному часі або в batch-режимі.

Акустичні маркери стресу та агресії

import librosa import numpy as np from dataclasses import dataclass @dataclass class EmotionalAcoustics: f0_mean: float # середня частота (агресія: зростання >20%) f0_range: float # діапазон тону (стрес: звуження) f0_std: float # варіабельність speaking_rate: float # темп (стрес: прискорення або сповільнення) energy_mean: float # гучність (агресія: значне зростання) jitter: float # тремор голосу (стрес: зростання) shimmer: float # нерівномірність амплітуди hnr: float # гармонічне відношення (стрес: зниження) def extract_stress_features(audio: np.ndarray, sr: int = 16000) -> EmotionalAcoustics: # Основний тон f0, voiced_flag, _ = librosa.pyin(audio, fmin=75, fmax=500, sr=sr) f0_voiced = f0[voiced_flag & ~np.isnan(f0)] # Енергія rms = librosa.feature.rms(y=audio, frame_length=2048, hop_length=512)[0] # Spectral features для HNR proxy zcr = librosa.feature.zero_crossing_rate(audio)[0] return EmotionalAcoustics( f0_mean=float(np.mean(f0_voiced)) if len(f0_voiced) > 0 else 0, f0_range=float(np.ptp(f0_voiced)) if len(f0_voiced) > 0 else 0, f0_std=float(np.std(f0_voiced)) if len(f0_voiced) > 0 else 0, speaking_rate=estimate_speaking_rate(audio, sr), energy_mean=float(np.mean(rms)), jitter=estimate_jitter(f0_voiced), shimmer=estimate_shimmer(rms), hnr=float(1.0 / (np.mean(zcr) + 1e-8)) ) 

Система аналізує акустичні характеристики голосу: частоту основного тону (F0), темп мовлення, енергію, джитер, шимер. Ці ознаки змінюються при стресі та агресії, незалежно від змісту мовлення. Аналіз ведеться кожні 3 секунди, що дозволяє реагувати миттєво.

Які акустичні ознаки вказують на стрес?

Евристичні правила (наприклад, «якщо гучність > порогу — агресія») дають точність ~60%. Наш ML-класифікатор на основі Gradient Boosting або нейромережі (PyTorch) підвищує точність до 85% і вище. Ключова перевага — урахування індивідуального baseline голосу. Перші 10 секунд розмови система запам'ятовує «норму» для конкретного клієнта та визначає відхилення від неї.

Порівняйте: правила дають 60% точності, наша модель — 85%. Це в 1.4 раза точніше, що критично знижує кількість хибних спрацьовувань і пропусків.

from sklearn.ensemble import GradientBoostingClassifier import joblib class StressAggressionClassifier: LABELS = {0: "neutral", 1: "stressed", 2: "aggressive"} def __init__(self, model_path: str): self.model = joblib.load(model_path) self.baseline = {} # персональний baseline перших 10 секунд def classify( self, features: EmotionalAcoustics, baseline: EmotionalAcoustics = None ) -> dict: feat_vector = self._to_vector(features) if baseline: # Нормалізуємо відносно персонального baseline base_vector = self._to_vector(baseline) feat_vector = (feat_vector - base_vector) / (base_vector + 1e-8) proba = self.model.predict_proba([feat_vector])[0] label_id = np.argmax(proba) return { "label": self.LABELS[label_id], "confidence": float(proba[label_id]), "probabilities": {self.LABELS[i]: float(p) for i, p in enumerate(proba)} } 

Як класифікатор ураховує індивідуальний baseline?

Для кожного клієнта на початку дзвінка ми обчислюємо baseline — усереднені акустичні характеристики за перші 10 секунд. Усі наступні ознаки нормалізуються відносно нього. Це дозволяє відрізнити «тиху від природи» людину від раптово притихлої у стресі. Без baseline модель часто плутає спокійну агресію з нейтральним станом.

Навчання на датасеті емоцій

Використовуємо RAVDESS (англійська) + EMOVO + кастомні записи з розміткою. Для української — RESD (Russian Emotional Speech Dataset) або власна розмітка.

Продуктивність після навчання: accuracy ~78–85% на 3 класах (neutral / stressed / aggressive). Порівняння: евристичні правила дають 60% точності, наша модель — 85% — це в 1.4 раза краще.

Порівняння підходів

Метод Точність Урахування baseline Час реакції
Евристичні правила ~60% Ні Миттєво
ML-класифікатор (Gradient Boosting) 78–85% Так 3 секунди
Нейромережа (PyTorch) до 90%+ Так 3–5 секунд

Етапи роботи над проєктом

  1. Аналітика — аудит процесів, збір вимог, оцінка обсягу даних.
  2. Збір даних і розмітка — якщо немає готового датасету, записуємо дзвінки та розмічаємо емоції вручну (2–4 тижні).
  3. Розробка ML-пайплайну — вилучення ознак, навчання моделі (Gradient Boosting або нейромережа на PyTorch), валідація.
  4. Інтеграція — REST API або gRPC сервіс, обробка потоку аудіо, алерти в CRM.
  5. Тестування — A/B тест на 10% дзвінків, порівняння з поточною системою.
  6. Деплой і супровід — контейнеризація (Docker + Kubernetes), моніторинг дрейфу даних.

Що входить у роботу?

  • Датасет (збір, очищення, розмітка) — за потреби.
  • Навчена модель у форматі ONNX або TorchScript.
  • REST API для інференсу з документацією.
  • Інтеграція з вашою SIP-інфраструктурою або CRM.
  • Дашборд статистики (розподіл емоцій, тренди, SLA).
  • Навчання операторів та супервізорів.
  • Гарантія на якість моделі (accuracy не нижче 80% на контрольній вибірці).

Терміни та вартість

Етап Термін Умови
Модель на готовому датасеті (2–3 класи) 2–3 тижні Так, якщо підходить відкритий датасет
Збір і розмітка даних з нуля 2–3 місяці Розширений обсяг робіт
Інтеграція та деплой 1–2 тижні Під ключ, повна документація

Вартість розраховується індивідуально після аналізу даних та вимог.

Типові помилки при впровадженні

  • Використання однієї й тієї ж моделі для різних акцентів і мов без адаптації.
  • Відсутність baseline — призводить до хибних спрацьовувань на «емоційних» клієнтах.
  • Спроба розпізнавати більше 3–4 класів — accuracy падає до 60%.
  • Ігнорування дрейфу даних: модель потребує періодичного донавчання на нових записах.

Замовте пілотний проєкт або технічний аудит — ми оцінимо точність на ваших даних і запропонуємо оптимальне рішення. Отримайте консультацію щодо інтеграції без зобов'язань.

CLASSIFICATION_WINDOW_SEC = 3.0 # аналізуємо кожні 3 секунди async def continuous_emotion_monitoring(call_id: str, audio_stream): classifier = StressAggressionClassifier("models/stress_model.pkl") baseline = None buffer = bytearray() async for chunk in audio_stream: buffer.extend(chunk) if len(buffer) >= 16000 * CLASSIFICATION_WINDOW_SEC * 2: audio = np.frombuffer(buffer, dtype=np.int16).astype(np.float32) / 32768.0 features = extract_stress_features(audio) # Перші 10 сек — встановлюємо baseline if baseline is None and len(buffer) < 160000: baseline = features buffer = bytearray() continue result = classifier.classify(features, baseline) if result["label"] == "aggressive" and result["confidence"] > 0.75: await trigger_aggression_alert(call_id, result) buffer = bytearray() 

Терміни: класифікатор на готовому датасеті — 2–3 тижні. Збір датасету та навчання з нуля — 2–3 місяці. Зв'яжіться з нами для обговорення вашого проєкту.