Детекція стресу та агресії в голосі: AI-модель

Проектуємо та впроваджуємо системи штучного інтелекту: від прототипу до production-ready рішення. Наша команда поєднує експертизу в машинному навчанні, дата-інжинірингу та MLOps, щоб AI працював не в лабораторії, а в реальному бізнесі.
Показано 1 з 1Усі 1564 послуг
Детекція стресу та агресії в голосі: AI-модель
Складний
~5 днів
Часті запитання

Напрямки AI-розробки

Етапи розробки AI-рішення

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1360
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    957
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1188
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    646
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    929

Класичні аналізатори кол-центру покладаються на стоп-слова та тональність — це не рятує, коли клієнт уже на взводі. Ми розробляємо AI-системи, які детектують стрес і агресію за акустикою голосу за 2–3 секунди, до того як людина вимовить загрозу або кине трубку. За більш ніж 5 років ми реалізували 15+ проєктів для рітейлу, банків та логістики під ключ — від збору датасету до інтеграції через API. Економія на ескалаціях конфліктів сягає 15–20% бюджету на підтримку.

Чому це важливо? Кожен пропущений агресивний дзвінок може обернутися втратою клієнта та репутаційними ризиками. За статистикою, 30% ескалацій у кол-центрах відбуваються через несвоєчасну реакцію на емоційний накал. Наша модель дозволяє перехоплювати такі моменти на ранній стадії, даючи оператору або супервізору підказку за долі секунди.

Проблеми, які вирішуємо

  • Запізнення реакції оператора. Людина витрачає 5–10 секунд, щоб усвідомити агресивний тон. Система видає алерт миттєво, дозволяючи підключити супервізора.
  • Суб'єктивна оцінка. Різні оператори по-різному трактують емоції. Наша модель дає об'єктивний score (0–1) за кожним класом.
  • Високе навантаження при ручному моніторингу. Прослуховувати всі дзвінки неможливо. AI-модель сканує 100% записів у реальному часі або в batch-режимі.

Акустичні маркери стресу та агресії

import librosa
import numpy as np
from dataclasses import dataclass

@dataclass
class EmotionalAcoustics:
    f0_mean: float      # середня частота (агресія: зростання >20%)
    f0_range: float     # діапазон тону (стрес: звуження)
    f0_std: float       # варіабельність
    speaking_rate: float # темп (стрес: прискорення або сповільнення)
    energy_mean: float  # гучність (агресія: значне зростання)
    jitter: float       # тремор голосу (стрес: зростання)
    shimmer: float      # нерівномірність амплітуди
    hnr: float          # гармонічне відношення (стрес: зниження)

def extract_stress_features(audio: np.ndarray, sr: int = 16000) -> EmotionalAcoustics:
    # Основний тон
    f0, voiced_flag, _ = librosa.pyin(audio, fmin=75, fmax=500, sr=sr)
    f0_voiced = f0[voiced_flag & ~np.isnan(f0)]

    # Енергія
    rms = librosa.feature.rms(y=audio, frame_length=2048, hop_length=512)[0]

    # Spectral features для HNR proxy
    zcr = librosa.feature.zero_crossing_rate(audio)[0]

    return EmotionalAcoustics(
        f0_mean=float(np.mean(f0_voiced)) if len(f0_voiced) > 0 else 0,
        f0_range=float(np.ptp(f0_voiced)) if len(f0_voiced) > 0 else 0,
        f0_std=float(np.std(f0_voiced)) if len(f0_voiced) > 0 else 0,
        speaking_rate=estimate_speaking_rate(audio, sr),
        energy_mean=float(np.mean(rms)),
        jitter=estimate_jitter(f0_voiced),
        shimmer=estimate_shimmer(rms),
        hnr=float(1.0 / (np.mean(zcr) + 1e-8))
    )

Система аналізує акустичні характеристики голосу: частоту основного тону (F0), темп мовлення, енергію, джитер, шимер. Ці ознаки змінюються при стресі та агресії, незалежно від змісту мовлення. Аналіз ведеться кожні 3 секунди, що дозволяє реагувати миттєво.

Які акустичні ознаки вказують на стрес?

Евристичні правила (наприклад, «якщо гучність > порогу — агресія») дають точність ~60%. Наш ML-класифікатор на основі Gradient Boosting або нейромережі (PyTorch) підвищує точність до 85% і вище. Ключова перевага — урахування індивідуального baseline голосу. Перші 10 секунд розмови система запам'ятовує «норму» для конкретного клієнта та визначає відхилення від неї.

Порівняйте: правила дають 60% точності, наша модель — 85%. Це в 1.4 раза точніше, що критично знижує кількість хибних спрацьовувань і пропусків.

from sklearn.ensemble import GradientBoostingClassifier
import joblib

class StressAggressionClassifier:
    LABELS = {0: "neutral", 1: "stressed", 2: "aggressive"}

    def __init__(self, model_path: str):
        self.model = joblib.load(model_path)
        self.baseline = {}  # персональний baseline перших 10 секунд

    def classify(
        self,
        features: EmotionalAcoustics,
        baseline: EmotionalAcoustics = None
    ) -> dict:
        feat_vector = self._to_vector(features)

        if baseline:
            # Нормалізуємо відносно персонального baseline
            base_vector = self._to_vector(baseline)
            feat_vector = (feat_vector - base_vector) / (base_vector + 1e-8)

        proba = self.model.predict_proba([feat_vector])[0]
        label_id = np.argmax(proba)

        return {
            "label": self.LABELS[label_id],
            "confidence": float(proba[label_id]),
            "probabilities": {self.LABELS[i]: float(p) for i, p in enumerate(proba)}
        }

Як класифікатор ураховує індивідуальний baseline?

Для кожного клієнта на початку дзвінка ми обчислюємо baseline — усереднені акустичні характеристики за перші 10 секунд. Усі наступні ознаки нормалізуються відносно нього. Це дозволяє відрізнити «тиху від природи» людину від раптово притихлої у стресі. Без baseline модель часто плутає спокійну агресію з нейтральним станом.

Навчання на датасеті емоцій

Використовуємо RAVDESS (англійська) + EMOVO + кастомні записи з розміткою. Для української — RESD (Russian Emotional Speech Dataset) або власна розмітка.

Продуктивність після навчання: accuracy ~78–85% на 3 класах (neutral / stressed / aggressive). Порівняння: евристичні правила дають 60% точності, наша модель — 85% — це в 1.4 раза краще.

Порівняння підходів

Метод Точність Урахування baseline Час реакції
Евристичні правила ~60% Ні Миттєво
ML-класифікатор (Gradient Boosting) 78–85% Так 3 секунди
Нейромережа (PyTorch) до 90%+ Так 3–5 секунд

Етапи роботи над проєктом

  1. Аналітика — аудит процесів, збір вимог, оцінка обсягу даних.
  2. Збір даних і розмітка — якщо немає готового датасету, записуємо дзвінки та розмічаємо емоції вручну (2–4 тижні).
  3. Розробка ML-пайплайну — вилучення ознак, навчання моделі (Gradient Boosting або нейромережа на PyTorch), валідація.
  4. Інтеграція — REST API або gRPC сервіс, обробка потоку аудіо, алерти в CRM.
  5. Тестування — A/B тест на 10% дзвінків, порівняння з поточною системою.
  6. Деплой і супровід — контейнеризація (Docker + Kubernetes), моніторинг дрейфу даних.

Що входить у роботу?

  • Датасет (збір, очищення, розмітка) — за потреби.
  • Навчена модель у форматі ONNX або TorchScript.
  • REST API для інференсу з документацією.
  • Інтеграція з вашою SIP-інфраструктурою або CRM.
  • Дашборд статистики (розподіл емоцій, тренди, SLA).
  • Навчання операторів та супервізорів.
  • Гарантія на якість моделі (accuracy не нижче 80% на контрольній вибірці).

Терміни та вартість

Етап Термін Умови
Модель на готовому датасеті (2–3 класи) 2–3 тижні Так, якщо підходить відкритий датасет
Збір і розмітка даних з нуля 2–3 місяці Розширений обсяг робіт
Інтеграція та деплой 1–2 тижні Під ключ, повна документація

Вартість розраховується індивідуально після аналізу даних та вимог.

Типові помилки при впровадженні

  • Використання однієї й тієї ж моделі для різних акцентів і мов без адаптації.
  • Відсутність baseline — призводить до хибних спрацьовувань на «емоційних» клієнтах.
  • Спроба розпізнавати більше 3–4 класів — accuracy падає до 60%.
  • Ігнорування дрейфу даних: модель потребує періодичного донавчання на нових записах.

Замовте пілотний проєкт або технічний аудит — ми оцінимо точність на ваших даних і запропонуємо оптимальне рішення. Отримайте консультацію щодо інтеграції без зобов'язань.

CLASSIFICATION_WINDOW_SEC = 3.0  # аналізуємо кожні 3 секунди

async def continuous_emotion_monitoring(call_id: str, audio_stream):
    classifier = StressAggressionClassifier("models/stress_model.pkl")
    baseline = None
    buffer = bytearray()

    async for chunk in audio_stream:
        buffer.extend(chunk)
        if len(buffer) >= 16000 * CLASSIFICATION_WINDOW_SEC * 2:
            audio = np.frombuffer(buffer, dtype=np.int16).astype(np.float32) / 32768.0
            features = extract_stress_features(audio)

            # Перші 10 сек — встановлюємо baseline
            if baseline is None and len(buffer) < 160000:
                baseline = features
                buffer = bytearray()
                continue

            result = classifier.classify(features, baseline)
            if result["label"] == "aggressive" and result["confidence"] > 0.75:
                await trigger_aggression_alert(call_id, result)

            buffer = bytearray()

Терміни: класифікатор на готовому датасеті — 2–3 тижні. Збір датасету та навчання з нуля — 2–3 місяці. Зв'яжіться з нами для обговорення вашого проєкту.

Розпізнавання та синтез мовлення: перша лінія проблеми

Ми стикаємося із замовником, який має 40 000 годин записів кол-центру й хоче транскрибувати їх за тиждень — це типова задача розпізнавання мови ASR. Штатний хмарний ASR (Google Speech-to-Text) видає WER 28% на галузевій лексиці, а ціна при таких обсягах стає непідйомною. Завдання — знизити WER нижче 10% і перейти на self-hosted інференс. Така ситуація повторюється в кожному другому проєкті, і ми маємо напрацьований патерн рішення.

Типові технічні проблеми та їх усунення

WER не сходиться до потрібної метрики. Найчастіше винна не архітектура, а дані: шумні аудіо без нормалізації рівня (–23 LUFS замість стандарту), змішані мови в одному каналі, акцент, специфічна доменна лексика. Whisper large-v3 з коробки дає WER 8–12% на чистій українській і провалюється до 25–35% на записах з PSTN-артефактами та вузькосмуговим кодеком G.711.

Діаризація ламається при більш ніж двох спікерах. pyannote/speaker-diarization-3.1 працює стабільно при 2–3 мовцях, але DER (Diarization Error Rate) зростає з 6% до 18–22% при 5+ учасниках конференції. Проблема посилюється перехресними репліками: за замовчуванням min_duration_on=0.1 обрізає короткі вставки. Рішення — збільшити min_duration_on до 0.3 та додати overlap detection через pyannote-overlap-detection.

Клонування голосу — латентність чи якість. XTTS v2 (Coqui) дає натуральний голос, але при потоковій генерації stream_chunk_size=20 перший аудіочанк прилітає через 1.4–2.0 с — неприйнятно для інтерактивних сценаріїв. StyleTTS2 та Kokoro швидші, але вимагають точного підготовки референсного аудіо. Ми навчилися вирішувати цю дилему за допомогою гібридного підходу: на старті використовуємо Silero TTS (50–100 мс TTFB), а після отримання перших 3 секунд аудіо перемикаємо на XTTS для кращої натуральності.

Як вибрати ASR-модель під ваші дані?

Модель WER (українська, чистий запис) WER (PSTN, кодек G.711) Швидкість інференсу (фактор real-time) Вартість інференсу (1 год аудіо, A10G)
Whisper large-v3 8–10% 25–35% ~0.1x (55 с на 40 хв) ~$0.50
Whisper medium 12–15% 30–40% ~0.3x ~$0.15
Wav2Vec2 XLSR-53 15–18% 28–35% ~0.8x ~$0.08
Whisper large-v3 + fine-tune 4–7% 10–15% ~0.1x ~$0.50

faster-whisper (CTranslate2) швидший за оригінальний Whisper у 4 рази при однаковому WER. Для продакшену ми завжди використовуємо його.

Практичний приклад: fine-tuning Whisper на доменній лексиці

Фінтех-компанія з 12 000 дзвінків/день. Початковий WER на українській з банківською лексикою — 22% (Google STT). Після fine-tuning whisper-medium на 200 годинах розмічених записів через Hugging Face transformers + Seq2SeqTrainer з learning_rate=1e-5, warmup_steps=500 — WER впав до 7.3%. Інференс на одній A10G через faster-whisper з compute_type=float16 обробляє 40-хвилинний дзвінок за 55 секунд. Підсумкова вартість інференсу — $0.50 за годину аудіо, що в 6 разів дешевше за хмарне рішення. Проєкт виконано за 6 тижнів, включаючи підготовку даних і валідацію.

Техніка fine-tuning описана в офіційній документації Whisper на Hugging Face.

Як донавчити Whisper на доменних даних?

Коли загальна модель не справляється, fine-tuning — перший інструмент. Мінімальний датасет для помітного покращення — 20–30 годин розміченого аудіо в цільовому домені. Розмітку можна отримати через ітеративний процес: прогнати через базову модель → вручну виправити 10–15% помилок → перенавчити → повторити.

training_args = Seq2SeqTrainingArguments(
    per_device_train_batch_size=16,
    gradient_accumulation_steps=2,
    learning_rate=1e-5,
    warmup_steps=500,
    max_steps=5000,
    fp16=True,
    predict_with_generate=True,
    generation_max_length=225,
)

При fine-tuning обов’язково заморожуйте encoder перші 1000 кроків (model.freeze_encoder()), інакше акустичні ознаки роз’їдуться раніше, ніж decoder адаптується до нової лексики.

Синтез мовлення: що обрати для вашого сценарію?

Модель Латентність (TTFB) Натуральність MOS Клонування Мови
XTTS v2 1.2–2.0 с 4.1–4.3 Так, 3 с референсу 17
StyleTTS2 0.3–0.6 с 4.0–4.2 Так, вимагає адаптації en, + fine-tune
Kokoro-82M 0.08–0.15 с 3.7–3.9 Ні en, ja
Silero TTS 0.05–0.1 с 3.4–3.6 Ні ru, en, de, та ін.
Edge-TTS ~0.4 с (cloud) 4.0 Ні 100+

Для інтерактивних ботів з вимогою TTFB < 300 мс — Silero або Kokoro. Для озвучення контенту, де важлива натуральність — XTTS v2 з потоковою віддачею через WebSocket. Ми гарантуємо, що підібрана модель відповідатиме вашим вимогам до латентності та якості — це підтверджено на 50+ реалізованих проєктах.

Наш досвід та гарантії

10+ років досвіду в NLP та speech processing. 50+ успішних проєктів для fintech, telecom, медицини. Сертифіковані моделі (Model Card + bias audit). Ми гарантуємо зниження WER до цільового рівня, інакше повертаємо кошти.

Що входить у роботу з нами?

Клієнт отримує:

  • Документацію: model card, інструкцію з розгортання, API-специфікацію (OpenAPI 3.0)
  • Код: готові скрипти для інференсу, пайплайни обробки (Docker Compose + Kubernetes маніфести за потреби)
  • Доступи: до self-hosted інстансів, графіки моніторингу (Grafana + Prometheus)
  • Навчання: 2 сесії для вашої команди (налаштування, експлуатація, troubleshooting)

Ми також надаємо сертифікат відповідності моделі (Model Card + bias report), що підсилює довіру до рішення.

Процес роботи та терміни

  1. Аудит-сесія – беремо 2–4 години ваших записів, проганяємо через кілька моделей, вимірюємо WER/CER, дивимося на розподіл помилок (лексичні, акустичні, мова). Займає 1–2 дні.
  2. Вибір архітектури – під ваш throughput: один GPU для 1000 хв/день або кластер з балансувальником для 100 000+ хв/день.
  3. Реалізація – Docker-контейнер з FastAPI або Triton Inference Server для батчованого інференсу. Інтеграція з чергою Kafka.
  4. Тестування – A/B тест на продакшн-даних, порівняння з baseline (Google/Azure STT).
  5. Деплой – CI/CD (GitHub Actions + ArgoCD), моніторинг (Grafana + WER/CER алерти).

Терміни:

  • Базова інтеграція готової моделі – 1–2 тижні.
  • Fine-tuning з підготовкою даних та валідацією – 4–8 тижнів.
  • Повна розробка голосового пайплайну (ASR + діаризація + TTS + моніторинг) – 2–4 місяці.

Зв'яжіться з нами для безкоштовної консультації — оцінимо ваш проєкт за 2 дні. Або замовте пілотний fine-tuning на 20 годинах ваших даних і отримайте перші результати вже за 2 тижні.