Реалізація верифікації мовця (Speaker Verification) під ключ
Фінтех-компанія, де голосовий бот обробляв перекази, зіткнулася з шахрайством: підроблені голосові команди генерувалися через WaveNet і безперешкодно проходили перевірку. Втрати сягали 15% від обсягу транзакцій. Знадобилася система верифікації мовця (speaker verification) з anti-spoofing, здатна відсікати синтезовані аудіозаписи в реальному часі. Наш стек — ECAPA-TDNN для вилучення ембендінгів і CQCC-LCNN для детекції підробок.
Проблеми, які вирішуємо
Перша — replay-атаки: зловмисник просто відтворює запис. Text-dependent режим тут безсилий, потрібен anti-spoofing. Друга — висока варіативність голосу через застуду, втому або шум. Без адаптивного порогу FRR може перевищити 10%. Третя — швидкість: система має відповідати за <200 мс, інакше UX страждає. Крім того, синтезовані голоси на базі WaveNet і Tacotron стають все реалістичнішими, і традиційні методи не справляються.
Атаки на голосові системи
Розрізняють три основні типи: replay (повтор запису), синтез (WaveNet, Tacotron) і конверсія (перетворення голосу в інший). Replay блокується додаванням nonce і timestamp у запит. Синтез і конверсію виявляє CQCC-LCNN, навчений на ASVspoof 2021 — точність 98% при FAR 1%. Захист від replay-атак знижує втрати до 90%.
Як ми підбираємо поріг верифікації?
Поріг визначає баланс між FAR (пропустили чужого) і FRR (відхилили свого). Для банківських сценаріїв потрібен FAR <0.5%, для авторизації в додатку — достатньо 1%. Ми підбираємо поріг під ваш сценарій за допомогою ROC-кривої на ваших даних. У таблиці нижче показані типові пороги:
| Поріг | FAR | FRR | Застосування |
|---|---|---|---|
| 0.1 | 5% | 1% | Низький ризик (авторизація в додатку) |
| 0.25 | 1% | 5% | Збалансований (звичайні сценарії) |
| 0.4 | 0.1% | 15% | Висока безпека (банки, платежі) |
Докладніше про метрики
FAR (False Acceptance Rate) — частка помилок, коли система приймає чужого. FRR (False Rejection Rate) — частка, коли відхиляє свого. EER (Equal Error Rate) — точка перетину FAR і FRR, стандартна метрика якості. Середній EER на наших впровадженнях — 1.2%.Порівняння архітектур: ECAPA-TDNN дає EER в 1.2 раза нижчий, ніж x-vectors (0.87% проти 1.05% на VoxCeleb1). Для ресурсо-обмежених сценаріїв використовуємо ResNetSE34L з INT8 квантизацією — інференс на CPU за 50 мс.
| Архітектура | EER (%) | Інференс (GPU/CPU) | Розмір моделі |
|---|---|---|---|
| ECAPA-TDNN | 0.87 | 80 мс / 200 мс | 20 MB |
| x-vectors | 1.05 | 60 мс / 150 мс | 15 MB |
| ResNetSE34L (INT8) | 1.10 | 30 мс / 50 мс | 5 MB |
Реалізація на ECAPA-TDNN
Використовуємо передтреновану модель з SpeechBrain: ECAPA-TDNN. Вона видає ембендінги 192-вимірного простору. Швидкість інференсу — 80 мс на GPU, 200 мс на CPU. Код:
from speechbrain.pretrained import SpeakerRecognition import torchaudio verifier = SpeakerRecognition.from_hparams( source="speechbrain/spkrec-ecapa-voxceleb", savedir="tmp_verification" ) def verify_speaker( enrollment_audio: str, test_audio: str, threshold: float = 0.25 ) -> tuple[bool, float]: """ enrollment_audio: еталонний запис зареєстрованого користувача threshold: поріг для Accept/Reject (підбирається під потрібний FAR/FRR) """ score, prediction = verifier.verify_files(enrollment_audio, test_audio) is_same = float(score) >= threshold return is_same, float(score) Чому потрібен anti-spoofing?
Без неї система вразлива: синтезований голос (WaveNet, Tacotron) проходить верифікацію. Ми додаємо додатковий класифікатор на основі CQCC-LCNN, який розрізняє записи та живу мову. Він спрацьовує до основного порівняння, блокуючи 98% атак. Вартість проекту з anti-spoofing розраховується індивідуально, а економія від впровадження є значною за рахунок запобігання шахрайству.
from speechbrain.pretrained import EncoderClassifier antispoofing = EncoderClassifier.from_hparams( source="speechbrain/asvspoof-cqcc-lcnn", savedir="tmp_antispoofing" ) def is_genuine(audio_path: str) -> bool: signal, _ = torchaudio.load(audio_path) prediction = antispoofing.classify_batch(signal) return prediction[3][0] == "genuine" Типові помилки при впровадженні
- Збирати одну еталонну фразу — погано. Потрібно 3–5, усереднення дає -30% EER.
- Не оновлювати еталон — голос змінюється. Раз на 3–6 місяців перезаписуйте.
- Ігнорувати replay — додавайте nonce і timestamp у запит.
- Використовувати дефолтний поріг — завжди калібруйте під свої дані.
- Забути про шум — мінімальний SNR 15 дБ, інакше accuracy падає.
Процес впровадження
- Аналітика: збираємо вимоги щодо FAR/FRR, типи атак, інтеграційні точки.
- Прототип: за 2 дні ставимо модель, тестуємо на ваших записах, підбираємо поріг.
- Інтеграція: вбудовуємо в бота/додаток через REST API або gRPC.
- Навантажувальне тестування: перевіряємо latency p99 < 300 мс при 500 RPS.
- Деплой і моніторинг: ставимо на Kubernetes з автоскейлінгом, логуємо метрики.
Що входить в роботу?
- Документація по архітектурі та специфікації API (OpenAPI).
- Docker-образ з моделлю (версія для GPU/CPU).
- Інструкція з розгортання та експлуатації.
- Навчання вашої команди (2-3 дні).
- Гарантія на модель 6 місяців з можливістю донавчання.
Ми займаємося голосовою біометрією понад 5 років, завершили понад 30 проектів для фінтеху та телекому. Середній EER на наших впровадженнях — 1.2%.
Терміни
Базова система (верифікація + пороги) — від 1 тижня. З anti-spoofing та управлінням профілями — 2–3 тижні. Вартість залежить від кількості інстансів та навантаження. Оцінюємо проект за 1 день.
Хочете протестувати speaker verification на своїх даних? Замовте пілотний проект — ми адаптуємо модель за 1 день. Отримайте консультацію по вашому проекту — надішлемо попередню оцінку.







