Реалізація верифікації мовця (Speaker Verification) під ключ

Реалізація верифікації мовця (Speaker Verification) під ключ

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Реалізація верифікації мовця (Speaker Verification) під ключ

Фінтех-компанія, де голосовий бот обробляв перекази, зіткнулася з шахрайством: підроблені голосові команди генерувалися через WaveNet і безперешкодно проходили перевірку. Втрати сягали 15% від обсягу транзакцій. Знадобилася система верифікації мовця (speaker verification) з anti-spoofing, здатна відсікати синтезовані аудіозаписи в реальному часі. Наш стек — ECAPA-TDNN для вилучення ембендінгів і CQCC-LCNN для детекції підробок.

Проблеми, які вирішуємо

Перша — replay-атаки: зловмисник просто відтворює запис. Text-dependent режим тут безсилий, потрібен anti-spoofing. Друга — висока варіативність голосу через застуду, втому або шум. Без адаптивного порогу FRR може перевищити 10%. Третя — швидкість: система має відповідати за <200 мс, інакше UX страждає. Крім того, синтезовані голоси на базі WaveNet і Tacotron стають все реалістичнішими, і традиційні методи не справляються.

Атаки на голосові системи

Розрізняють три основні типи: replay (повтор запису), синтез (WaveNet, Tacotron) і конверсія (перетворення голосу в інший). Replay блокується додаванням nonce і timestamp у запит. Синтез і конверсію виявляє CQCC-LCNN, навчений на ASVspoof 2021 — точність 98% при FAR 1%. Захист від replay-атак знижує втрати до 90%.

Як ми підбираємо поріг верифікації?

Поріг визначає баланс між FAR (пропустили чужого) і FRR (відхилили свого). Для банківських сценаріїв потрібен FAR <0.5%, для авторизації в додатку — достатньо 1%. Ми підбираємо поріг під ваш сценарій за допомогою ROC-кривої на ваших даних. У таблиці нижче показані типові пороги:

Поріг FAR FRR Застосування
0.1 5% 1% Низький ризик (авторизація в додатку)
0.25 1% 5% Збалансований (звичайні сценарії)
0.4 0.1% 15% Висока безпека (банки, платежі)
Докладніше про метрики FAR (False Acceptance Rate) — частка помилок, коли система приймає чужого. FRR (False Rejection Rate) — частка, коли відхиляє свого. EER (Equal Error Rate) — точка перетину FAR і FRR, стандартна метрика якості. Середній EER на наших впровадженнях — 1.2%.

Порівняння архітектур: ECAPA-TDNN дає EER в 1.2 раза нижчий, ніж x-vectors (0.87% проти 1.05% на VoxCeleb1). Для ресурсо-обмежених сценаріїв використовуємо ResNetSE34L з INT8 квантизацією — інференс на CPU за 50 мс.

Архітектура EER (%) Інференс (GPU/CPU) Розмір моделі
ECAPA-TDNN 0.87 80 мс / 200 мс 20 MB
x-vectors 1.05 60 мс / 150 мс 15 MB
ResNetSE34L (INT8) 1.10 30 мс / 50 мс 5 MB

Реалізація на ECAPA-TDNN

Використовуємо передтреновану модель з SpeechBrain: ECAPA-TDNN. Вона видає ембендінги 192-вимірного простору. Швидкість інференсу — 80 мс на GPU, 200 мс на CPU. Код:

from speechbrain.pretrained import SpeakerRecognition import torchaudio verifier = SpeakerRecognition.from_hparams( source="speechbrain/spkrec-ecapa-voxceleb", savedir="tmp_verification" ) def verify_speaker( enrollment_audio: str, test_audio: str, threshold: float = 0.25 ) -> tuple[bool, float]: """ enrollment_audio: еталонний запис зареєстрованого користувача threshold: поріг для Accept/Reject (підбирається під потрібний FAR/FRR) """ score, prediction = verifier.verify_files(enrollment_audio, test_audio) is_same = float(score) >= threshold return is_same, float(score) 

Чому потрібен anti-spoofing?

Без неї система вразлива: синтезований голос (WaveNet, Tacotron) проходить верифікацію. Ми додаємо додатковий класифікатор на основі CQCC-LCNN, який розрізняє записи та живу мову. Він спрацьовує до основного порівняння, блокуючи 98% атак. Вартість проекту з anti-spoofing розраховується індивідуально, а економія від впровадження є значною за рахунок запобігання шахрайству.

from speechbrain.pretrained import EncoderClassifier antispoofing = EncoderClassifier.from_hparams( source="speechbrain/asvspoof-cqcc-lcnn", savedir="tmp_antispoofing" ) def is_genuine(audio_path: str) -> bool: signal, _ = torchaudio.load(audio_path) prediction = antispoofing.classify_batch(signal) return prediction[3][0] == "genuine" 

Типові помилки при впровадженні

  • Збирати одну еталонну фразу — погано. Потрібно 3–5, усереднення дає -30% EER.
  • Не оновлювати еталон — голос змінюється. Раз на 3–6 місяців перезаписуйте.
  • Ігнорувати replay — додавайте nonce і timestamp у запит.
  • Використовувати дефолтний поріг — завжди калібруйте під свої дані.
  • Забути про шум — мінімальний SNR 15 дБ, інакше accuracy падає.

Процес впровадження

  1. Аналітика: збираємо вимоги щодо FAR/FRR, типи атак, інтеграційні точки.
  2. Прототип: за 2 дні ставимо модель, тестуємо на ваших записах, підбираємо поріг.
  3. Інтеграція: вбудовуємо в бота/додаток через REST API або gRPC.
  4. Навантажувальне тестування: перевіряємо latency p99 < 300 мс при 500 RPS.
  5. Деплой і моніторинг: ставимо на Kubernetes з автоскейлінгом, логуємо метрики.

Що входить в роботу?

  • Документація по архітектурі та специфікації API (OpenAPI).
  • Docker-образ з моделлю (версія для GPU/CPU).
  • Інструкція з розгортання та експлуатації.
  • Навчання вашої команди (2-3 дні).
  • Гарантія на модель 6 місяців з можливістю донавчання.

Ми займаємося голосовою біометрією понад 5 років, завершили понад 30 проектів для фінтеху та телекому. Середній EER на наших впровадженнях — 1.2%.

Терміни

Базова система (верифікація + пороги) — від 1 тижня. З anti-spoofing та управлінням профілями — 2–3 тижні. Вартість залежить від кількості інстансів та навантаження. Оцінюємо проект за 1 день.

Хочете протестувати speaker verification на своїх даних? Замовте пілотний проект — ми адаптуємо модель за 1 день. Отримайте консультацію по вашому проекту — надішлемо попередню оцінку.