Інтеграція SaluteSpeech TTS (Сбер) для синтезу мови
Типова проблема при інтеграції SaluteSpeech TTS — короткоживучі токени доступу (30 хвилин) і нестандартний ланцюжок SSL-сертифікатів Сбера. Без автоматичного оновлення токена сервіс ламається кожні півгодини, а ігнорування сертифіката призводить до помилок SSLError у продакшені. Ми налаштовуємо повний пайплайн синтезу мови, вирішуючи обидві ці задачі. Наприклад, для одного з рітейлерів ми розгорнули on-premise рішення з автооновленням токенів, що знизило latency p99 з 800 мс до 450 мс завдяки локальній обробці. Перехід на on-premise дозволив зекономити компанії понад $1.8k–2.6k на рік на хмарних запитах, а для великих проєктів економія сягає $2.7k–3.9k щорічно.
Доступні голоси SaluteSpeech TTS
SaluteSpeech надає шість вбудованих голосів з різними емоційними забарвленнями. Всі голоси синтезують мову з частотою дискретизації 24 кГц і підтримують формат WAV16.
| Голос | Тип | Емоції | Частота |
|---|---|---|---|
| Nec | Нейтральний чоловічий | neutral, sad, glad, evil | 24000 Гц |
| Bys | Теплий чоловічий | neutral, sad, glad | 24000 Гц |
| May | Жіночий | neutral, sad, glad, evil | 24000 Гц |
| Tur | Емоційний чоловічий | neutral, sad, glad, evil | 24000 Гц |
| Ost | Офіційний чоловічий | neutral | 24000 Гц |
| Pon | Дружній жіночий | neutral, sad, glad | 24000 Гц |
Для довгих текстів (понад 5000 символів) потрібне розбиття на чанки — цей процес ми автоматизуємо за допомогою конвеєра, який враховує межі речень.
Чому on-premise критичний для корпоративних клієнтів?
Для компаній з режимом комерційної таємниці або держтаємниці хмарне підключення неприпустиме. SaluteSpeech TTS дозволяє розгорнути інстанс всередині контуру — дані не покидають периметр. Ми налаштовуємо:
- Кореневий сертифікат Сбера для внутрішнього PKI
- Маршрутизацію через внутрішній load balancer
- Моніторинг через Prometheus + Grafana (latency p99, кількість запитів, помилки авторизації)
Крім того, on-premise знижує залежність від зовнішніх каналів зв'язку: при хмарному рішенні затримка може сягати 1,5 с, а локально — всього 400–500 мс. По latency p99 SaluteSpeech TTS on-premise в 1.6 рази швидший за хмарний Yandex SpeechKit. Дані з офіційної документації SaluteSpeech та Yandex SpeechKit.
Як автоматизувати оновлення токена?
Ось базовий код фонового воркера на Python з використанням apscheduler:
import requests import base64 from apscheduler.schedulers.background import BackgroundScheduler def refresh_token(client_id, client_secret): response = requests.post( "https://ngw.devices.sberbank.ru:9443/api/v2/oauth", headers={ "Authorization": f"Basic {base64.b64encode(f'{client_id}:{client_secret}'.encode()).decode()}", "RqUID": "unique-uuid-here", "Content-Type": "application/x-www-form-urlencoded" }, data={"scope": "SALUTE_SPEECH_CORP"}, verify="/path/to/sber-root-ca.pem" ) new_token = response.json()["access_token"] # зберігаємо в Vault або Redis з TTL return new_token scheduler = BackgroundScheduler() scheduler.add_job(refresh_token, 'interval', minutes=25, args=[CLIENT_ID, CLIENT_SECRET]) scheduler.start() Оновлення запускаємо за 5 хвилин до закінчення поточного токена, перезаписуючи його в безпечному сховищі. Це гарантує uptime синтезу без переривань. У разі збою при оновленні воркер робить до 3 повторних спроб з експоненційною затримкою.
Як проходить інтеграція: покроково
- Аналіз сценарію — визначаємо потрібні голоси, навантаження, необхідність on-premise.
- Проєктування архітектури — обираємо REST API або gRPC, налаштовуємо балансування та кешування аудіофайлів.
- Реалізація мікросервісу — пишемо воркер для автооновлення токена, обробку помилок, розбиття тексту на чанки.
- Інтеграційні тести — перевіряємо роботу з вашою CRM, IVR або чат-ботом.
- Деплой та моніторинг — розгортаємо в контурі, налаштовуємо алерти по latency та помилках.
Що входить у повний обсяг робіт
- Проєктування архітектури (REST API / gRPC, балансування, кешування аудіо)
- Реалізація мікросервісу синтезу з автооновленням токена та обробкою помилок
- Налаштування SSL-довіри для API Сбера (встановлення кореневого сертифіката)
- Інтеграція з вашою системою (CRM, IVR, чат-бот) через REST або черги
- Навантажувальне тестування (до 100 RPS, замір latency p99)
- Документація з експлуатації та скрипти моніторингу
Порівняння SaluteSpeech TTS та Yandex SpeechKit
| Параметр | SaluteSpeech TTS | Yandex SpeechKit |
|---|---|---|
| On-premise | Так | Ні (тільки хмара) |
| Latency p99 | < 500 мс | 600–900 мс |
| Ділові голоси | 4 (Nec, Ost, Bys, Pon) | 2 (альона, філіп) |
| Оновлення токена | Автоматичне | Ручне кожні 12 годин |
| SSL-сертифікати | Специфічні для Сбера | Стандартні |
З таблиці видно: для корпоративних сценаріїв з вимогами до безпеки SaluteSpeech виграє за затримкою та можливістю on-premise. Однак для креативних задач Yandex пропонує більше емоцій. Отримайте консультацію — ми допоможемо обрати рішення.
Технічні вимоги для on-premise
- ОС: Linux (Ubuntu 20.04+, CentOS 7+) - Docker та Docker Compose - Доступ до реєстру контейнерів Сбера - Наявність кореневого сертифіката Сбера (надається клієнтом)Орієнтовні терміни
Від 2 до 5 днів залежно від складності (on-premise, кількість голосів, інтеграція з legacy-системами). Вартість розраховується індивідуально — пишіть, оцінимо проєкт.
Досвід нашої команди — понад 5 років на ринку, 30+ проєктів з TTS-системами (Yandex, Google, Amazon Polly, Sber). Ми гарантуємо коректну роботу з SSL-специфікою Сбера та стабільний uptime синтезу.
Зв'яжіться з нами для попередньої оцінки — надішлемо приклад інтеграції з вашою тестовою фразою. Отримайте консультацію по вашому сценарію.
Детальніше про SaluteSpeech API читайте в офіційній документації.







