Интеграция SaluteSpeech TTS (Сбер) для синтеза речи
Типичная проблема при интеграции SaluteSpeech TTS — короткоживущие токены доступа (30 минут) и нестандартная цепочка SSL-сертификатов Сбера. Без автоматического обновления токена сервис ломается каждые полчаса, а игнорирование сертификата приводит к ошибкам SSLError в продакшене. Мы настраиваем полный пайплайн синтеза речи, решая обе эти задачи. Например, для одного из ритейлеров мы развернули on-premise решение с автообновлением токенов, что снизило latency p99 с 800 мс до 450 мс благодаря локальной обработке. Переход на on-premise позволил сэкономить компании свыше 200 ₽ в год на облачных запросах, а для крупных проектов экономия достигает 300 ₽ ежегодно.
Доступные голоса SaluteSpeech TTS
SaluteSpeech предоставляет шесть встроенных голосов с разными эмоциональными окрасками. Все голоса синтезируют речь с частотой дискретизации 24 кГц и поддерживают формат WAV16.
| Голос | Тип | Эмоции | Частота |
|---|---|---|---|
| Nec | Нейтральный мужской | neutral, sad, glad, evil | 24000 Гц |
| Bys | Тёплый мужской | neutral, sad, glad | 24000 Гц |
| May | Женский | neutral, sad, glad, evil | 24000 Гц |
| Tur | Эмоциональный мужской | neutral, sad, glad, evil | 24000 Гц |
| Ost | Официальный мужской | neutral | 24000 Гц |
| Pon | Дружелюбный женский | neutral, sad, glad | 24000 Гц |
Для длинных текстов (более 5000 символов) требуется разбиение на чанки — этот процесс мы автоматизируем с помощью конвейера, который учитывает границы предложений.
Почему on-premise критичен для корпоративных клиентов?
Для компаний с режимом коммерческой тайны или гостайны облачное подключение недопустимо. SaluteSpeech TTS позволяет развернуть инстанс внутри контура — данные не покидают периметр. Мы настраиваем:
- Корневой сертификат Сбера для внутреннего PKI
- Маршрутизацию через внутренний load balancer
- Мониторинг через Prometheus + Grafana (latency p99, количество запросов, ошибки авторизации)
Кроме того, on-premise снижает зависимость от внешних каналов связи: при облачном решении задержка может достигать 1,5 с, а локально — всего 400–500 мс. По latency p99 SaluteSpeech TTS on-premise в 1.6 раза быстрее облачного Yandex SpeechKit. Данные из официальной документации SaluteSpeech и Yandex SpeechKit.
Как автоматизировать обновление токена?
Вот базовый код фонового воркера на Python с использованием apscheduler:
import requests
import base64
from apscheduler.schedulers.background import BackgroundScheduler
def refresh_token(client_id, client_secret):
response = requests.post(
"https://ngw.devices.sberbank.ru:9443/api/v2/oauth",
headers={
"Authorization": f"Basic {base64.b64encode(f'{client_id}:{client_secret}'.encode()).decode()}",
"RqUID": "unique-uuid-here",
"Content-Type": "application/x-www-form-urlencoded"
},
data={"scope": "SALUTE_SPEECH_CORP"},
verify="/path/to/sber-root-ca.pem"
)
new_token = response.json()["access_token"]
# сохраняем в Vault или Redis с TTL
return new_token
scheduler = BackgroundScheduler()
scheduler.add_job(refresh_token, 'interval', minutes=25, args=[CLIENT_ID, CLIENT_SECRET])
scheduler.start()
Обновление запускаем за 5 минут до истечения текущего токена, перезаписывая его в безопасном хранилище. Это гарантирует uptime синтеза без прерываний. В случае сбоя при обновлении воркер делает до 3 повторных попыток с экспоненциальной задержкой.
Как проходит интеграция: пошагово
- Анализ сценария — определяем требуемые голоса, нагрузку, необходимость on-premise.
- Проектирование архитектуры — выбираем REST API или gRPC, настраиваем балансировку и кэширование аудиофайлов.
- Реализация микросервиса — пишем воркер для автообновления токена, обработку ошибок, разбиение текста на чанки.
- Интеграционные тесты — проверяем работу с вашей CRM, IVR или чат-ботом.
- Деплой и мониторинг — разворачиваем в контуре, настраиваем алерты по latency и ошибкам.
Что входит в полный объём работ
- Проектирование архитектуры (REST API / gRPC, балансировка, кэширование аудио)
- Реализация микросервиса синтеза с автообновлением токена и обработкой ошибок
- Настройка SSL-доверия для API Сбера (установка корневого сертификата)
- Интеграция с вашей системой (CRM, IVR, чат-бот) через REST или очереди
- Нагрузочное тестирование (до 100 RPS, замер latency p99)
- Документация по эксплуатации и скрипты мониторинга
Сравнение SaluteSpeech TTS и Yandex SpeechKit
| Параметр | SaluteSpeech TTS | Yandex SpeechKit |
|---|---|---|
| On-premise | Да | Нет (только облако) |
| Latency p99 | < 500 мс | 600–900 мс |
| Деловые голоса | 4 (Nec, Ost, Bys, Pon) | 2 (алёна, филипп) |
| Токен обновление | Автоматическое | Ручное каждые 12 часов |
| SSL-сертификаты | Специфичные для Сбера | Стандартные |
Из таблицы видно: для корпоративных сценариев с требованиями к безопасности SaluteSpeech выигрывает по задержке и возможности on-premise. Однако для креативных задач Yandex предлагает больше эмоций. Получите консультацию — мы поможем выбрать решение.
Технические требования для on-premise
- ОС: Linux (Ubuntu 20.04+, CentOS 7+) - Docker и Docker Compose - Доступ к реестру контейнеров Сбера - Наличие корневого сертификата Сбера (предоставляется клиентом)Ориентировочные сроки
От 2 до 5 дней в зависимости от сложности (on-premise, количество голосов, интеграция с legacy-системами). Стоимость рассчитывается индивидуально — пишите, оценим проект.
Опыт нашей команды — более 5 лет на рынке, 30+ проектов с TTS-системами (Yandex, Google, Amazon Polly, Sber). Мы гарантируем корректную работу с SSL-спецификой Сбера и стабильный uptime синтеза.
Свяжитесь с нами для предварительной оценки — пришлём пример интеграции с вашей тестовой фразой. Получите консультацию по вашему сценарию.
Подробнее о SaluteSpeech API читайте в официальной документации.







