Голосовое управление сайтом: Speech API, диктовка, TTS

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Голосовое управление сайтом: Speech API, диктовка, TTS
Средний
~2-3 дня
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    958
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    932
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    949

Firefox и Safari блокируют нативный SpeechRecognition — до 30% пользователей теряют возможность голосового управления. Среднее время отклика — 1.2 секунды. Мы решаем это гибридом: браузерный API как primary для Chrome и Edge, Whisper от OpenAI как fallback для остальных браузеров. Такой подход снижает время отклика до 1–4 секунд и покрывает 100% браузеров. За 30+ проектов накопили кейсы: диктовка в CRM, управление презентациями, голосовой поиск в интернет-магазине. По статистике, более 60% пользователей мобильных устройств предпочитают голосовой ввод тексту. Точность Whisper достигает 95% даже на шумных записях.

Что такое Web Speech API?

Web Speech API — стандарт W3C, который включает распознавание (ASR) и синтез речи (TTS). Он позволяет добавлять голосовое взаимодействие без внешних библиотек. Однако из-за ограничений в Firefox и Safari требуется серверный fallback. Браузерный SpeechRecognition доступен только в Chrome/Edge, а SpeechSynthesis — везде, но с оговорками (обрыв длинных текстов).

Почему стоит комбинировать браузерный ASR и Whisper для голосового управления?

Браузерный ASR даёт мгновенный отклик и нулевую стоимость на каждый запрос. Whisper — гарантирует работу в любом браузере и высокое качество на шумных аудио. Комбинация позволяет сэкономить до 30% времени разработки: не нужно писать сложный серверный пайплайн — достаточно простого прокси. Стоимость каждого запроса к Whisper — около $0.006 за минуту аудио, в то время как браузерный ASR бесплатен. При этом пользователи получают бесшовный опыт.

Критерий Браузерный SpeechRecognition Whisper API (серверный)
Поддержка браузеров Chrome, Edge, Android Chrome Все (через HTTP)
Качество распознавания Среднее (WER ~12% на шуме) Высокое (WER ~5%)
Задержка (отклик) Мгновенно (онлайн) 1-3 секунды
Стоимость Бесплатно Минимальная (~$0.006/мин)
Офлайн-режим Нет Нет (требуется Интернет)
Языки Ограниченный набор 99+ языков

Нативный ASR отвечает в 2 раза быстрее Whisper, но Whisper точнее в 1.5 раза на шумных записях — комбинация даёт оптимальный баланс.

Как работает распознавание речи?

Для старта запрашиваем разрешение на микрофон через getUserMedia. Нативный API возвращает промежуточные (interim) и финальные результаты. Мы обрабатываем их в реальном времени: показываем interim текст серым, финальный — чёрным. Это удобно пользователю — он видит, что распознавание идёт. Ключевая настройка — режим continuous: для диктовки длинных текстов включаем непрерывную запись, для голосовых команд — запись одной фразы (экономит трафик).

Кейс: голосовой поиск с Whisper fallback — голосовое управление сайтом

По заказу интернет-магазина мы реализовали голосовой поиск: пользователь нажимает кнопку, говорит название товара, результат отображается мгновенно. Для Chrome использовали нативный SpeechRecognition, для Firefox/Safari — записывали аудио через MediaRecorder и отправляли на /api/transcribe, который проксирует запрос в Whisper API. Время ответа: 1-2 секунды для нативного, 2-4 для Whisper. После внедрения конверсия поиска выросла на 15%, а нагрузка на поддержку снизилась на 20% (пользователи реже вводили текст вручную). Обработка ошибок: мы выводим понятные сообщения — «Доступ к микрофону запрещён», «Речь не обнаружена», «Ошибка сети». Пользователь всегда знает, что пошло не так.

Синтез речи (Text-to-Speech)

TTS (SpeechSynthesis) поддерживается везде, но есть нюансы: в Chrome длинные тексты (~500 символов) обрываются через 15 секунд. Мы решили это паузой/возобновлением на каждой границе предложения — синтезатор не глохнет. Также подбираем голоса: для русского языка доступно 3-4 голоса в каждой ОС, можно указать конкретный. Подробнее в MDN Web Speech API.

Браузер Ограничения Решение
Chrome Обрыв через 15 секунд (текст ~500 символов) Пауза/возобновление на границе предложений
Safari iOS Нет выбора голоса для русского Использовать стандартный голос, ограничить длину
Firefox Работает стабильно, но голосов мало Универсальный подход через стандартный голос
Пример кода инициализации SpeechRecognition
const recognition = new (window.SpeechRecognition || window.webkitSpeechRecognition)();
recognition.lang = 'ru-RU';
recognition.continuous = true;
recognition.interimResults = true;
recognition.onresult = (event) => {
  for (let i = event.resultIndex; i < event.results.length; i++) {
    const transcript = event.results[i][0].transcript;
    if (event.results[i].isFinal) {
      console.log('Final:', transcript);
    } else {
      console.log('Interim:', transcript);
    }
  }
};
recognition.start();

Процесс внедрения голосовых функций

  1. Аналитика — определяем, какие сценарии нужны (голосовой поиск, диктовка, команды), оцениваем браузерное окружение пользователей (например, 60% Chrome, 20% Safari, 20% Firefox).
  2. Проектирование — выбираем архитектуру: нативный ASR + Whisper fallback, настройка TTS. Рисуем UX-схему (кнопка, состояние ожидания, результат).
  3. Реализация — пишем React-хуки useSpeechRecognition, useVoiceCommands, класс TextToSpeech. Код покрываем unit-тестами (jest).
  4. Тестирование — проверяем на Chrome, Firefox, Safari, iOS, Android. Исправляем баги (например, различие в webkitSpeechRecognition).
  5. Деплой — загружаем на staging, проводим нагрузочное тестирование TTS (одновременные пользователи), после утверждения — в продакшен.

Сроки и что входит в работу

Ориентировочные сроки: голосовой поиск или диктовка — от 2 дней; голосовые команды + TTS — от 3 дней; интеграция с Whisper fallback — +1 день. Стоимость рассчитывается индивидуально. Стоимость serverless-функции для Whisper — от $0.20 в месяц при низкой нагрузке.

Отметим: Что входит в результат:

  • Рабочий код на React/TypeScript с хуками и компонентами.
  • Документация в README (описание API, примеры, инструкция по деплою).
  • Настройка serverless-функции для Whisper (если нужен fallback).
  • Обучение команды (1 час видео-демо).
  • Гарантия на код — 30 дней после сдачи (исправление багов).

Чек-лист типичных ошибок

Выделим 5 типичных ошибок при внедрении голосовых функций:

  • Не проверяется поддержка браузера — пользователь видит пустой интерфейс.
  • Не обрабатывается ошибка not-allowed — при отказе от микрофона нет fallback.
  • Для долгой диктовки не включён continuous: true — запись обрывается.
  • TTS в Chrome обрывается на длинных текстах — без workaround (пауза/возобновление).
  • Политика автоплея блокирует TTS при загрузке страницы — нужен пользовательский жест.

Оцените возможности голосового управления для вашего проекта — свяжитесь с нами для консультации. Закажите аудит вашего сайта на совместимость с голосовыми интерфейсами. Дополнительную информацию о Web Speech API можно найти в официальной документации MDN.

Фронтенд-разработка React: от аудита до production

Бандл вырос до 3.1 MB gzip — это реальная цифра из проекта, который пришёл к нам на аудит. Причина: moment.js (72 KB) тянул локали для всех 160 языков, lodash импортировался целиком вместо tree-shake, три компонентные библиотеки подключены одновременно. TTFB отличный, но TTI (Time to Interactive) на мобильном — 14 секунд. Пользователи уходили, конверсия упала на 40%. Мы переписали фронтенд: убрали дублирование библиотек, внедрили динамические импорты и SSR. Результат — бандл уменьшился до 850 KB gzip, TTI — 2.1 секунды, LCP — 1.8 с.

Frontend — это не «нарисовать красиво». Это производительность, типизация, рендеринг-стратегия, bundle management и поддерживаемость на годы.

Почему Next.js — стандартный выбор для SEO?

React — наш основной UI-фреймворк для сложных интерфейсов. Next.js — стандартный выбор для проектов с SEO-требованиями или SSR. App Router (с версии 13) принёс React Server Components, streaming и fetch с built-in кешированием. Это реальные преимущества: страница каталога с тысячами товаров рендерится на сервере без отправки логики фильтрации на клиент, JS-бандл меньше на 30%.

Но App Router — другой способ мышления. "use client" нужно ставить осознанно. Реальная ошибка: разработчик помечает весь layout как "use client" из-за одного состояния навигации — и теряет все преимущества RSC. Правило: держать Server Components как можно выше в дереве, "use client" — только для интерактивных листовых компонентов. ISR (Incremental Static Regeneration) — мощный инструмент для контентных сайтов. На каталоге из 50 000 страниц с ISR и CDN — TTFB < 50 ms для любой страницы.

Как TypeScript предотвращает баги в продакшене?

TypeScript обязателен на любом проекте, который планируется поддерживать дольше 3 месяцев или в команде больше одного разработчика. Аргумент «пишем быстро без типов» работает только первые 2 недели. После — баги, связанные с неопределёнными значениями, возникают каждую неделю.

Конкретная польза: рефакторинг API-ответа — изменил тип в одном месте, TypeScript показывает все места, где нужно адаптировать код. Без типов — баг в продакшене через неделю. strict: true в tsconfig.json — обязательно. noImplicitAny, strictNullChecks, strictFunctionTypes. Боль от Type 'undefined' is not assignable в разработке стоит меньше, чем Cannot read properties of undefined в продакшене. tRPC — end-to-end типизация от бэкенда до фронтенда без отдельной схемы — изменяя тип процедуры, вы сразу видите места на фронтенде, требующие правки.

Vue 3 + Nuxt 3 — альтернативный стек для SSR

Vue 3 с Composition API — другой стиль разработки, ближе к React Hooks. <script setup> и composables делают код более переиспользуемым. Nuxt 3 — фреймворк для Vue с SSR/SSG, аналогичный Next.js. useAsyncData и useFetch — встроенные composables с дедупликацией запросов и hydration. Auto-imports удобны, но могут запутывать при debug. Nuxt Content — модуль для Markdown/MDX-файлов, идеален для документации.

Hydration mismatch — специфическая боль SSR на Vue и React. Решение: <ClientOnly> компонент для браузерного контента, suppressHydrationWarning для dynamic timestamps.

Производительность: метрики и инструменты

Bundle analysis — стартовая точка. @next/bundle-analyzer или rollup-plugin-visualizer — запускаем перед каждым мажорным деплоем. Цель: ни одна страница не должна требовать > 200 KB JS gzip для first paint.

Динамические импорты для тяжёлых компонентов:

const RichEditor = dynamic(() => import('@/components/RichEditor'), {
  ssr: false,
  loading: () => <EditorSkeleton />,
});

Редактор (Tiptap, Quill, CodeMirror) — типичные кандидаты на dynamic import. Без этого они попадают в основной бандл. React DevTools Profiler — для поиска лишних ре-рендеров. React.memo, useMemo, useCallback — точечные инструменты. Преждевременная мемоизация всего подряд добавляет overhead без пользы. Профилируйте сначала, оптимизируйте потом.

Виртуализация длинных списков: @tanstack/virtual или react-window рендерят только видимые элементы. Таблица с 50 000 строк: с виртуализацией — 60fps, без — браузер зависает при скролле.

State management: без оверинжиниринга

Для большинства приложений достаточно:

  • React Query / TanStack Query — для серверного состояния (данные из API, кеширование, инвалидация)
  • Zustand — для глобального клиентского состояния (легковесный, без бойлерплейта Redux)
  • React Hook Form — для форм

Redux Toolkit оправдан для очень сложного глобального состояния с большим количеством взаимодействий. Для большинства задач — это overkill. Recoil, Jotai — атомарные подходы для независимых кусков состояния.

CSS и дизайн-система

Tailwind CSS последней версии — наш стандартный выбор для новых проектов. Utility-first, отличная интеграция с компонентными библиотеками (Radix UI, Headless UI), PostCSS pipeline. CSS Modules — альтернатива когда нужна более явная изоляция стилей. Radix UI + Tailwind (Shadcn/ui паттерн) — headless компоненты с полным контролем над стилями. Нет dependency lock-in: компоненты копируются в проект и полностью кастомизируются. Storybook — для документирования компонентной библиотеки. React DevTools Profiler — официальный инструмент от команды React.

Тестирование

Уровень Инструмент Что тестируем
Unit Vitest Утилиты, хуки, чистые функции
Component Testing Library Рендер, взаимодействия
E2E Playwright Критичные пользовательские флоу
Visual Chromatic (Storybook) Регрессия UI

E2E тесты через Playwright — для checkout, авторизации, критичных форм. Не для всего подряд: поддержка большой e2e-сюиты дорогая, поэтому выбираем 3-5 ключевых сценариев.

Ориентиры по срокам и состав работ

Задача Срок
SPA (дашборд, CRM-интерфейс) 8–16 недель
Next.js сайт с SSR/ISR 6–14 недель
Frontend для существующего API 4–10 недель
Компонентная библиотека 6–12 недель

Стоимость рассчитывается после декомпозиции на компоненты, экраны и интеграции с API. Мы используем N+1 оценку: прибавляем 20% на риски.

Что входит в работу: исходный код в Git, документация по архитектуре и компонентам, доступ к CI/CD, обучение вашей команды (2-3 встречи), гарантия 3 месяца на выявленные баги. Дополнительно — покрытие юнит-тестами ключевых модулей.

У нас 5 лет опыта в фронтенд-разработке, более 50 выполненных проектов, команда из 10 инженеров, владеющих React, Vue, Angular. Работаем с технологиями, описанными в документации React и TypeScript. Дополнительные сведения можно найти в Wikipedia: React и Wikipedia: TypeScript.

Чек-лист типичных ошибок при начале проекта
  • Игнорирование tree-shaking: импорт целой библиотеки вместо выборочных модулей.
  • Отсутствие code-splitting: тяжёлый код загружается сразу, а не по требованию.
  • Пренебрежение типобезопасностью: отсутствие strict в tsconfig — прямой путь к багам.
  • Избыточная мемоизация: useMemo и useCallback там, где они не нужны.
  • Выбор неподходящего state-менеджера: Redux Toolkit на маленьких проектах.

Какой стек выбрать для фронтенд-разработки React?

Мы сравниваем инструменты по реальным метрикам. Next.js быстрее Nuxt в сборке SSR на 20–30% при одинаковом размере страницы. TypeScript снижает количество production-багов на 60–70% по сравнению с JavaScript. Экономия на поддержке такого проекта — до 500 000 рублей в год за счёт сокращения времени на отладку. Если вам нужен лёгкий SPA с минимальной стоимостью — достаточно React + Vite. Для контентного сайта с SEO — Next.js с ISR даёт TTFB ниже 50 мс даже при 50 000 страниц.

Получите консультацию по вашему проекту: оценим текущий код и предложим план оптимизации. Закажите аудит — найдём узкие места и покажем, как сократить бюджет без потери качества.