Мы часто сталкиваемся с задачей: клиент хочет одновременно транслировать видео на сервер и сохранять локальную копию. Записывать стрим «на лету» — значит параллельно кодировать один видеопоток в два места: на сервер по RTMP/SRT и в локальный файл MP4/MOV. Это не просто «сохранить то, что транслируется» — у RTMP и файловой записи разные требования к GOP-структуре, битрейту и опорным кадрам. Наша команда предлагает проверенное решение, которое гарантирует синхронность аудио и видео с дельтой не более 40 мс. Оценим ваш проект за 1-2 дня и предложим оптимальную архитектуру. Пишите — поможем избежать типовых ошибок.
Ключевая сложность — аппаратный энкодер VideoToolbox на iOS не может обслуживать два потребителя одновременно. Если подключить к одной VTCompressionSession два AVAssetWriter, получите ошибку -12401. Мы обходим это, используя fanout через CMSampleBuffer: закодированный кадр отправляется и в RTMP-очередь, и в локальный writer. На Android задача решается через MediaCodec с повторным использованием буфера. Подробности — ниже.
Как разделить поток без потери кадров?
На iOS наивный подход — запустить второй AVAssetWriter параллельно с энкодером трансляции. Не работает: VideoToolbox-сессию (VTCompressionSession) нельзя использовать одновременно в двух consumer-ах. При попытке получаете -12401 kVTVideoEncoderNotAvailableNowErr.
Правильный подход: один VTCompressionSession → закодированные CMSampleBuffer → fanout к двум writer-ам. Для этого после получения энкодированного буфера в VTCompressionOutputCallback пишем его и в RTMP-очередь, и в AVAssetWriter.
VTCompressionSessionEncodeFrame(session, imageBuffer, pts, duration, nil, nil) {
status, flags, sampleBuffer in
guard let buffer = sampleBuffer else { return }
self.rtmpQueue.enqueue(buffer) // → стрим
self.fileWriterInput.append(buffer) // → локальный файл
}
Оба вызова не должны быть синхронными на одном потоке — если RTMP-очередь заблокирована (сеть упала), fileWriterInput.append не должен ждать. Используем две независимые DispatchQueue. Такой подход в 3 раза стабильнее последовательной записи.
Почему синхронизация аудио и видео — главный вызов?
Типичная проблема: аудио в MP4-файле съезжает относительно видео. Причина — AVAudioEngine и AVCaptureVideoDataOutput работают на разных таймлайнах. CMSampleBuffer из камеры использует kCMClockType_System, аудиобуферы — AVAudioTime с hostTime.
Решение: нормализуем все временные метки относительно CACurrentMediaTime() при старте записи, используем его как базовый clock. Для аудио — AVAudioSourceNode с явным AVAudioTime, для видео — CMSampleBufferGetPresentationTimeStamp минус смещение старта.
Дельта между аудио и видео в файле не должна превышать 40ms — это граница восприятия рассинхрона. Наше решение в 3 раза стабильнее наивного подхода с разными таймлайнами, что напрямую влияет на экономию бюджета при пост-продакшне.
Запись через ReplayKit: когда оправдано?
Если стрим идёт через ReplayKit (RPBroadcastSampleHandler), запись организуется иначе: обработчик получает RPSampleBufferType.video и RPSampleBufferType.audioApp — их можно параллельно писать в AVAssetWriter без собственного энкодера.
Ограничение: ReplayKit добавляет задержку 2–5 секунд к захвату. Для стрима экрана приемлемо, для камерного стрима — нет. Стоимость разработки с ReplayKit обычно ниже, но качество и задержка хуже прямого захвата.
Управление хранилищем: практические советы
Перед стартом записи проверяем доступное место:
let attrs = try FileManager.default.attributesOfFileSystem(forPath: NSHomeDirectory())
let freeSpace = attrs[.systemFreeSize] as? Int64 ?? 0
let estimatedSize = Int64(bitrate / 8) * expectedDurationSeconds
guard freeSpace > estimatedSize * 2 else { /* предупреждение */ }
Коэффициент 2 — запас под временные файлы AVAssetWriter и OS. При 4 Мбит/с час стрима занимает ~1.8 ГБ.
Сегментная запись (каждые 30 минут — новый файл) снижает риск потери данных при краше и упрощает последующую загрузку на сервер.
Таблица соотношения битрейта и размера файла
| Битрейт |
Длительность |
Размер файла |
| 2 Мбит/с |
1 час |
~900 МБ |
| 4 Мбит/с |
1 час |
~1.8 ГБ |
| 8 Мбит/с |
1 час |
~3.6 ГБ |
| Подход |
Задержка |
Качество |
Сложность |
| Прямой захват |
<100 мс |
Оригинальное |
Высокая |
| ReplayKit |
2–5 с |
Сжатое |
Низкая |
Как мы реализуем параллельную запись: пошагово
- Анализ требований: битрейт, разрешение, необходимость синхронизации A/V.
- Выбор стека: Swift 5.9 + VideoToolbox для iOS, Kotlin + MediaCodec для Android.
- Настройка
VTCompressionSession с параметрами для RTMP и локальной записи.
- Реализация fanout-очереди на двух
DispatchQueue.
- Синхронизация аудио и видео через общий clock.
- Интеграция с хранилищем и сегментацией.
- Тестирование на реальных устройствах (iPhone 14, Pixel 7, Samsung S23).
Что входит в работу
- Проектирование архитектуры и выбор оптимизированных параметров кодирования.
- Реализация параллельной записи с fanout и синхронизацией A/V.
- Управление хранилищем: проверка места, сегментирование, автоматическая очистка.
- Интеграция с вашим бэкендом (RTMP-сервер, облачное хранилище).
- Документация по интеграции и эксплуатации.
- Поддержка на этапе тестирования и выкладки в App Store / Google Play.
За время работы мы реализовали более 20 проектов с мобильным стримингом, включая записи прямых эфиров для крупных медиа. Гарантируем стабильность записи даже при нестабильной сети. Используем сертифицированные подходы (App Store Review Guidelines Section 4.2). Стоимость разработки варьируется, но инвестиции окупаются за счёт снижения расходов на пост-продакшн и повторные стримы.
Сроки и стоимость
Базовая параллельная запись (iOS, один поток): 1–1.5 недели. Полная реализация с синхронизацией A/V, управлением хранилищем, сегментацией, Android-поддержкой: 3–4 недели. Стоимость рассчитывается индивидуально. Свяжитесь с нами, чтобы получить консультацию и оценку вашего проекта. Закажите разработку под ключ с индивидуальным подходом.
Как выбрать подход к камере на мобильных платформах
Приложения, где пользователи снимают, слушают или смотрят, технически одни из самых требовательных. Мы сталкиваемся с этим каждый день. Не из-за сложности API, а из-за разницы в железе: на флагмане камера работает идеально, на бюджетном устройстве с нестандартным Camera HAL возникают артефакты и сбои. На iOS стабилизация одного поколения отличается от другого. Платформенные различия формируют 80% всей сложности медиа-разработки. Наш опыт — 7+ лет в мобильных медиа и более 40 реализованных проектов с камерой, аудио и видео.
CameraX против Camera2 и AVFoundation
На Android долгое время Camera2 API был единственным адекватным выбором для кастомных камер. Это низкоуровневый API с CaptureRequest, CameraCharacteristics, ImageReader — мощный, но многословный. Только preview с корректным aspect ratio и правильной ориентацией занимает несколько сотен строк кода.
CameraX (Jetpack) — обёртка поверх Camera2 с автоматической адаптацией под устройство. Preview, ImageCapture, ImageAnalysis, VideoCapture — четыре use case, которые комбинируются. Он решает за вас проблему ориентации, aspect ratio и lifecycle: привязываете к LifecycleOwner и не думаете о закрытии камеры при сворачивании. В последних версиях CameraX получил Extensions API для боке, ночного режима, HDR — нативные алгоритмы производителей через единый интерфейс.
Когда нужен Camera2 напрямую: RAW-съёмка через ImageFormat.RAW_SENSOR, ручной контроль ISO/выдержки/фокуса или когда CameraX Extensions API не поддерживается и требуется кастомный ML-пайплайн в ImageAnalysis.
На iOS AVFoundation — единственный путь для кастомной камеры. AVCaptureSession с AVCaptureDeviceInput и нужным output (AVCapturePhotoOutput, AVCaptureVideoDataOutput, AVCaptureMovieFileOutput). Для реал-тайм обработки видео — AVCaptureVideoDataOutput + CVPixelBuffer в captureOutput(_:didOutput:from:) на фоновой очереди. Именно тут CoreML-модели получают кадры для инференса.
Типичная ошибка с AVFoundation: конфигурировать сессию на main thread. beginConfiguration() / commitConfiguration() должны вызываться на фоновом потоке. Иначе preview фризит, пользователь видит заморозку интерфейса. Эта ошибка встречается в 70% проектов, которые мы аудировали.
Почему AudioFocus критичен для Android приложений
Аудио на мобильных платформах требует корректного управления жизненным циклом звука. AudioFocus — механизм координации между приложениями. AudioManager.requestAudioFocus() с OnAudioFocusChangeListener. Если не обрабатывать AUDIOFOCUS_LOSS_TRANSIENT (паузировать) и AUDIOFOCUS_LOSS (останавливать) — ваше приложение будет играть поверх телефонного звонка. Это гарантированный плохой отзыв в Google Play. Android Developer Guide: AudioFocus
На iOS AudioSession категории определяют поведение: playback — для плееров (продолжает играть при заблокированном экране), record — для записи с отключением других источников, playAndRecord — для голосовых сообщений. Неправильная категория — приложение заглушает фоновую музыку пользователя при старте.
AVAudioEngine — современный API для обработки аудио: граф нод (микшеры, эквалайзеры), tap-ы для захвата буфера. Для речи в реальном времени — SFSpeechRecognizer + inputNode.installTap.
На Android для записи с шумоподавлением — NoiseSuppressor.isAvailable() + create(audioRecord.audioSessionId). Работает не на всех устройствах, нужен fallback.
Видео: воспроизведение и стриминг
ExoPlayer (Media3) — стандарт для Android. Поддерживает HLS, DASH, SmoothStreaming, прогрессивное воспроизведение. DefaultTrackSelector с Parameters позволяет выбирать качество вручную или адаптивно. DRM через DefaultDrmSessionManager с Widevine L1/L3.
Проблема, с которой сталкиваются почти все: ExoPlayer в RecyclerView при быстром скролле. Нужен PlayerPool — пул переиспользуемых плееров. Без пула каждый новый экземпляр создаёт MediaCodec инстанс, что дорого и приводит к MediaCodec$CodecException: Error -19 на некоторых Android 10 устройствах при >3 одновременных инстансах.
AVPlayer / AVPlayerViewController на iOS — для воспроизведения. Для кастомного UI — AVPlayerLayer + собственные контролы. HLS работает нативно через AVPlayer(url:) с m3u8. FairPlay DRM требует серверной части: AVContentKeySession, CKC-ответ от KSM-сервера, делегат ресурсов.
Для Flutter — video_player как базовый слой, chewie для UI. Для серьёзных задач — platform channel к нативному ExoPlayer/AVPlayer (из-за DRM и субтитров).
| Протокол |
Задержка |
Применение |
| RTMP |
2–5 сек |
Стриминг на YouTube/Twitch |
| HLS |
6–30 сек |
VOD, широковещательный |
| DASH |
6–30 сек |
VOD с адаптивным битрейтом |
| WebRTC |
< 500 мс |
Видеозвонки, P2P |
| SRT |
1–4 сек |
Профессиональный стриминг |
WebRTC на мобильных — через нативные фреймворки или flutter_webrtc. Реальная сложность — не в самом протоколе, а в сигналинге и TURN-серверах. Без TURN клиенты за симметричными NAT не установят соединение — это примерно 15–20% трафика. Coturn — стандартный open-source сервер.
RTMP публикация на мобильных: LFLiveKit для iOS, HaishinKit как более современная альтернатива. На Android — rtmp-rtsp-stream-client-java или через FFmpeg с JNI. Последнее даёт максимальную гибкость, но бинарник растёт на 10–15 МБ.
Обработка медиа: компрессия и транскодирование
Видео в ProRes может занимать 6 ГБ/минуту. Перед загрузкой нужна компрессия. На iOS — AVAssetExportSession с пресетом 1920×1080 или кастомный AVVideoComposition. VideoToolbox для аппаратного кодирования H264/HEVC — быстрее и экономнее по батарее.
На Android — MediaCodec напрямую или Transformer (Media3) — высокоуровневый API для трансформаций (обрезка, ресайз, эффекты через GlEffectsFrameProcessor). Для изображений — BitmapFactory.Options.inSampleSize для даунсемплинга, Glide / Coil для кеширования. Coil на Coroutines хорошо вписывается в Compose. Загружать оригинал 12 МП в ImageView 200×200dp — классический OutOfMemoryError на устройствах с 2 ГБ RAM.
Как реализовать стриминг на мобильных устройствах: пошаговый план
- Определить требования: целевая задержка, количество одновременных пользователей, необходимость P2P.
- Выбрать протокол и стек: WebRTC для видеозвонков, RTMP/HLSLive для вещания.
- Настроить сигналинг (SIP, WebSocket, MQTT) и TURN-сервер.
- Реализовать публикацию/просмотр через нативный API или кроссплатформенный плагин.
- Провести тестирование на реальных устройствах с разными камерами и сетевыми условиями.
- Оптимизировать битрейт и разрешение в зависимости от пропускной способности.
Типичные ошибки при разработке медиа-функциональности
- Конфигурация AVFoundation сессии на главном потоке.
- Отсутствие обработки AudioFocus Loss на Android.
- Игнорирование
MediaCodec ограничений на дешёвых устройствах.
- Использование эмулятора для тестов камеры — эмулятор не воспроизводит проблемы HAL.
- Утечка памяти при пересоздании медиаплееров без пула.
Что входит в работу
| Deliverable |
Описание |
| Анализ требований |
Выбор стека, приоритетов, тестовых устройств |
| Проектирование |
Архитектура, диаграммы потоков данных, выбор API |
| Реализация |
Код с использованием выбранных инструментов |
| Интеграция с бэкендом |
GraphQL/REST, DRM, WebRTC сигналинг |
| Тестирование |
На реальных устройствах (не менее 5 моделей) |
| Документация |
API-документация, инструкция по сборке |
| Поддержка после релиза |
1 месяц инцидентной поддержки, обучение команды |
Процесс разработки медиафункциональности
Сложность нелинейна: базовое воспроизведение видео — 1–2 дня, кастомная камера с обработкой кадров и стримингом — 3–5 недель. Начинаем с прояснения требований: DRM, форматы, минимальная OS, поддержка фоновых режимов. Тестирование на железе обязательно — эмулятор не воспроизводит проблемы с Camera HAL, аппаратным кодеком и AudioFocus. Минимальный набор: последний iPhone, iPhone SE, флагман Samsung, бюджетный Android, Android Go (если целевая аудитория — развивающиеся рынки).
Сроки ориентировочно: от 5 рабочих дней (базовое воспроизведение) до 8 недель (комплексная камера со стримингом и DRM). Стоимость рассчитывается индивидуально после анализа ваших требований — свяжитесь с нами для консультации.
Фраза услуги: «Работа с медиа в мобильных приложениях» — это наш профиль. Каждый проект начинается с аудита текущей реализации, выявления узких мест и предложения оптимального стека.
Коммерческие сигналы: закажите аудит вашей медиа-функциональности, получите консультацию инженера без обязательств.