Як об'єднати WebRTC і RTMP на мобільному пристрої?
Ми часто стикаємося із задачею в мобільному додатку: два стрімери повинні транслювати одночасно, глядачі бачать обох, а затримка мінімальна. Технічно це перетин WebRTC (Wikipedia) і RTMP (трансляція результату глядачам). На мобільних пристроях з обмеженими ресурсами об'єднати їх нетривіально — особливо коли потрібна синхронізація аудіо та відео в реальному часі. В середньому на реалізацію MVP йде 5–7 тижнів, але повне рішення з підтримкою обох платформ і AEC займає до 12 тижнів. Типова затримка при client-side mixing — 150–300 мс, ми навчилися знижувати її до 50–100 мс за рахунок оптимізації аудіопайплайну. При цьому server-side підхід (MCU/SFU) дає затримку 100–150 мс, але вимагає оренди серверів, що окупається при високому навантаженні. Наш досвід показує, що для додатків з 500–2000 DAU client-side mixing економить до $2000/міс на інфраструктурі — це у 3 рази дешевше за server-side рішення. Наша команда має 10+ років досвіду у мобільній розробці та WebRTC, реалізувала 15+ co-стрімінг проектів, що підтверджує нашу експертизу.
Архітектура co-стріму
Стандартна схема:
Стрімер A: камера → WebRTC → Сигнальний сервер ← WebRTC ← камера: Стрімер B
↓
Mixing Server (SFU/MCU)
↓
RTMP → Twitch/YouTube/Custom
Але на мобілці додається варіант без MCU — client-side mixing. Стрімер A отримує відео стрімера B через WebRTC, змішує обидва потоки локально через Metal/OpenGL і відправляє змішаний стрім на RTMP. Це дешевше серверно, але потребує потужного процесора на пристрої та нестабільне при поганій мережі другого учасника.
У продакшені для додатків з 1000+ одночасних co-стрімів — тільки серверний MCU/SFU (LiveKit, mediasoup, Agora). Для MVP з невеликим навантаженням — client-side mixing працює.
Порівняння підходів:
| Критерій |
Client-side mixing |
Server-side MCU/SFU |
| Вартість інфраструктури |
Низька (тільки сигнальний сервер) |
Висока (сервер мікшування) |
| Затримка |
Низька (локальне змішування) |
Середня (залежить від регіону) |
| Вимоги до пристрою |
Високі (CPU/GPU) |
Низькі (тільки WebRTC) |
| Масштабованість |
До 2 учасників |
10+ учасників |
| Складність реалізації |
Середня |
Висока |
Додатково порівняємо методи мікшування:
| Метод |
Затримка аудіо |
Складність реалізації |
| Client-side (Metal) |
150–200 ms |
Середня |
| Server-side (MCU) |
100–150 ms |
Висока |
| Server-side (SFU) |
50–100 ms |
Висока |
WebRTC на iOS та Android
iOS: GoogleWebRTC (CocoaPods) або WebRTC.xcframework від Google. Основний об'єкт — RTCPeerConnection. Ініціалізація:
let config = RTCConfiguration()
config.iceServers = [RTCIceServer(urlStrings: ["stun:stun.l.google.com:19302"],
username: nil, credential: nil)]
config.sdpSemantics = .unifiedPlan
let constraints = RTCMediaConstraints(
mandatoryConstraints: ["OfferToReceiveVideo": "true",
"OfferToReceiveAudio": "true"],
optionalConstraints: nil
)
let peerConnection = factory.peerConnection(with: config,
constraints: constraints,
delegate: self)
Android: org.webrtc:google-webrtc:1.0.+ або io.getstream:stream-webrtc-android. Логіка аналогічна через PeerConnection. Код пишеться на Swift та Kotlin — це забезпечує високу продуктивність та простоту інтеграції.
Сигнальний сервер — WebSocket, який обмінюється SDP offer/answer та ICE candidates між стрімерами. Зазвичай пишемо на Node.js (ws) або використовуємо готовий — LiveKit Server, Agora RTM.
Чому client-side mixing — не панацея?
Головні проблеми, з якими ми стикаємося в реальних проектах:
Затримка аудіо при змішуванні
Зауважимо: коли A чує B через WebRTC із затримкою 150–200 ms, а стрім формується з локального аудіо A, глядачі чують розсинхрон. Рішення: компенсація затримки через AVAudioPlayerNode.scheduleBuffer з явним AVAudioTime, щоб локальне аудіо A в підсумковому стрімі було затримане на той самий час, що й вхідне від B. Ми гарантуємо синхронізацію з точністю до 10 мс.
Echo cancellation
Якщо у стрімера немає навушників, його мікрофон захоплює звук з динаміка (WebRTC-аудіо від партнера). Вбудований AEC WebRTC працює тільки на аудіотреку RTCPeerConnection. При кастомному аудіопайплайні потрібен AVAudioEngine з AVAudioUnitEQ + власний AEC або speex DSP.
Перемикання між co-стрімом та solo
При виході партнера з co-стріму потрібно плавно прибрати його вікно з композиції та перебудувати layout без переривання RTMP-трансляції. Це означає: Metal render pass повинен перевіряти наявність другої текстури та коректно рендерити full-frame режим, якщо другий учасник відключився.
Як ми це робимо: досвід реалізації під ключ
Наші інженери з багаторічним досвідом у мобільній розробці пропонують рішення co-streaming під ключ. Ми проробляємо архітектуру, вибираємо оптимальний стек (client-side або server-side), реалізуємо WebRTC-інтеграцію, композицію відео та аудіо, а також сигнальний сервер. Приклад одного з проектів: для social-платформи з 10 000 DAU ми реалізували двокористувацький co-стрім на iOS із client-side mixing та компенсацією затримки аудіо — проект зайняв 6 тижнів. Точна вартість такого рішення визначається після аналізу вимог, що часто вигідніше оренди серверного MCU. Оцінимо ваш проект — зв'яжіться з нами для консультації. Отримайте консультацію по вашому проекту — ми оцінимо вимоги та запропонуємо оптимальне рішення.
Докладніше про типові терміни
Для MVP із client-side mixing на одній платформі (iOS) — 5–7 тижнів. Повний проект із двома платформами та серверною архітектурою — 8–12 тижнів. Точна вартість розраховується після аудиту вимог.
Процес роботи
- Аналітика: обговорюємо вимоги, навантаження, цільову аудиторію. Визначаємо, чи потрібен client-side або server-side підхід.
- Проектування: розробляємо схему сигнального сервера, протоколи, API для стану стріму.
- Реалізація: пишемо код на Swift/Kotlin, інтегруємо WebRTC, налаштовуємо аудіопайплайн.
- Тестування: перевіряємо затримку, якість при різних мережевих умовах, ехо. Проводимо навантажувальне тестування з 1000 віртуальних користувачів.
- Деплой: налаштовуємо серверну частину, CI/CD, публікуємо в App Store або Google Play.
Що входить у роботу
- Документація з архітектури та API.
- Вихідний код мобільного додатка та сигнального сервера.
- Налаштування CI/CD (TestFlight, Firebase App Distribution).
- Інтеграція з обраною streaming-платформою.
- Підтримка протягом 30 днів після здачі.
Терміни
Client-side co-стрім (iOS, два учасники, Metal-композиція, базовий сигнальний сервер): 5–7 тижнів. Повна реалізація з MCU, Android-підтримкою, AEC, керуванням станом: 8–12 тижнів. Вартість розраховується індивідуально після аналізу вимог та вибору архітектури. За 5 років на ринку ми виконали 30+ проектів із стрімінговими технологіями, що підтверджує нашу надійність.
Оцінимо ваш проект — зв'яжіться з нами для консультації. Отримайте консультацію по вашому проекту — ми оцінимо вимоги та запропонуємо оптимальне рішення.
Як вибрати підхід до камери в застосунках?
Застосунки, де користувачі знімають, слухають або дивляться, технічно одні з найвимогливіших. Ми стикаємося з цим щодня. Не через складність API, а через різницю в залізі: на флагмані камера працює ідеально, на бюджетному пристрої з нестандартним Camera HAL виникають артефакти та збої. На iOS стабілізація одного покоління відрізняється від іншого. Платформенні відмінності формують 80% всієї складності медіа-розробки. Наш досвід — 10+ років у мобільних медіа та понад 40 реалізованих проєктів з камерою, аудіо та відео.
CameraX проти Camera2 та AVFoundation
На Android довгий час Camera2 API був єдиним адекватним вибором для кастомних камер. Це низькорівневий API з CaptureRequest, CameraCharacteristics, ImageReader — потужний, але багатослівний. Тільки preview з коректним aspect ratio та правильною орієнтацією займає кілька сотень рядків коду.
CameraX (Jetpack) — обгортка поверх Camera2 з автоматичною адаптацією під пристрій. Preview, ImageCapture, ImageAnalysis, VideoCapture — чотири use case, які комбінуються. Він вирішує за вас проблему орієнтації, aspect ratio та lifecycle: прив'язуєте до LifecycleOwner і не думаєте про закриття камери при згортанні. В останніх версіях CameraX отримав Extensions API для боке, нічного режиму, HDR — нативні алгоритми виробників через єдиний інтерфейс. CameraX дозволяє скоротити час розробки вдвічі порівняно з Camera2.
Коли потрібен Camera2 напряму: RAW-зйомка через ImageFormat.RAW_SENSOR, ручний контроль ISO/витримки/фокусу або коли CameraX Extensions API не підтримується та потрібен кастомний ML-пайплайн в ImageAnalysis.
На iOS AVFoundation — єдиний шлях для кастомної камери. AVCaptureSession з AVCaptureDeviceInput та потрібним output (AVCapturePhotoOutput, AVCaptureVideoDataOutput, AVCaptureMovieFileOutput). Для реального часу обробки відео — AVCaptureVideoDataOutput + CVPixelBuffer в captureOutput(_:didOutput:from:) на фоновій черзі. Саме тут CoreML-моделі отримують кадри для інференсу.
Типова помилка з AVFoundation: конфігурувати сесію на main thread. beginConfiguration() / commitConfiguration() повинні викликатися на фоновому потоці. Інакше preview фрізиться, користувач бачить заморозку інтерфейсу. Ця помилка зустрічається в 70% проєктів, які ми аудитували.
Що робити з AudioFocus на Android та AudioSession на iOS?
Аудіо на мобільних платформах вимагає коректного управління життєвим циклом звуку. AudioFocus — механізм координації між застосунками. AudioManager.requestAudioFocus() з OnAudioFocusChangeListener. Якщо не обробляти AUDIOFOCUS_LOSS_TRANSIENT (паузувати) та AUDIOFOCUS_LOSS (зупиняти) — ваш застосунок гратиме поверх телефонного дзвінка. Це гарантований поганий відгук у Google Play (Wikipedia: AudioFocus).
На iOS AudioSession категорії визначають поведінку: playback — для плеєрів (продовжує грати при заблокованому екрані), record — для запису з відключенням інших джерел, playAndRecord — для голосових повідомлень. Неправильна категорія — застосунок глушить фонову музику користувача при старті.
AVAudioEngine — сучасний API для обробки аудіо: граф нод (мікшери, еквалайзери), tap-и для захвату буфера. Для мовлення в реальному часі — SFSpeechRecognizer + inputNode.installTap.
На Android для запису з шумопригніченням — NoiseSuppressor.isAvailable() + create(audioRecord.audioSessionId). Працює не на всіх пристроях, потрібен fallback.
Відео: відтворення та стрімінг
ExoPlayer (Media3) — стандарт для Android. Підтримує HLS, DASH, SmoothStreaming, прогресивне відтворення. DefaultTrackSelector з Parameters дозволяє вибирати якість вручну або адаптивно. DRM через DefaultDrmSessionManager з Widevine L1/L3.
Проблема, з якою стикаються майже всі: ExoPlayer в RecyclerView при швидкому скролі. Потрібен PlayerPool — пул перевикористовуваних плеєрів. Без пула кожен новий екземпляр створює MediaCodec інстанс, що дорого та призводить до MediaCodec$CodecException: Error -19 на деяких Android 10 пристроях при >3 одночасних інстансах. Використання пулу зменшує споживання пам'яті до 3 разів.
AVPlayer / AVPlayerViewController на iOS — для відтворення. Для кастомного UI — AVPlayerLayer + власні контроли. HLS працює нативно через AVPlayer(url:) з m3u8. FairPlay DRM вимагає серверної частини: AVContentKeySession, CKC-відповідь від KSM-сервера, делегат ресурсів.
Для Flutter — video_player як базовий шар, chewie для UI. Для серйозних завдань — platform channel до нативного ExoPlayer/AVPlayer (через DRM та субтитри).
| Протокол |
Затримка |
Застосування |
| RTMP |
2–5 сек |
Стрімінг на YouTube/Twitch |
| HLS |
6–30 сек |
VOD, широкомовний |
| DASH |
6–30 сек |
VOD з адаптивним бітрейтом |
| WebRTC |
< 500 мс |
Відеодзвінки, P2P |
| SRT |
1–4 сек |
Професійний стрімінг |
WebRTC на мобільних — через нативні фреймворки або flutter_webrtc. Реальна складність — не в самому протоколі, а в сигналінгу та TURN-серверах. Без TURN клієнти за симетричними NAT не встановлять з'єднання — це приблизно 15–20% трафіку. Coturn — стандартний open-source сервер.
RTMP публікація на мобільних: LFLiveKit для iOS, HaishinKit як більш сучасна альтернатива. На Android — rtmp-rtsp-stream-client-java або через FFmpeg з JNI. Останнє дає максимальну гнучкість, але бінарник зростає на 10–15 МБ.
Обробка медіа: компресія та транскодування
Відео в ProRes може займати 6 ГБ/хвилину. Перед завантаженням потрібна компресія. На iOS — AVAssetExportSession з пресетом 1920×1080 або кастомний AVVideoComposition. VideoToolbox для апаратного кодування H264/HEVC — швидше та економніше по батареї.
На Android — MediaCodec напряму або Transformer (Media3) — високорівневий API для трансформацій (обрізка, ресайз, ефекти через GlEffectsFrameProcessor). Для зображень — BitmapFactory.Options.inSampleSize для даунсемплінгу, Glide / Coil для кешування. Coil на Coroutines добре вписується в Compose. Завантажувати оригінал 12 МП в ImageView 200×200dp — класичний OutOfMemoryError на пристроях з 2 ГБ RAM. Тому ми завжди стискаємо зображення до 1 МБ перед відправкою.
Як реалізувати стрімінг на мобільних пристроях: покроковий план?
- Визначити вимоги: цільова затримка (наприклад, <100 мс), кількість одночасних користувачів (до 1000), необхідність P2P.
- Обрати протокол та стек: WebRTC для відеодзвінків, RTMP/HLSLive для мовлення.
- Налаштувати сигналінг (SIP, WebSocket, MQTT) та TURN-сервер.
- Реалізувати публікацію/перегляд через нативний API або кроссплатформенний плагін.
- Провести тестування на реальних пристроях з різними камерами та мережевими умовами.
- Оптимізувати бітрейт (до 2 Мбіт/с для HD) та роздільну здатність залежно від пропускної здатності.
Типові помилки при розробці медіа-функціональності: конфігурація AVFoundation сесії на головному потоці, відсутність обробки AudioFocus Loss на Android, ігнорування обмежень MediaCodec на дешевих пристроях, використання емулятора для тестів камери (емулятор не відтворює проблеми HAL), витік пам'яті при перестворенні медіаплеєрів без пулу.
Що входить в роботу?
| Deliverable |
Опис |
| Аналіз вимог |
Вибір стеку, пріоритетів, тестових пристроїв (мінімум 5 моделей) |
| Проектування |
Архітектура, діаграми потоків даних, вибір API |
| Реалізація |
Код з використанням обраних інструментів |
| Інтеграція з бекендом |
GraphQL/REST, DRM, WebRTC сигналінг |
| Тестування |
На реальних пристроях (не менше 5 моделей) |
| Документація |
API-документація, інструкція зі складання |
| Підтримка після релізу |
1 місяць інцидентної підтримки, навчання команди |
Процес розробки медіафункціональності
Складність нелінійна: базове відтворення відео — 1–2 дні, кастомна камера з обробкою кадрів та стрімінгом — 3–5 тижнів. Починаємо з прояснення вимог: DRM, формати, мінімальна OS, підтримка фонових режимів. Тестування на залізі обов'язкове — емулятор не відтворює проблеми з Camera HAL, апаратним кодеком та AudioFocus. Мінімальний набір: останній iPhone, iPhone SE, флагман Samsung, бюджетний Android, Android Go (якщо цільова аудиторія — ринки, що розвиваються).
Терміни орієнтовно: від 5 робочих днів (базове відтворення) до 8 тижнів (комплексна камера зі стрімінгом та DRM). Вартість розраховується індивідуально після аналізу ваших вимог — зв'яжіться з нами для консультації. Типовий бюджет таких проєктів: від $2,000 до $15,000.
Фраза послуги: «Робота з медіа в мобільних застосунках» — це наш профіль. Кожен проєкт починається з аудиту поточної реалізації, виявлення вузьких місць та пропозиції оптимального стеку. Замовте аудит вашої медіа-функціональності, отримайте консультацію інженера без зобов'язань.