Як досягти 30 FPS в AI-сегментації на мобільних пристроях
Уявіть: відеодзвінок з розмитим фоном, але замість плавної картинки — гальма та артефакти. Або додаток доповненої реальності, який не встигає за рухами користувача. Це типові наслідки поганої оптимізації AI-сегментації. Ми часто стикаємося із запитами на real-time відеосегментацію. Це коли додаток розуміє, що в кадрі: людина, фон, машина, дорога, і робить це на кожному кадрі з частотою 15–30 FPS. Зробити «працює на демо» нескладно. Зробити «не гріється, не лагає, працює на iPhone XR» — потребує серйозної роботи з оптимізацією. Правильний вибір моделі та грамотний пайплайн обробки — ключові фактори успішного проєкту. Ключові фактори продуктивності — це inference latency, throughput, та оптимізація dtype (FP16 vs FP32). Ми також застосовуємо pruning, quantization та knowledge distillation для зменшення розміру моделі. Використання depthwise separable convolutions дозволяє знизити кількість параметрів у 5 разів без значної втрати якості.
Як вибрати модель для сегментації?
Семантична сегментація — кожен піксель належить до класу (фон, людина, автомобіль). Застосування: заміна фону на відеодзвінках, AR-ефекти, аналіз дорожньої обстановки. Instance сегментація — окрема маска на кожен об'єкт одного класу (три машини — три маски). Застосування: підрахунок об'єктів, трекінг. Panoptic сегментація — комбінація. Важче, на мобільних використовується рідко.
| Модель | Роздільна здатність | FPS (CoreML) | Якість |
|---|---|---|---|
| MobileNetV3-DeepLabV3 | 513×513 | 22–28 | Середня |
| EfficientPS-lite | 640×360 | 18–24 | Добра |
| YOLOv8n-seg | 640×640 | 20–30 | Добра |
| Segment Anything (SAM-mobile) | 1024×1024 | 3–5 | Відмінна |
YOLOv8n-seg краще за MobileNetV3 в 2 рази за якістю при схожій швидкості. EfficientPS-lite працює на 30% швидше за MobileNetV3 на Android, а при використанні GPU – в 1.5 рази швидше завдяки оптимізованій архітектурі. SAM — тільки для інтерактивної сегментації, для реального часу не годиться.
Чому продуктивність критична?
Мобільні GPU обмежені в тепловиділенні та енергоспоживанні. Наївна реалізація швидко призводить до перегріву та падіння FPS. Оптимізація починається з вибору моделі: легкі архітектури (MobileNetV3, YOLOv8n-seg) дають 20–30 FPS на сучасних чипах, але потребують грамотного пайплайну. Згідно з документацією Core ML, правильне налаштування Metal рендеру знижує навантаження на CPU на 40%.
Як оптимізувати iOS пайплайн?
class RealtimeSegmentationProcessor {
private let model: VNCoreMLModel
private let processQueue = DispatchQueue(label: "segmentation.process", qos: .userInteractive)
// Frame skipping: обробляємо кожен N-й кадр
private var frameCounter = 0
private let processEveryNFrames = 2 // 30fps камера → 15fps обробка
func captureOutput(_ output: AVCaptureOutput,
didOutput sampleBuffer: CMSampleBuffer,
from connection: AVCaptureConnection) {
frameCounter += 1
guard frameCounter % processEveryNFrames == 0 else { return }
guard let pixelBuffer = CMSampleBufferGetImageBuffer(sampleBuffer) else { return }
processQueue.async { [weak self] in
self?.runSegmentation(on: pixelBuffer)
}
}
private func runSegmentation(on pixelBuffer: CVPixelBuffer) {
let request = VNCoreMLRequest(model: model) { [weak self] req, _ in
guard let observation = req.results?.first as? VNCoreMLFeatureValueObservation,
let maskArray = observation.featureValue.multiArrayValue else { return }
let mask = self?.processMask(maskArray)
DispatchQueue.main.async {
self?.delegate?.didUpdateSegmentationMask(mask)
}
}
// Важно: pixelBuffer має бути у правильному форматі
request.imageCropAndScaleOption = .scaleFill
let handler = VNImageRequestHandler(cvPixelBuffer: pixelBuffer,
orientation: .right) // landscape orientation
try? handler.perform([request])
}
private func processMask(_ array: MLMultiArray) -> SegmentationMask {
// Конвертація MLMultiArray → CVPixelBuffer для рендеру
// Shape: [numClasses, height, width]
let numClasses = array.shape[0].intValue
let height = array.shape[1].intValue
let width = array.shape[2].intValue
// Argmax по класах для кожного пікселя → label map
var labelMap = [UInt8](repeating: 0, count: height * width)
for y in 0..<height {
for x in 0..<width {
var maxClass = 0
var maxVal: Float = -Float.infinity
for c in 0..<numClasses {
let val = array[[c, y, x] as [NSNumber]].floatValue
if val > maxVal { maxVal = val; maxClass = c }
}
labelMap[y * width + x] = UInt8(maxClass)
}
}
return SegmentationMask(labels: labelMap, width: width, height: height,
classColors: Self.classColorMap)
}
}
Як Metal прискорює рендер маски?
Наївний підхід — малювати маску в CPU loop — дає 3–5 FPS на рендері. Правильно — Metal / OpenGL ES. Metal шейдер накладає маску на GPU без участі CPU, що забезпечує стабільні 30 FPS навіть на iPhone 11.
// Metal шейдер для накладання маски на відео
// Входи: videoTexture (YCbCr), maskTexture (label map), colorLUT (клас→колір)
fragment float4 segmentationOverlay(
VertexOut in [[stage_in]],
texture2d<float> videoTexture [[texture(0)]],
texture2d<uint> maskTexture [[texture(1)]],
texture1d<float> colorLUT [[texture(2)]],
constant OverlayParams& params [[buffer(0)]]
) {
float2 uv = in.texCoords;
float4 videoColor = videoTexture.sample(sampler, uv);
uint classLabel = maskTexture.sample(nearestSampler, uv).r;
if (classLabel == 0) { return videoColor; } // фон — без змін
float4 maskColor = colorLUT.sample(sampler, float(classLabel) / float(params.numClasses));
return mix(videoColor, maskColor, params.overlayAlpha); // blending
}
| Платформа | Механізм рендеру | FPS (на пристроях середнього сегменту) |
|---|---|---|
| iOS (Metal) | GPU compute + shader | 28–30 |
| Android (MediaPipe+OpenGL) | GPU delegate + overlay | 25–30 |
Як замінити фон на Android за допомогою MediaPipe?
Для відеодзвінків популярна бінарна сегментація (людина / фон). Ми використовуємо MediaPipe Selfie Segmentation — готове рішення, оптимізоване саме для цього:
// Android: MediaPipe Selfie Segmentation
val options = ImageSegmenterOptions.builder()
.setBaseOptions(BaseOptions.builder()
.setModelAssetPath("selfie_segmentation.tflite")
.setDelegate(Delegate.GPU)
.build())
.setRunningMode(RunningMode.LIVE_STREAM)
.setResultListener { result, _ ->
val confidenceMask = result.confidenceMasks?.get(0)
updateBackground(confidenceMask)
}
.build()
val segmenter = ImageSegmenter.createFromOptions(context, options)
Delegate.GPU принципово: на CPU той самий MediaPipe дає 8–12 FPS, на GPU — 25–30 FPS. Для додаткового прискорення використовуйте Vulkan compute shaders, що дозволяють знизити затримки ще на 15%.
Процес роботи: від ідеї до продакшену
- Аналіз задачі — визначаємо класи об'єктів, target-пристрої, вимоги до FPS.
- Вибір моделі — тестуємо 3–5 моделей на реальних девайсах, заміряємо швидкість та mIoU.
- Оптимізація пайплайну — налаштування frame skipping, Metal рендер, TFLite GPU delegate, INT8 quantization.
- Інтеграція — вбудовуємо в додаток, обробка помилок (перехід на CPU при троттлінгу).
- QA та деплой — навантажувальне тестування, App Store / Google Play реліз.
Що входить в роботу
- Підбір та калібрування моделі під ваші дані.
- Реалізація пайплайну захоплення та обробки кадрів.
- GPU-рендер маски (Metal на iOS, OpenGL/Vulkan на Android).
- Документація по інтеграції та супровід.
- Підтримка протягом 30 днів після релізу.
- Пропонуємо інтеграцію під ключ. Надішліть нам технічне завдання для безкоштовної оцінки.
Терміни та вартість
Базова сегментація одного класу (наприклад, людина) з готовою моделлю — від 1 тижня. Вартість базової сегментації становить від $500, що дозволяє заощадити до 40% порівняно з наймом окремого фахівця. Кастомна мультикласова сегментація з Metal/GPU рендером та підтримкою iOS + Android — від 2 до 4 тижнів, вартість — від $2000. Вартість розраховується індивідуально після оцінки вашого проєкту. Пишіть нам для консультації.
У нас за плечима 5 років досвіду в мобільній розробці та понад 50 проєктів з AI на борту. Ми гарантуємо стабільні 30 FPS на пристроях не старше iPhone XR та Samsung S10. Зв'яжіться з нами для технічної консультації та точного розрахунку. Замовте пілотний проєкт, щоб оцінити якість на реальних даних.







