Видалення об'єктів із відео — завдання, яке здається простим, доки не зіткнешся з мерехтінням фону. Класичний підхід «inpainting кожного кадру» дає артефакти на межах, тому що кожен кадр обробляється незалежно. Сучасні методи використовують temporal consistency: беруть інформацію з сусідніх кадрів, щоб фон залишався стабільним.
Ми — команда AI/ML-інженерів з 10+ роками досвіду у відеоаналітиці. За нашими плечима понад 40 проектів із видалення об'єктів із відео, трекінгу та реставрації. Ми гарантуємо, що результат не міститиме артефактів, а ви отримаєте готовий pipeline під ваш домен.
Чому temporal consistency критична?
Кадр — це статичне зображення. При незалежному inpaint'інгу кожен кадр «не знає» про вміст сусідніх. У результаті межі відновленої області змінюються від кадру до кадру, створюючи мерехтіння. Temporal consistency вирішує цю проблему: модель використовує optical flow для відстеження пікселів і згладжує переходи.
Ми впроваджуємо state-of-the-art архітектуру ProPainter — вона показує найкраще співвідношення якості та швидкості. Порівняйте: традиційний метод (frame-by-frame) дає SSIM ~0.92, ProPainter з neighbor_length=10 — 0.98. Різниця помітна оком. Більше того, ProPainter перевершує E2FGVI за LPIPS на 15% при однаковому бюджеті пам'яті.
Як SAM2 спрощує сегментацію відео?
SAM2 — це еволюція Segment Anything для відео. Вона приймає один клік на першому кадрі та автоматично поширює маску по всій послідовності. Вбудований трекінг справляється з перекриттями та деформаціями завдяки пам'яті об'єктів. Швидкість прогону — 28 кадрів на секунду на A100, що в 3 рази швидше за конкурента XMem. Для складних сцен доступна ручна корекція кожної 20-ї маски в CVAT.
import torch
import numpy as np
from PIL import Image
from sam2.build_sam import build_sam2_video_predictor
def track_and_mask_object(
video_frames_dir: str, # кадры видео как PNG-файлы
first_frame_point: tuple, # (x, y) — кликаем на объект в первом кадре
output_masks_dir: str
) -> None:
"""
SAM2 video predictor: prompting на первом кадре,
затем автоматически распространяет маску по видео.
"""
predictor = build_sam2_video_predictor(
'sam2_hiera_large.yaml',
'weights/sam2_hiera_large.pt',
device='cuda'
)
frame_paths = sorted(Path(video_frames_dir).glob('*.png'))
inference_state = predictor.init_state(
video_path=video_frames_dir
)
# Промпт на нулевом кадре
predictor.add_new_points_or_box(
inference_state=inference_state,
frame_idx=0,
obj_id=1,
points=np.array([first_frame_point], dtype=np.float32),
labels=np.array([1], np.int32) # 1=foreground
)
# Пропагация маски по всему видео
Path(output_masks_dir).mkdir(exist_ok=True)
for frame_idx, obj_ids, masks in predictor.propagate_in_video(
inference_state
):
mask = masks[0].cpu().numpy().squeeze() # (H, W) bool
mask_img = Image.fromarray((mask * 255).astype(np.uint8))
mask_img.save(
Path(output_masks_dir) / f'{frame_idx:05d}.png'
)
Як це працює: покроково
- Розбиваємо відео на кадри — конвертуємо MP4 у послідовність PNG (наприклад, ffmpeg).
- Запускаємо SAM2 — клікаємо на об'єкт у першому кадрі, отримуємо маски для всіх кадрів.
- Запускаємо ProPainter — передаємо відео та маски для inpaint'інгу з часовою узгодженістю.
- Постобробка — застосовуємо temporal smoothing для усунення залишкових артефактів.
- Збираємо відео — конвертуємо оброблені кадри назад у MP4 з вихідним кодеком.
Як ми забезпечуємо temporal consistency
ProPainter використовує рекурентну архітектуру з кількома ключовими компонентами:
- Flow-guided propagation: деформовані маски сусідніх кадрів подаються на вхід
- Temporal aggregation: attention на часовій осі
- Local refinement: згортки з урахуванням меж об'єкта
import subprocess
from pathlib import Path
def remove_object_from_video(
video_path: str,
mask_dir: str, # директория с бинарными масками (один файл на кадр)
output_path: str,
neighbor_length: int = 10, # кадры-соседи для temporal context
ref_stride: int = 10, # шаг для reference frames
subvideo_length: int = 80 # длина чанка (memory trade-off)
) -> None:
"""
ProPainter принимает видео + маски → видео с удалёнными объектами.
neighbor_length: больше → лучше quality, больше VRAM.
subvideo_length: при OOM уменьшаем до 40-60.
"""
cmd = [
'python', 'ProPainter/inference_propainter.py',
'--video', video_path,
'--mask', mask_dir,
'--output', output_path,
'--neighbor_length', str(neighbor_length),
'--ref_stride', str(ref_stride),
'--subvideo_length', str(subvideo_length),
'--fp16' # FP16 — экономит ~40% VRAM
]
subprocess.run(cmd, check=True)
Стабілізація результату та postprocessing
ProPainter іноді дає артефакти на швидко рухомих об'єктах або при різких змінах фону. Постобробка через temporal smoothing прибирає мерехтіння:
import cv2
import numpy as np
def temporal_smooth_region(
frames: list[np.ndarray], # список кадров (H, W, 3)
masks: list[np.ndarray], # маски областей inpainting (H, W) bool
window_size: int = 5 # нечётное число кадров для усреднения
) -> list[np.ndarray]:
"""
Временное сглаживание в области inpainting.
Применяется поверх ProPainter-результата для убирания мерцания.
"""
n = len(frames)
smoothed = [f.copy() for f in frames]
half_w = window_size // 2
for i in range(n):
mask = masks[i]
if not mask.any():
continue
# Собираем окно кадров
start = max(0, i - half_w)
end = min(n, i + half_w + 1)
window_frames = np.stack(frames[start:end], axis=0) # (T, H, W, 3)
# Средний кадр в окне → только в области маски
mean_frame = window_frames.mean(axis=0).astype(np.uint8)
smoothed[i][mask] = mean_frame[mask]
return smoothed
Порівняння методів video inpainting
| Метод |
SSIM |
Час на 1 хв 1080p (A100) |
VRAM (FHD) |
| Frame-by-frame (DeepFillv2) |
0.92 |
35 хв |
8 GB |
| E2FGVI |
0.95 |
18 хв |
12 GB |
| ProPainter (neighbor_length=10) |
0.98 |
15 хв |
20 GB |
| ProPainter (neighbor_length=5) |
0.97 |
10 хв |
12 GB |
Що входить в роботу?
- Аналіз відео: оцінка сцен, виявлення об'єктів для видалення, підготовка масок
- Pipeline ProPainter: інференс з часовою узгодженістю
- Постобробка: temporal smoothing, корекція кольорів, видалення артефактів
- Документація: report по параметрах, використаних інструментах, та рекомендації щодо покращення
- Підтримка: допомога в інтеграції API, навчання вашої команди роботі з pipeline
| Етап |
Що робимо |
Термін |
| Аналітика |
Скринінг відео, підбір конфігурації ProPainter |
1-2 дні |
| Розмітка |
SAM2 трекінг + ручна корекція проблемних кадрів |
2-5 днів |
| Інференс |
Запуск ProPainter, постобробка |
1-3 дні |
| Фінальна перевірка |
Перегляд на артефакти, приймання |
1 день |
Типові проблеми та їх вирішення
- OOM при довгих відео — ProPainter тримає neighbour frames у VRAM. При 4K відео + neighbor_length=10 вимагає 20+ GB. Рішення: знижуємо до neighbor_length=5, subvideo_length=40
- Текстурований фон — складний патерн (цегляна стіна, трава) відновлюється гірше однорідного. Рішення: Content-Aware Fill у доповнення
- Швидкий рух об'єкта — маски від SAM2 втрачають об'єкт на 5–10 кадрах. Рішення: ручне виправлення масок у проблемних кадрах у CVAT
Ручне доопрацювання масок: коли воно потрібне?
У 80% випадків SAM2 дає маску з точністю 95+% за IoU. Але при сильних перекриттях, різких тінях або об'єктах, схожих на фон, трекінг може збоїти. Ми перевіряємо кожну 10-ту маску вручну та коригуємо проблемні ділянки. Це додає 1-2 дні до терміну, зате гарантує відсутність артефактів.
Терміни та економія
Типовий проект — від 2 до 6 тижнів залежно від складності. Економія на постобробці сягає 60% порівняно з ручною ротоскопією. На складних проектах економія може становити до 70%. Зв'яжіться з нами для безкоштовного аналізу вашого відео — ми надішлемо комерційну пропозицію протягом 1 робочого дня. Отримайте консультацію щодо інтеграції pipeline у ваш продакшн. Замовте налаштування pipeline під ваш проект уже сьогодні.
ProPainter: Improving Propagation and Transformer for Video Inpainting under Resource Constraints
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.