AI-ротоскопінг: автоматичне виділення об'єктів на відео

Ручний ротоскопінг 4-хвилинної сцени — це 5 760 кадрів при 24fps. Досвідчений спеціаліст закриває 30–60 кадрів на день, перетворюючи епізод на 3–6 місяців роботи. Ми автоматизуємо цей процес за допомогою ШІ, скорочуючи терміни до тижня. Автоматизація скорочує час у 10–30 разів порівняно з ручним рот

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1440
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Ручний ротоскопінг 4-хвилинної сцени — це 5 760 кадрів при 24fps. Досвідчений спеціаліст закриває 30–60 кадрів на день, перетворюючи епізод на 3–6 місяців роботи. Ми автоматизуємо цей процес за допомогою ШІ, скорочуючи терміни до тижня. Автоматизація скорочує час у 10–30 разів порівняно з ручним ротоскопінгом. Наш AI-ротоскопінг поєднує SAM 2 для відеосегментації, RVM для video matting, temporal smoothing на основі оптичного потоку та alpha matting для субпіксельної точності. Наприклад, для 10-хвилинного ролика економія складає до 100 000 грн. За час роботи (5 років на ринку) оброблено понад 50 проєктів, включаючи повнометражні фільми та рекламні ролики. Клієнти отримують економію до 500 000 грн на великих проєктах — це до 70% бюджету на ротоскопінгу.

Як працює AI-ротоскопінг?

AI-ротоскопіювання — автоматичне виділення об'єктів на відео (людей, автомобілів, тварин) за допомогою моделей комп'ютерного зору. На відміну від ручного ротоскопінгу, де кожен кадр обводиться вручну, ШІ-моделі сегментують об'єкт і відстежують його рух. Це незамінно для постпродакшну: заміна фону, додавання ефектів, ізоляція об'єкта для compositing. Технологія підходить для будь-яких сцен: від простих (статична камера, чіткий контур) до складних (швидкий рух, розвіяне волосся, натовп). Для оцінки якості використовуємо метрики IoU та MSE між масками, а також perceptual metrics LPIPS.

Технічні деталі

Сучасний підхід — не просто сегментація по кадрах, а трекінг маски в часі з temporal consistency. Ключові інструменти:

SAM 2 (Segment Anything Model 2) від Meta — прямо створений для відеосегментації. Задаєш точку або bounding box на першому кадрі, модель пропагує маску через весь ролик з урахуванням руху. На практиці: точність зберігається на 80–120 кадрах без додаткових промптів, далі потрібна корекція. Memory module всередині SAM 2 тримає контекст попередніх кадрів. SAM 2 у 10 разів швидше за ручну сегментацію.

import torch from sam2.build_sam import build_sam2_video_predictor predictor = build_sam2_video_predictor( "sam2_hiera_large.yaml", "sam2_hiera_large.pt", device="cuda" ) with torch.inference_mode(), torch.autocast("cuda", dtype=torch.bfloat16): state = predictor.init_state(video_path="scene_001.mp4") # Задаємо точку на акторі в кадрі 0 _, _, masks = predictor.add_new_points_or_box( state, frame_idx=0, obj_id=1, points=[[540, 380]], labels=[1] ) # Пропагація маски по всьому відео for frame_idx, obj_ids, masks in predictor.propagate_in_video(state): save_mask(frame_idx, masks) 

RVM (Robust Video Matting) — спеціалізований на відділенні людини від фону, працює в реальному часі (30fps на RTX 3080). Кращий за SAM 2 для сцен з розвіяним волоссям і напівпрозорими елементами.

Технічні вимоги до обладнання GPU з 16+ ГБ VRAM (NVIDIA RTX 3080 або A4000). Для продакшену – сервери з кількома GPU або хмарні рішення SageMaker, Vertex AI.
Модель Тип Точність Швидкість Підходить для
SAM 2 Відеосегментація Висока (субпіксельна) ~10fps (RTX 4090) Складні сцени, будь-які об'єкти
RVM Video Matting Дуже висока (волосся, дим) 30fps (RTX 3080) Люди, напівпрозорі елементи
Runway ML ШІ-асист Середня Миттєво Швидкі чернетки

Як усунути мерехтіння маски?

Відзначимо: коли сегментуєш кадр за кадром незалежно, маска «мерехтить» — краї стрибають на 2–5 пікселів між кадрами. У готовому compositing це виглядає як тремтячий контур. Рішення — temporal smoothing:

  1. Optical flow консистентність: застосовуємо RAFT або FlowFormer для обчислення оптичного потоку між кадрами, маску з кадру N варпимо в кадр N+1 і усереднюємо з передбаченням моделі.
  2. Post-processing з morphological operations: невеликий erode/dilate по масці прибирає шум, gaussian blur на краях робить перехід плавним.
  3. Alpha матування: замість бінарної маски (0/1) використовуємо soft alpha (0..1) на краях — через GuidedFilter або Deep Image Matting.

На практиці: SAM 2 без temporal smoothing дає edge flickering на швидкому русі. Після застосування RAFT + alpha refinement через ViTMatte — переміщення країв маски між кадрами < 1.2 px (субпіксельна стабільність).

Чи потрібен Temporal Smoothing для стабілізації маски?

Temporal smoothing — це не просто фільтр, а комплекс технік, що забезпечують часову узгодженість маски. Оптичний потік (RAFT) дозволяє «переносити» маску з кадру на кадр, а alpha matting (ViTMatte) додає субпіксельну точність на краях. У результаті — стабільна маска навіть на складних сценах зі швидким рухом. Гарантія точності на рівні субпікселя.

Процес роботи в продакшні

  1. Первинна автоматична сегментація SAM 2 / RVM — весь ролик.
  2. QA: автоматичний детектор flickering (variance маски в ковзному вікні 5 кадрів > threshold).
  3. Ручна корекція лише проблемних ділянок — через Silhouette, Mocha Pro або After Effects Roto Brush.
  4. Alpha refinement через ViTMatte для волосся та напівпрозорих тканин.
  5. Експорт EXR-послідовності з alpha-каналом.

Співвідношення ручної роботи до автоматики: проста сцена — 90/10, складна — 60/40. Економія бюджету на повнометражному фільмі може сягати 500 000 грн.

Зв'яжіться з нами для точної оцінки вашого проєкту. Ми підберемо оптимальний pipeline і порахуємо вартість індивідуально.

Що входить в роботу

  • Первинна автоматична сегментація з використанням обраної моделі (SAM 2, RVM).
  • QA та детекція flickering з наданням звіту.
  • Ручна корекція проблемних кадрів (до 10% від загального обсягу) — безкоштовно.
  • Alpha refinement для волосся, диму, напівпрозорих об'єктів.
  • Експорт у необхідному форматі (EXR, PNG, MOV з альфа-каналом).
  • Навчання вашої команди роботі з отриманими масками (за запитом).
Обсяг Автоматика + QA Повний pipeline
Короткий ролик до 2 хв 1–3 дні 3–7 днів
Епізод 20–40 хв 1–2 тижні 3–5 тижнів
Повнометражний фільм 4–8 тижнів 3–4 місяці

Терміни орієнтовні, точна оцінка — після аналізу вихідного матеріалу. Вартість розраховується індивідуально залежно від складності сцен і необхідної якості. Замовте тестову обробку 1-хвилинного ролика, щоб переконатися в якості. Отримайте консультацію по вашому проєкту — ми допоможемо обрати оптимальний підхід.

Посилання: RVM