Ручной ротоскопинг 4-минутной сцены — это 5 760 кадров при 24fps. Опытный специалист закрывает 30–60 кадров в день, превращая эпизод в 3–6 месяцев работы. Мы автоматизируем этот процесс с помощью ИИ, сокращая сроки до недели. Наш pipeline использует передовые модели видеосегментации и temporal smoothing для промышленного качества. За время работы обработано свыше 50 проектов, включая полнометражные фильмы и рекламные ролики. Клиенты экономят до 70% бюджета на ротоскопинге, что может составлять около $900–1.3k на крупных проектах.
Область применения AI-ротоскопинга
AI-ротоскопирование — автоматическое выделение объектов на видео (людей, автомобилей, животных) с помощью моделей компьютерного зрения. В отличие от ручного ротоскопинга, где каждый кадр обрисовывается вручную, ИИ-модели сегментируют объект и отслеживают его движение. Это незаменимо для постпродакшена: замена фона, добавление эффектов, изоляция объекта для compositing. Технология подходит для любых сцен: от простых (статичная камера, чёткий контур) до сложных (быстрое движение, развевающиеся волосы, толпа).
Как работает AI-ротоскопинг?
Технические детали
Современный подход — не просто сегментация по кадрам, а трекинг маски во времени с temporal consistency. Ключевые инструменты:
SAM 2 (Segment Anything Model 2) от Meta SAM 2 — прямо создан для видеосегментации. Задаёшь точку или bounding box на первом кадре, модель пропагирует маску через весь ролик с учётом движения. На практике: точность сохраняется на 80–120 кадрах без дополнительных промптов, дальше нужна коррекция. Memory module внутри SAM 2 держит контекст предыдущих кадров.
import torch from sam2.build_sam import build_sam2_video_predictor predictor = build_sam2_video_predictor( "sam2_hiera_large.yaml", "sam2_hiera_large.pt", device="cuda" ) with torch.inference_mode(), torch.autocast("cuda", dtype=torch.bfloat16): state = predictor.init_state(video_path="scene_001.mp4") # Задаём точку на актёре в кадре 0 _, _, masks = predictor.add_new_points_or_box( state, frame_idx=0, obj_id=1, points=[[540, 380]], labels=[1] ) # Пропагация маски по всему видео for frame_idx, obj_ids, masks in predictor.propagate_in_video(state): save_mask(frame_idx, masks) RVM (Robust Video Matting) — специализирован на отделении человека от фона, работает в реальном времени (30fps на RTX 3080). Лучше SAM 2 для сцен с развевающимися волосами и полупрозрачными элементами.
| Модель | Тип | Точность | Скорость | Подходит для |
|---|---|---|---|---|
| SAM 2 | Видеосегментация | Высокая (субпиксельная) | ~10fps (RTX 4090) | Сложные сцены, любые объекты |
| RVM | Video Matting | Очень высокая (волосы, дым) | 30fps (RTX 3080) | Люди, полупрозрачные элементы |
| Runway ML | ИИ-ассист | Средняя | Мгновенно | Быстрые черновики |
Почему возникает мерцание маски и как с ним бороться?
Отметим: когда сегментируешь кадр за кадром независимо, маска «мерцает» — края прыгают на 2–5 пикселей между кадрами. В готовом compositing это выглядит как дрожащий контур. Решение — temporal smoothing:
- Optical flow консистентность: применяем RAFT или FlowFormer для вычисления оптического потока между кадрами, маску из кадра N варпируем в кадр N+1 и усредняем с предсказанием модели.
- Post-processing с morphological operations: небольшой erode/dilate по маске убирает шум, gaussian blur на краях делает переход плавным.
- Alpha матирование: вместо бинарной маски (0/1) используем soft alpha (0..1) на краях — через GuidedFilter или Deep Image Matting.
На практике: SAM 2 без temporal smoothing даёт edge flickering на быстром движении. После применения RAFT + alpha refinement через ViTMatte — перемещение краёв маски между кадрами < 1.2 px (субпиксельная стабильность).
Как Temporal Smoothing устраняет мерцание маски?
Temporal smoothing — это не просто фильтр, а комплекс техник, обеспечивающих временную согласованность маски. Оптический поток (RAFT) позволяет «переносить» маску с кадра на кадр, а alpha matting (ViTMatte) добавляет субпиксельную точность на краях. В результате — стабильная маска даже на сложных сценах с быстрым движением.
Процесс работы в продакшне
- Первичная автоматическая сегментация SAM 2 / RVM — весь ролик.
- QA: автоматический детектор flickering (variance маски в скользящем окне 5 кадров > threshold).
- Ручная коррекция только проблемных участков — через Silhouette, Mocha Pro или After Effects Roto Brush.
- Alpha refinement через ViTMatte для волос и полупрозрачных тканей.
- Экспорт EXR-последовательности с alpha-каналом.
Соотношение ручной работы к автоматике: простая сцена — 90/10, сложная — 60/40. Экономия бюджета на полнометражном фильме может достигать сотен тысяч долларов.
Свяжитесь с нами для точной оценки вашего проекта. Мы подберём оптимальный pipeline и посчитаем стоимость индивидуально.
Что входит в работу
- Первичная автоматическая сегментация с использованием выбранной модели (SAM 2, RVM).
- QA и детекция flickering с предоставлением отчёта.
- Ручная коррекция проблемных кадров (до 10% от общего объёма) — бесплатно.
- Alpha refinement для волос, дыма, полупрозрачных объектов.
- Экспорт в требуемом формате (EXR, PNG, MOV с альфа-каналом).
- Обучение вашей команды работе с полученными масками (по запросу).
| Объём | Автоматика + QA | Полный pipeline |
|---|---|---|
| Короткий ролик до 2 мин | 1–3 дня | 3–7 дней |
| Эпизод 20–40 мин | 1–2 недели | 3–5 недель |
| Полнометражный фильм | 4–8 недель | 3–4 месяца |
Сроки ориентировочные, точная оценка — после анализа исходного материала. Стоимость рассчитывается индивидуально в зависимости от сложности сцен и требуемого качества. Закажите тестовую обработку 1-минутного ролика, чтобы убедиться в качестве. Получите консультацию по вашему проекту — мы поможем выбрать оптимальный подход.
Ссылки: RVM







