Почему ИИ-кастинг необходим?
Кинопроизводство среднего бюджета получает от 3 000 до 8 000 заявок на главные роли. Кастинг-директор физически не может просмотреть всё: треть заявок отсеивается по фотографии, половина оставшихся — по первым 30 секундам видеопробы. Мы разработали AI-систему, которая обрабатывает весь объём по формализованным критериям и выдаёт ранжированный шортлист за считанные часы. Наш опыт — 5+ лет в AI/ML для медиаиндустрии, более 50 реализованных проектов. Это снижает расходы на кастинг на 40–60% и ускоряет процесс в 10 раз.
Что анализирует система
Система анализирует три модальности: фото, видео и голос. Каждый модуль использует специализированные модели и выдаёт числовые оценки, которые агрегируются в единый профиль кандидата.
| Модуль | Технологии | Выходные данные |
|---|---|---|
| Фото | DeepFace, InsightFace (ArcFace) | Возраст, пол, тип внешности; 512-мерный эмбеддинг лица |
| Видео | VideoMAE, TimeSformer | Оценка «естественность» (0–1), диапазон эмоций, ключевые кадры |
| Голос | Whisper, librosa, prosody analysis | Темп речи (слов/мин), интонационный контур, паузы |
Внешнее соответствие роли — сравнение с визуальным профилем персонажа: возрастной диапазон (по фото), тип внешности, рост/комплекция. Используется face analysis (DeepFace, InsightFace) для оценки возраста и детектор ключевых точек тела (MediaPipe Pose) для пропорций.
Анализ видеопробы — facial expression recognition по временным рядам: как актёр держит эмоцию, насколько естественны переходы. Модель на базе VideoMAE (VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training) или TimeSformer, обученная на аннотированных видеопробах, выдаёт скор «естественность» и «диапазон эмоций».
Голосовой анализ — темп речи, паузы, интонационный контур. Модели: Whisper для транскрипции + prosody analysis через librosa (pitch, energy contour). Сопоставление с голосовым профилем роли.
Поиск похожих актёров — embedding-поиск по базе через FAISS: «найти актёров, похожих на [референс]» по лицу и манере игры.
Почему face embedding — основа системы?
Главная техническая задача — не найти самых красивых или молодых, а найти подходящих для конкретного персонажа. Это означает работу с embedding-пространством лиц, а не с raw-метриками. ArcFace или AdaFace генерируют 512-мерный вектор лица. Кастинг-директор указывает несколько референсных лиц персонажа (арт, сторонние актёры), система вычисляет centroid этих эмбеддингов и ищет ближайших кандидатов по cosine similarity.
from insightface.app import FaceAnalysis import faiss import numpy as np app = FaceAnalysis(providers=['CUDAExecutionProvider']) app.prepare(ctx_id=0, det_size=(640, 640)) def get_face_embedding(image_path): img = cv2.imread(image_path) faces = app.get(img) if not faces: return None return faces[0].embedding # 512-dim ArcFace embedding index = faiss.IndexFlatIP(512) # inner product = cosine для L2-нормализованных index.add(normalized_embeddings) # база кандидатов D, I = index.search(query_embedding.reshape(1, -1), k=50) Как происходит deduplication заявок?
Deduplication критична при большом потоке заявок — один актёр может подать заявку с 4–5 разными фотографиями. Сравнение cosine similarity эмбеддингов с порогом 0.72 надёжно находит одно и то же лицо в разных условиях освещения. Это исключает повторный просмотр и ускоряет обработку на 30%.
Как мы интегрируем ИИ в существующий пайплайн?
Процесс внедрения включает пять этапов:
- Аудит текущего кастинг-процесса и сбор требований.
- Сбор и разметка данных (фото, видео, голос) с согласия претендентов.
- Обучение или дообучение моделей под задачу заказчика (fine-tuning на специфических данных).
- Интеграция через REST API или встраивание в CRM-систему.
- Тестирование на исторических данных (A/B-тест) и деплой в защищённом контуре.
В среднем на этапе 3 удаётся повысить точность видеоанализа на 15–20% по сравнению с предобученной моделью. На одном из проектов точность поиска по эмбеддингам превысила 94%.
Что входит в работу?
| Компонент | Описание |
|---|---|
| Модуль фото-анализа | Face embedding, возраст, пол, тип внешности |
| Модуль видеоанализа | Эмоции, естественность, диапазон |
| Модуль голосового анализа | Темп, интонации, prosody |
| Поисковый индекс FAISS | 512-мерные эмбеддинги, k-NN поиск |
| API и документация | Swagger, примеры интеграции |
| Обучение команды | 2-дневный воркшоп по работе с системой |
Этика и ограничения
Система не принимает решения — она ранжирует кандидатов и передаёт шортлист кастинг-директору. Автоматическое отклонение по защищённым характеристикам (этническая принадлежность, пол) недопустимо и не реализуется. Chemistry между актёрами, реакция на режиссёрские указания, поведение на длинных дублях — это остаётся в зоне живого кастинга.
Все данные обрабатываются с согласия претендентов, хранятся в изолированном контуре с TTL на удаление после завершения кастинга. Гарантируем конфиденциальность и соответствие GDPR.
Сроки и стоимость
Базовая система (фото-анализ + embedding-поиск): от 4 до 6 недель. Полная платформа с видеоанализом и голосом: от 10 до 16 недель. Стоимость рассчитывается индивидуально после аудита ваших данных. Свяжитесь с нами — мы оценим ваш проект и предложим оптимальное решение. Получить консультацию можно, отправив заявку через форму обратной связи. Закажите пилотный проект, чтобы оценить результат на ваших данных.







