Вы получаете видео с камеры наблюдения, но вместо чёткого скелета — шум и ложные срабатывания. Знакомая ситуация? Мы решаем эту задачу с помощью production-ready моделей Pose estimation. Наши инженеры имеют 5+ лет опыта в компьютерном зрении и реализовали более 30 проектов по распознаванию поз для фитнеса, реабилитации и киносъёмки. Pose estimation — детекция ключевых точек тела человека (keypoints): суставы, голова, конечности. Задача: по изображению или видео получить 2D или 3D координаты 17–133 точек скелета. Основные технические сложности: перекрытия, когда один человек заслоняет другого; bottom-up подходы могут ошибаться при группировке keypoints — используем комбинацию top-down с Non-Maximum Suppression. Освещение и ракурс: тени, блики, нестандартный угол камеры — решается аугментацией данных и transformer-моделями (ViTPose). Реальное время: latency p99 должна быть ниже 30ms для видео 30 FPS — применяем RTMPose с оптимизацией ONNX Runtime и TensorRT. Для фитнес-приложений с одним пользователем предпочтителен top-down (RTMPose-l), для многолюдных пространств — bottom-up (OpenPose). В условиях плохого освещения помогает CLAHE и ансамбли моделей. Внедрение таких систем окупается за 3–6 месяцев за счёт автоматизации анализа и сокращения времени экспертов на 80%.
Какие проблемы решаем
Pose estimation — детекция ключевых точек тела человека (keypoints): суставы, голова, конечности. Задача: по изображению или видео получить 2D или 3D координаты 17–133 точек скелета. Основные технические сложности:
- Перекрытия: когда один человек заслоняет другого, bottom-up подходы группируют keypoints с ошибками. Используем комбинацию top-down с Non-Maximum Suppression для N людей.
- Освещение и ракурс: тени, блики, нестандартный угол камеры. Помогает аугментация данных и использование transformer-моделей (ViTPose).
- Реальное время: latency p99 должна быть ниже 30ms для видео 30 FPS. Применяем RTMPose с оптимизацией ONNX Runtime и TensorRT.
Top-down vs Bottom-up — какой подход выбрать?
Выбор между top-down и bottom-up зависит от сценария. Top-down даёт более точные keypoints, так как bounding box ограничивает область поиска, но производительность падает при >5 людях. Bottom-up быстрее при множестве людей, но хуже обрабатывает пересечения. Для фитнес-приложений с одним пользователем предпочтителен top-down (RTMPose-l), для многолюдных пространств — bottom-up (OpenPose).
from ultralytics import YOLO import cv2 # YOLOv8-pose — top-down, производительный вариант model = YOLO('yolov8l-pose.pt') def estimate_poses(image_path: str) -> list[dict]: results = model(image_path, conf=0.5) poses = [] for result in results: for i, (bbox, kps) in enumerate(zip( result.boxes.xyxy, result.keypoints.data )): keypoints = [] for j, kp in enumerate(kps): x, y, conf = kp keypoints.append({ 'name': COCO_KEYPOINTS[j], 'x': float(x), 'y': float(y), 'confidence': float(conf) }) poses.append({ 'person_id': i, 'bbox': bbox.tolist(), 'keypoints': keypoints }) return poses COCO_KEYPOINTS = [ 'nose', 'left_eye', 'right_eye', 'left_ear', 'right_ear', 'left_shoulder', 'right_shoulder', 'left_elbow', 'right_elbow', 'left_wrist', 'right_wrist', 'left_hip', 'right_hip', 'left_knee', 'right_knee', 'left_ankle', 'right_ankle' ] ViTPose и RTMPose — production-ready модели
ViTPose — лучшее качество на COCO benchmark. ViTPose-H: AP 79.1 на COCO val2017. Transformer-based backbone, требует больше ресурсов.
RTMPose — оптимизирован для production (RTMDet детектор + RTMPose backbone). RTMPose-l: AP 76.3, latency 3ms на T4. Рекомендуется для систем реального времени.
from mmpose.apis import MMPoseInferencer inferencer = MMPoseInferencer('rtmpose-l_8xb32-270e_coco-wholebody-384x288') results = inferencer('image.jpg', out_dir='output/') Как улучшить точность при частичных затемнениях?
В условиях плохого освещения помогает предобработка изображения: контрастирование, CLAHE, использование моделей с attention (ViTPose). Также эффективен ансамбль из нескольких моделей (ViTPose + RTMPose) с усреднением keypoints. COCO keypoints dataset содержит примеры с разным освещением, и fine-tuning на своих данных с аугментациями (brightness, noise) даёт прирост 3–5% AP.
3D Pose Estimation для реабилитации и спорта
Для реабилитации, спортивного анализа нужны 3D-координаты:
- MotionBERT — transformer для 2D→3D лифтинга: принимает 2D keypoints из видео, выдаёт 3D скелет.
- MediaPipe Pose — встроенный 3D (относительные 3D координаты без depth camera).
- Stereo camera setup — точный 3D через две синхронизированные камеры.
- Depth camera (Intel RealSense, Azure Kinect) — RGBD для точного 3D.
Анализ техники выполнения упражнений
import numpy as np def analyze_squat_form(keypoints: dict) -> dict: """Анализ техники приседания по keypoints""" # Угол в колене hip = np.array([keypoints['left_hip']['x'], keypoints['left_hip']['y']]) knee = np.array([keypoints['left_knee']['x'], keypoints['left_knee']['y']]) ankle = np.array([keypoints['left_ankle']['x'], keypoints['left_ankle']['y']]) knee_angle = calculate_angle(hip, knee, ankle) # Выравнивание спины (наклон туловища) shoulder = np.array([keypoints['left_shoulder']['x'], keypoints['left_shoulder']['y']]) torso_angle = calculate_angle(shoulder, hip, np.array([hip[0], hip[1] + 100])) return { 'knee_angle': knee_angle, 'torso_angle': torso_angle, 'depth': 'sufficient' if knee_angle < 90 else 'insufficient', 'back_alignment': 'good' if 70 < torso_angle < 90 else 'needs_correction' } Метрики качества
- OKS (Object Keypoint Similarity) — основная метрика COCO.
- AP (Average Precision) на COCO val.
- PCKh (Percentage of Correct Keypoints) — для head-normalized threshold.
| Модель | AP COCO val | FPS (T4) |
|---|---|---|
| RTMPose-t | 68.5 | 300 |
| RTMPose-l | 76.3 | 100 |
| ViTPose-B | 75.8 | 50 |
| ViTPose-H | 79.1 | 20 |
| Применение | Срок |
|---|---|
| Фитнес-приложение с анализом упражнений | 4–6 недель |
| Реабилитационная система с 3D | 7–10 недель |
| Mocap без маркеров для анимации | 8–14 недель |
Что входит в работу
- Прототип модели: выбор архитектуры, обучение/дообучение с метриками.
- Интеграция: API на FastAPI, инференс на GPU/CPU, оптимизация под TensorRT.
- Документация: model card, описание пайплайна, инструкция по развёртыванию.
- Поддержка: 2 недели бесплатной поддержки после сдачи, обучение вашей команды.
Наш процесс
- Аналитика: разбираем вашу задачу, собираем требования по точности и скорости.
- Проектирование: выбираем модель (ViTPose, RTMPose, OpenPose), определяем пайплайн.
- Прототипирование: быстрый MVP за 1–2 недели, демонстрация заказчику.
- Оптимизация: сжатие модели (quantization INT8, pruning), подгонка под целевое железо.
- Деплой: контейнеризация, мониторинг (MLflow, Prometheus), CI/CD.
Получите консультацию по вашему проекту — мы оценим требования и предложим оптимальное решение.
Стоимость и сроки
Стоимость рассчитывается индивидуально в зависимости от сложности. Ориентировочные сроки указаны в таблице выше. Внедрение системы окупается за 3–6 месяцев за счёт автоматизации анализа и сокращения времени экспертов на 80%. Снижаем затраты на разработку с нуля, используя предобученные модели и transfer learning.
Закажите пилотный проект и проверьте эффективность на своих данных.







