Разработка системы распознавания поз человека (Pose Estimation)

Вы получаете видео с камеры наблюдения, но вместо чёткого скелета — шум и ложные срабатывания. Знакомая ситуация? Мы решаем эту задачу с помощью production-ready моделей [Pose estimation](https://en.wikipedia.org/wiki/Pose_estimation). Наши инженеры имеют 5+ лет опыта в компьютерном зрении и реализо

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1460
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1314
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    1012
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1275
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    727
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1018

Вы получаете видео с камеры наблюдения, но вместо чёткого скелета — шум и ложные срабатывания. Знакомая ситуация? Мы решаем эту задачу с помощью production-ready моделей Pose estimation. Наши инженеры имеют 5+ лет опыта в компьютерном зрении и реализовали более 30 проектов по распознаванию поз для фитнеса, реабилитации и киносъёмки. Pose estimation — детекция ключевых точек тела человека (keypoints): суставы, голова, конечности. Задача: по изображению или видео получить 2D или 3D координаты 17–133 точек скелета. Основные технические сложности: перекрытия, когда один человек заслоняет другого; bottom-up подходы могут ошибаться при группировке keypoints — используем комбинацию top-down с Non-Maximum Suppression. Освещение и ракурс: тени, блики, нестандартный угол камеры — решается аугментацией данных и transformer-моделями (ViTPose). Реальное время: latency p99 должна быть ниже 30ms для видео 30 FPS — применяем RTMPose с оптимизацией ONNX Runtime и TensorRT. Для фитнес-приложений с одним пользователем предпочтителен top-down (RTMPose-l), для многолюдных пространств — bottom-up (OpenPose). В условиях плохого освещения помогает CLAHE и ансамбли моделей. Внедрение таких систем окупается за 3–6 месяцев за счёт автоматизации анализа и сокращения времени экспертов на 80%.

Какие проблемы решаем

Pose estimation — детекция ключевых точек тела человека (keypoints): суставы, голова, конечности. Задача: по изображению или видео получить 2D или 3D координаты 17–133 точек скелета. Основные технические сложности:

  • Перекрытия: когда один человек заслоняет другого, bottom-up подходы группируют keypoints с ошибками. Используем комбинацию top-down с Non-Maximum Suppression для N людей.
  • Освещение и ракурс: тени, блики, нестандартный угол камеры. Помогает аугментация данных и использование transformer-моделей (ViTPose).
  • Реальное время: latency p99 должна быть ниже 30ms для видео 30 FPS. Применяем RTMPose с оптимизацией ONNX Runtime и TensorRT.

Top-down vs Bottom-up — какой подход выбрать?

Выбор между top-down и bottom-up зависит от сценария. Top-down даёт более точные keypoints, так как bounding box ограничивает область поиска, но производительность падает при >5 людях. Bottom-up быстрее при множестве людей, но хуже обрабатывает пересечения. Для фитнес-приложений с одним пользователем предпочтителен top-down (RTMPose-l), для многолюдных пространств — bottom-up (OpenPose).

from ultralytics import YOLO import cv2 # YOLOv8-pose — top-down, производительный вариант model = YOLO('yolov8l-pose.pt') def estimate_poses(image_path: str) -> list[dict]: results = model(image_path, conf=0.5) poses = [] for result in results: for i, (bbox, kps) in enumerate(zip( result.boxes.xyxy, result.keypoints.data )): keypoints = [] for j, kp in enumerate(kps): x, y, conf = kp keypoints.append({ 'name': COCO_KEYPOINTS[j], 'x': float(x), 'y': float(y), 'confidence': float(conf) }) poses.append({ 'person_id': i, 'bbox': bbox.tolist(), 'keypoints': keypoints }) return poses COCO_KEYPOINTS = [ 'nose', 'left_eye', 'right_eye', 'left_ear', 'right_ear', 'left_shoulder', 'right_shoulder', 'left_elbow', 'right_elbow', 'left_wrist', 'right_wrist', 'left_hip', 'right_hip', 'left_knee', 'right_knee', 'left_ankle', 'right_ankle' ] 

ViTPose и RTMPose — production-ready модели

ViTPose — лучшее качество на COCO benchmark. ViTPose-H: AP 79.1 на COCO val2017. Transformer-based backbone, требует больше ресурсов.

RTMPose — оптимизирован для production (RTMDet детектор + RTMPose backbone). RTMPose-l: AP 76.3, latency 3ms на T4. Рекомендуется для систем реального времени.

from mmpose.apis import MMPoseInferencer inferencer = MMPoseInferencer('rtmpose-l_8xb32-270e_coco-wholebody-384x288') results = inferencer('image.jpg', out_dir='output/') 

Как улучшить точность при частичных затемнениях?

В условиях плохого освещения помогает предобработка изображения: контрастирование, CLAHE, использование моделей с attention (ViTPose). Также эффективен ансамбль из нескольких моделей (ViTPose + RTMPose) с усреднением keypoints. COCO keypoints dataset содержит примеры с разным освещением, и fine-tuning на своих данных с аугментациями (brightness, noise) даёт прирост 3–5% AP.

3D Pose Estimation для реабилитации и спорта

Для реабилитации, спортивного анализа нужны 3D-координаты:

  • MotionBERT — transformer для 2D→3D лифтинга: принимает 2D keypoints из видео, выдаёт 3D скелет.
  • MediaPipe Pose — встроенный 3D (относительные 3D координаты без depth camera).
  • Stereo camera setup — точный 3D через две синхронизированные камеры.
  • Depth camera (Intel RealSense, Azure Kinect) — RGBD для точного 3D.

Анализ техники выполнения упражнений

import numpy as np def analyze_squat_form(keypoints: dict) -> dict: """Анализ техники приседания по keypoints""" # Угол в колене hip = np.array([keypoints['left_hip']['x'], keypoints['left_hip']['y']]) knee = np.array([keypoints['left_knee']['x'], keypoints['left_knee']['y']]) ankle = np.array([keypoints['left_ankle']['x'], keypoints['left_ankle']['y']]) knee_angle = calculate_angle(hip, knee, ankle) # Выравнивание спины (наклон туловища) shoulder = np.array([keypoints['left_shoulder']['x'], keypoints['left_shoulder']['y']]) torso_angle = calculate_angle(shoulder, hip, np.array([hip[0], hip[1] + 100])) return { 'knee_angle': knee_angle, 'torso_angle': torso_angle, 'depth': 'sufficient' if knee_angle < 90 else 'insufficient', 'back_alignment': 'good' if 70 < torso_angle < 90 else 'needs_correction' } 

Метрики качества

  • OKS (Object Keypoint Similarity) — основная метрика COCO.
  • AP (Average Precision) на COCO val.
  • PCKh (Percentage of Correct Keypoints) — для head-normalized threshold.
Модель AP COCO val FPS (T4)
RTMPose-t 68.5 300
RTMPose-l 76.3 100
ViTPose-B 75.8 50
ViTPose-H 79.1 20
Применение Срок
Фитнес-приложение с анализом упражнений 4–6 недель
Реабилитационная система с 3D 7–10 недель
Mocap без маркеров для анимации 8–14 недель

Что входит в работу

  • Прототип модели: выбор архитектуры, обучение/дообучение с метриками.
  • Интеграция: API на FastAPI, инференс на GPU/CPU, оптимизация под TensorRT.
  • Документация: model card, описание пайплайна, инструкция по развёртыванию.
  • Поддержка: 2 недели бесплатной поддержки после сдачи, обучение вашей команды.

Наш процесс

  1. Аналитика: разбираем вашу задачу, собираем требования по точности и скорости.
  2. Проектирование: выбираем модель (ViTPose, RTMPose, OpenPose), определяем пайплайн.
  3. Прототипирование: быстрый MVP за 1–2 недели, демонстрация заказчику.
  4. Оптимизация: сжатие модели (quantization INT8, pruning), подгонка под целевое железо.
  5. Деплой: контейнеризация, мониторинг (MLflow, Prometheus), CI/CD.

Получите консультацию по вашему проекту — мы оценим требования и предложим оптимальное решение.

Стоимость и сроки

Стоимость рассчитывается индивидуально в зависимости от сложности. Ориентировочные сроки указаны в таблице выше. Внедрение системы окупается за 3–6 месяцев за счёт автоматизации анализа и сокращения времени экспертов на 80%. Снижаем затраты на разработку с нуля, используя предобученные модели и transfer learning.

Закажите пилотный проект и проверьте эффективность на своих данных.