Розробка системи розпізнавання поз людини (Pose Estimation)

Ви отримуєте відео з камери спостереження, але замість чітких скелетних точок — шум та хибні спрацьовування. Знайома ситуація? Ми вирішуємо це завдання за допомогою production-ready моделей Pose estimation (https://en.wikipedia.org/wiki/Pose_estimation). Наші інженери мають 5+ років досвіду в комп'ю

Напрямки AI-розробки

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    997
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1264
  • image_logo-advance_0.webp
    Розробка логотипу компанії B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    1002

Ви отримуєте відео з камери спостереження, але замість чітких скелетних точок — шум та хибні спрацьовування. Знайома ситуація? Ми вирішуємо це завдання за допомогою production-ready моделей Pose estimation (https://en.wikipedia.org/wiki/Pose_estimation). Наші інженери мають 5+ років досвіду в комп'ютерному зорі та реалізували понад 30 проєктів із розпізнавання поз людини для фітнесу, реабілітації та кінозйомки.

Які проблеми вирішуємо

Pose estimation — це детекція ключових точок тіла людини (keypoints): суглоби, голова, кінцівки. Задача: за зображенням або відео отримати 2D або 3D координати 17–133 точок скелета. Основні технічні складності:

  • Перекриття: коли одна людина затуляє іншу, bottom-up підходи групують keypoints з помилками. Використовуємо комбінацію top-down з Non-Maximum Suppression для N людей.
  • Освітлення та ракурс: тіні, відблиски, нестандартний кут камери. Допомагає аугментація даних та використання transformer-моделей (ViTPose).
  • Реальний час: latency p99 має бути нижче 30ms для відео 30 FPS. Застосовуємо RTMPose з оптимізацією ONNX Runtime та TensorRT.

Для підвищення точності ми використовуємо attention-механізми та heatmap-регресію ключових точок, а також не-максимальне придушення (NMS) для видалення дублікатів.

Top-down vs Bottom-up — який підхід обрати?

Вибір між top-down підходом та bottom-up підходом залежить від сценарію. Top-down забезпечує на 5% вищий AP, ніж bottom-up, але працює в 2 рази повільніше при 5 особах. Top-down дає більш точні keypoints, оскільки bounding box обмежує область пошуку, але продуктивність падає при >5 людях. Bottom-up швидший при багатьох людях, але гірше обробляє перетини. Наприклад, bottom-up підхід може бути до 5 разів швидшим при >10 людях. Для фітнес-додатків з одним користувачем кращий top-down (RTMPose-l), для багатолюдних просторів — bottom-up (OpenPose).

from ultralytics import YOLO import cv2 # YOLOv8-pose — top-down, продуктивний варіант model = YOLO('yolov8l-pose.pt') def estimate_poses(image_path: str) -> list[dict]: results = model(image_path, conf=0.5) poses = [] for result in results: for i, (bbox, kps) in enumerate(zip( result.boxes.xyxy, result.keypoints.data )): keypoints = [] for j, kp in enumerate(kps): x, y, conf = kp keypoints.append({ 'name': COCO_KEYPOINTS[j], 'x': float(x), 'y': float(y), 'confidence': float(conf) }) poses.append({ 'person_id': i, 'bbox': bbox.tolist(), 'keypoints': keypoints }) return poses COCO_KEYPOINTS = [ 'nose', 'left_eye', 'right_eye', 'left_ear', 'right_ear', 'left_shoulder', 'right_shoulder', 'left_elbow', 'right_elbow', 'left_wrist', 'right_wrist', 'left_hip', 'right_hip', 'left_knee', 'right_knee', 'left_ankle', 'right_ankle' ] 

ViTPose та RTMPose — production-ready моделі

ViTPose — найкраща якість на COCO benchmark. ViTPose-H: AP 79.1 на COCO val2017. Transformer-based backbone, потребує більше ресурсів.

RTMPose — оптимізований для production (RTMDet детектор + RTMPose backbone). RTMPose-l: AP 76.3, latency 3ms на T4. Рекомендується для систем реального часу. RTMPose-l працює в 10 разів швидше за ViTPose-H при порівнянній точності. ViTPose-H дає на 3% вищий AP, ніж RTMPose-l, але потребує вдвічі більше ресурсів.

from mmpose.apis import MMPoseInferencer inferencer = MMPoseInferencer('rtmpose-l_8xb32-270e_coco-wholebody-384x288') results = inferencer('image.jpg', out_dir='output/') 
Як покращити точність при часткових затемненнях?

В умовах поганого освітлення допомагає попередня обробка зображення: контрастування, CLAHE, використання моделей з attention (ViTPose). Також ефективний ансамбль з кількох моделей (ViTPose + RTMPose) з усередненням keypoints. COCO keypoints dataset містить приклади з різним освітленням, і fine-tuning на своїх даних з аугментаціями (brightness, noise) дає приріст 3–5% AP.

3D Pose Estimation для реабілітації та спорту

Для реабілітації, спортивного аналізу потрібні 3D-координати:

  • MotionBERT — transformer для 2D→3D ліфтингу: приймає 2D keypoints з відео, видає 3D скелет.
  • MediaPipe Pose — вбудований 3D (відносні 3D координати без depth camera).
  • Stereo camera setup — точний 3D через дві синхронізовані камери.
  • Depth camera (Intel RealSense, Azure Kinect) — RGBD для точного 3D.

Аналіз техніки виконання вправ

import numpy as np def analyze_squat_form(keypoints: dict) -> dict: """Аналіз техніки присідання за keypoints""" # Кут у коліні hip = np.array([keypoints['left_hip']['x'], keypoints['left_hip']['y']]) knee = np.array([keypoints['left_knee']['x'], keypoints['left_knee']['y']]) ankle = np.array([keypoints['left_ankle']['x'], keypoints['left_ankle']['y']]) knee_angle = calculate_angle(hip, knee, ankle) # Вирівнювання спини (нахил тулуба) shoulder = np.array([keypoints['left_shoulder']['x'], keypoints['left_shoulder']['y']]) torso_angle = calculate_angle(shoulder, hip, np.array([hip[0], hip[1] + 100])) return { 'knee_angle': knee_angle, 'torso_angle': torso_angle, 'depth': 'sufficient' if knee_angle < 90 else 'insufficient', 'back_alignment': 'good' if 70 < torso_angle < 90 else 'needs_correction' } 

Метрики якості

  • OKS (Object Keypoint Similarity) — основна метрика COCO.
  • AP (Average Precision) на COCO val.
  • PCKh (Percentage of Correct Keypoints) — для head-normalized threshold.
  • Для оцінки точності використовується метрика mAP при IoU 0.5:0.95.
Модель AP COCO val FPS (T4)
RTMPose-t 68.5 300
RTMPose-l 76.3 100
ViTPose-B 75.8 50
ViTPose-H 79.1 20
Застосування Термін
Фітнес-додаток з аналізом вправ 4–6 тижнів
Реабілітаційна система з 3D 7–10 тижнів
Mocap без маркерів для анімації 8–14 тижнів

Як оцінити якість моделі pose estimation?

Для оцінки використовують метрики AP, OKS та PCKh. Важно враховувати теплові карти (heatmap) та регресію keypoints. Ми використовуємо валідацію на тестовому наборі з оклюзіями.

Що входить в роботу

  • Прототип моделі: вибір архітектури, навчання/донавчання з метриками.
  • Інтеграція: API на FastAPI, інференс на GPU/CPU, оптимізація під TensorRT.
  • Документація: model card, опис пайплайну, інструкція з розгортання.
  • Підтримка: 2 тижні безкоштовної підтримки після здачі, навчання вашої команди.

Наш процес

  1. Аналітика: розбираємо вашу задачу, збираємо вимоги до точності та швидкості.
  2. Проектування: обираємо модель (ViTPose, RTMPose, OpenPose), визначаємо пайплайн.
  3. Прототипування: швидкий MVP за 1–2 тижні, демонстрація замовнику.
  4. Оптимізація: стиснення моделі (quantization INT8, pruning), підгонка під цільове залізо.
  5. Деплой: контейнеризація, моніторинг (MLflow, Prometheus), CI/CD, з використанням MLOps практик.

Гарантія на наші рішення — 6 місяців безкоштовної підтримки та сертифікація розробників. Вартість розробки стартує від $5,000 залежно від складності, а економія на оплаті праці експертів може сягати $10,000 на місяць. Економія може сягати $120,000 на рік. Отримайте консультацію щодо вашого проєкту — ми оцінимо вимоги та запропонуємо оптимальне рішення.

Вартість та терміни

Вартість розраховується індивідуально. Орієнтовні терміни вказані в таблиці вище. Впровадження системи окупається за 3–6 місяців завдяки автоматизації аналізу та скороченню часу експертів на 80%. Знижуємо витрати на розробку з нуля, використовуючи попередньо навчені моделі та transfer learning.

Замовте пілотний проєкт і перевірте ефективність на своїх даних.