Ви отримуєте відео з камери спостереження, але замість чітких скелетних точок — шум та хибні спрацьовування. Знайома ситуація? Ми вирішуємо це завдання за допомогою production-ready моделей Pose estimation (https://en.wikipedia.org/wiki/Pose_estimation). Наші інженери мають 5+ років досвіду в комп'ютерному зорі та реалізували понад 30 проєктів із розпізнавання поз людини для фітнесу, реабілітації та кінозйомки.
Які проблеми вирішуємо
Pose estimation — це детекція ключових точок тіла людини (keypoints): суглоби, голова, кінцівки. Задача: за зображенням або відео отримати 2D або 3D координати 17–133 точок скелета. Основні технічні складності:
- Перекриття: коли одна людина затуляє іншу, bottom-up підходи групують keypoints з помилками. Використовуємо комбінацію top-down з Non-Maximum Suppression для N людей.
- Освітлення та ракурс: тіні, відблиски, нестандартний кут камери. Допомагає аугментація даних та використання transformer-моделей (ViTPose).
- Реальний час: latency p99 має бути нижче 30ms для відео 30 FPS. Застосовуємо RTMPose з оптимізацією ONNX Runtime та TensorRT.
Для підвищення точності ми використовуємо attention-механізми та heatmap-регресію ключових точок, а також не-максимальне придушення (NMS) для видалення дублікатів.
Top-down vs Bottom-up — який підхід обрати?
Вибір між top-down підходом та bottom-up підходом залежить від сценарію. Top-down забезпечує на 5% вищий AP, ніж bottom-up, але працює в 2 рази повільніше при 5 особах. Top-down дає більш точні keypoints, оскільки bounding box обмежує область пошуку, але продуктивність падає при >5 людях. Bottom-up швидший при багатьох людях, але гірше обробляє перетини. Наприклад, bottom-up підхід може бути до 5 разів швидшим при >10 людях. Для фітнес-додатків з одним користувачем кращий top-down (RTMPose-l), для багатолюдних просторів — bottom-up (OpenPose).
from ultralytics import YOLO import cv2 # YOLOv8-pose — top-down, продуктивний варіант model = YOLO('yolov8l-pose.pt') def estimate_poses(image_path: str) -> list[dict]: results = model(image_path, conf=0.5) poses = [] for result in results: for i, (bbox, kps) in enumerate(zip( result.boxes.xyxy, result.keypoints.data )): keypoints = [] for j, kp in enumerate(kps): x, y, conf = kp keypoints.append({ 'name': COCO_KEYPOINTS[j], 'x': float(x), 'y': float(y), 'confidence': float(conf) }) poses.append({ 'person_id': i, 'bbox': bbox.tolist(), 'keypoints': keypoints }) return poses COCO_KEYPOINTS = [ 'nose', 'left_eye', 'right_eye', 'left_ear', 'right_ear', 'left_shoulder', 'right_shoulder', 'left_elbow', 'right_elbow', 'left_wrist', 'right_wrist', 'left_hip', 'right_hip', 'left_knee', 'right_knee', 'left_ankle', 'right_ankle' ] ViTPose та RTMPose — production-ready моделі
ViTPose — найкраща якість на COCO benchmark. ViTPose-H: AP 79.1 на COCO val2017. Transformer-based backbone, потребує більше ресурсів.
RTMPose — оптимізований для production (RTMDet детектор + RTMPose backbone). RTMPose-l: AP 76.3, latency 3ms на T4. Рекомендується для систем реального часу. RTMPose-l працює в 10 разів швидше за ViTPose-H при порівнянній точності. ViTPose-H дає на 3% вищий AP, ніж RTMPose-l, але потребує вдвічі більше ресурсів.
from mmpose.apis import MMPoseInferencer inferencer = MMPoseInferencer('rtmpose-l_8xb32-270e_coco-wholebody-384x288') results = inferencer('image.jpg', out_dir='output/') Як покращити точність при часткових затемненнях?
В умовах поганого освітлення допомагає попередня обробка зображення: контрастування, CLAHE, використання моделей з attention (ViTPose). Також ефективний ансамбль з кількох моделей (ViTPose + RTMPose) з усередненням keypoints. COCO keypoints dataset містить приклади з різним освітленням, і fine-tuning на своїх даних з аугментаціями (brightness, noise) дає приріст 3–5% AP.
3D Pose Estimation для реабілітації та спорту
Для реабілітації, спортивного аналізу потрібні 3D-координати:
- MotionBERT — transformer для 2D→3D ліфтингу: приймає 2D keypoints з відео, видає 3D скелет.
- MediaPipe Pose — вбудований 3D (відносні 3D координати без depth camera).
- Stereo camera setup — точний 3D через дві синхронізовані камери.
- Depth camera (Intel RealSense, Azure Kinect) — RGBD для точного 3D.
Аналіз техніки виконання вправ
import numpy as np def analyze_squat_form(keypoints: dict) -> dict: """Аналіз техніки присідання за keypoints""" # Кут у коліні hip = np.array([keypoints['left_hip']['x'], keypoints['left_hip']['y']]) knee = np.array([keypoints['left_knee']['x'], keypoints['left_knee']['y']]) ankle = np.array([keypoints['left_ankle']['x'], keypoints['left_ankle']['y']]) knee_angle = calculate_angle(hip, knee, ankle) # Вирівнювання спини (нахил тулуба) shoulder = np.array([keypoints['left_shoulder']['x'], keypoints['left_shoulder']['y']]) torso_angle = calculate_angle(shoulder, hip, np.array([hip[0], hip[1] + 100])) return { 'knee_angle': knee_angle, 'torso_angle': torso_angle, 'depth': 'sufficient' if knee_angle < 90 else 'insufficient', 'back_alignment': 'good' if 70 < torso_angle < 90 else 'needs_correction' } Метрики якості
- OKS (Object Keypoint Similarity) — основна метрика COCO.
- AP (Average Precision) на COCO val.
- PCKh (Percentage of Correct Keypoints) — для head-normalized threshold.
- Для оцінки точності використовується метрика mAP при IoU 0.5:0.95.
| Модель | AP COCO val | FPS (T4) |
|---|---|---|
| RTMPose-t | 68.5 | 300 |
| RTMPose-l | 76.3 | 100 |
| ViTPose-B | 75.8 | 50 |
| ViTPose-H | 79.1 | 20 |
| Застосування | Термін |
|---|---|
| Фітнес-додаток з аналізом вправ | 4–6 тижнів |
| Реабілітаційна система з 3D | 7–10 тижнів |
| Mocap без маркерів для анімації | 8–14 тижнів |
Як оцінити якість моделі pose estimation?
Для оцінки використовують метрики AP, OKS та PCKh. Важно враховувати теплові карти (heatmap) та регресію keypoints. Ми використовуємо валідацію на тестовому наборі з оклюзіями.
Що входить в роботу
- Прототип моделі: вибір архітектури, навчання/донавчання з метриками.
- Інтеграція: API на FastAPI, інференс на GPU/CPU, оптимізація під TensorRT.
- Документація: model card, опис пайплайну, інструкція з розгортання.
- Підтримка: 2 тижні безкоштовної підтримки після здачі, навчання вашої команди.
Наш процес
- Аналітика: розбираємо вашу задачу, збираємо вимоги до точності та швидкості.
- Проектування: обираємо модель (ViTPose, RTMPose, OpenPose), визначаємо пайплайн.
- Прототипування: швидкий MVP за 1–2 тижні, демонстрація замовнику.
- Оптимізація: стиснення моделі (quantization INT8, pruning), підгонка під цільове залізо.
- Деплой: контейнеризація, моніторинг (MLflow, Prometheus), CI/CD, з використанням MLOps практик.
Гарантія на наші рішення — 6 місяців безкоштовної підтримки та сертифікація розробників. Вартість розробки стартує від $5,000 залежно від складності, а економія на оплаті праці експертів може сягати $10,000 на місяць. Економія може сягати $120,000 на рік. Отримайте консультацію щодо вашого проєкту — ми оцінимо вимоги та запропонуємо оптимальне рішення.
Вартість та терміни
Вартість розраховується індивідуально. Орієнтовні терміни вказані в таблиці вище. Впровадження системи окупається за 3–6 місяців завдяки автоматизації аналізу та скороченню часу експертів на 80%. Знижуємо витрати на розробку з нуля, використовуючи попередньо навчені моделі та transfer learning.
Замовте пілотний проєкт і перевірте ефективність на своїх даних.







