Хірург, що працює через консоль da Vinci, бачить операційне поле через стереокамеру з 10-кратним збільшенням. Рухи його рук масштабуються та фільтруються від тремору. Але навіть найкраща роботизована система не дає відповіді на ключові питання: чи не зачеплена артерія? чи достатньо натягу тканини? Ми розробляємо AI-системи комп'ютерного зору, які додають цей контекст у реальному часі. Наша CV-система відстежує положення інструментів, сегментує анатомічні структури і будує 3D-карту операційного поля. Це не дослідницький прототип — це production-ready рішення, сертифіковані за IEC 62304. Наш досвід — 10+ років у машинному зорі та 5 проєктів у медичній робототехніці. Отримайте консультацію: оцінимо ваш проєкт за 2 дні.
Нижче розберемо три ключові завдання: трекінг інструментів, сегментацію тканин і depth estimation для AR-overlay. Покажемо, які моделі працюють в операційній, і розповімо про терміни впровадження.
Задачі CV в хірургічній робототехніці
Трекінг хірургічних інструментів
Базова задача, без якої не працює більшість іншого. Система повинна знати в реальному часі: де знаходиться кожен інструмент (затискач, ножиці, голка), його орієнтацію в 3D-просторі, швидкість руху.
Instance segmentation підхід: Mask R-CNN або YOLOv8m-seg для сегментації кожного інструмента попіксельно. На датасеті Cholec80 (80 відео лапароскопічних холецистектомій) fine-tuned YOLOv8m-seg дає mAP50 = 0.89 для детекції інструментів. YOLOv8m-seg швидший за Mask R-CNN у 3 рази при порівнянній точності.
Keypoint detection підхід: для точної оцінки орієнтації — детекція ключових точок інструмента (кінчик, з'єднання бранш, рукоятка). ViTPose або HRNet адаптовані для хірургічних інструментів.
Як вирішується проблема окклюзій інструментів?
Часткова видимість та окклюзії — коли інструменти перекривають один одного або виходять за край кадру. Temporal prediction (калманівський фільтр або RNN) відновлює трек при тимчасовій втраті. У наших проєктах ми використовуємо комбінацію YOLOv8-seg і Kalman filter з спостережуваністю на 5-10 кадрів назад.
Сегментація анатомічних структур
Розрізнення критичних структур (жовчна протока, артерії, нерви) від навколишніх тканин — задача з найвищими вимогами до точності. Помилка тут = травма пацієнта.
Специфіка: інтраопераційне зображення — не чиста анатомія підручника. Кров, дим від електрокоагулятора, деформація тканин при маніпуляціях. Модель повинна бути стійкою до цих артефактів.
Датасети: CholecSeg8k (8 000 анотованих кадрів холецистектомій, 13 класів тканин), Endoscapes (ендоскопічні сцени), KidneyVSS. Архітектура: TransFuse (CNN + Transformer fusion) або HardNet — спеціалізовані для медичної сегментації.
Чому depth estimation — найскладніша задача?
Технічно найбільш складна частина. Хірург оперує в 3D-просторі, але бачить 2D-зображення (якщо немає стереосистеми). Depth estimation дозволяє відновлювати 3D з монокулярного лапароскопічного відео.
Чому це складно
Ендоскопічне зображення порушує більшість припущень, на яких працюють стандартні depth estimation моделі:
- Дисторсія об'єктива значна (ширококутна оптика ендоскопа)
- Відсутність текстури на однорідних тканинах (моделі не бачать parallax)
- Specular highlights — відблиски від вологих тканин обманюють модель
- Деформація м'яких тканин — на відміну від статичних сцен, тканини рухаються та деформуються
Підходи
Self-supervised depth estimation (Monodepth2, DynDepth): навчання без розмічених глибинних карт, тільки з послідовностей кадрів. Фотометрична loss + ego-motion prediction. На лапароскопічних даних: AbsRel ≈ 0.12–0.18 — прийнятно для відносних оцінок.
Стерео + structured light: da Vinci Xi має stereo endoscope. Disparity з stereo matching (RAFT-Stereo, CFNet) дає точну абсолютну глибину. AbsRel < 0.05 при правильному калібруванні.
Гібридний підхід: depth estimation як prior + sparse 3D landmarks з feature matching (SuperGlue + SuperPoint) для уточнення. Використовується для AR-overlay анатомічного атласу поверх відео.
| Метод |
AbsRel |
Вимагає стерео |
Затримка (мс) |
| Monodepth2 (self-sup) |
0.16 |
Ні |
12 |
| RAFT-Stereo |
0.04 |
Так |
28 |
| DPT (mono) |
0.14 |
Ні |
18 |
| Гібрид (Stereo + DPT) |
0.03 |
Так |
35 |
Augmented Reality overlay
Накладання анатомічного атласу (структури, які не можна зачепити) поверх хірургічного відео в реальному часі. Pipeline: Depth estimation → 3D registration з передопераційним CT/MRI → деформаційна модель тканини (для врахування рухів) → AR-рендер.
Latency вимога: < 50 ms кінець-в-кінець. Це диктує вибір архітектури: тільки легкі моделі або спеціалізоване GPU.
Процес розробки AI-системи під ключ
Ми застосовуємо покроковий підхід, щоб мінімізувати ризики та забезпечити відповідність медичним стандартам.
- Аналіз задачі: збір вимог, вибір цільових задач (трекінг, сегментація, depth estimation), оцінка доступних даних.
- Збір і розмітка даних: анотація кадрів (маски інструментів, ключові точки, глибинні карти). Використовуємо внутрішні тули для семантичної сегментації. Економія часу на етапі розмітки — до 40% за рахунок активного навчання.
- Навчання та валідація: підбір архітектури, fine-tuning на медичних датасетах, оцінка за AbsRel, mAP, latency.
- Інтеграція та оптимізація: ONNX Runtime або TensorRT для прискорення, розгортання на платформі NVIDIA IGX Orin.
- Тестування та сертифікація: перевірка на репрезентативних даних, документування за IEC 62304.
- Деплой та підтримка: встановлення в операційній, навчання персоналу, гарантійне обслуговування.
Що входить у роботу
- Документація: модель карта, опис архітектури, інструкція з експлуатації.
- Навчання команди клієнта роботі з системою.
- Технічна підтримка на етапі впровадження та гарантійний період.
- Адаптація під конкретну операційну та інтеграція з існуючим обладнанням.
Вимоги до системи в OR
Медичні вимоги жорсткі: IEC 62304 (життєвий цикл ПЗ медичного пристрою), FDA 510(k) або CE MDR для використання в клініці. Це не просто CV-розробка — це медична розробка з відповідною документацією, валідацією та сертифікацією.
Обчислювальна платформа: NVIDIA IGX Orin (medically-qualified platform) або NVIDIA Clara Holoscan для real-time медичних AI-систем. Підтримує обробку 4K 60fps при затримці < 1 frame.
Порівняння методів сегментації інструментів
| Метод |
mAP50 |
Latency (ms) |
Стійкість до окклюзій |
| Mask R-CNN |
0.91 |
45 |
Середня |
| YOLOv8m-seg |
0.89 |
12 |
Висока |
| HRNet + Kalman |
0.87 |
18 |
Дуже висока |
Терміни
Дослідницька система для конкретної задачі (трекінг інструментів або сегментація однієї структури): 3–5 місяців. Production-ready система з медичною валідацією: 9–18 місяців з урахуванням регуляторних вимог. Вартість розробки розраховується індивідуально залежно від складності та обсягу робіт.
Зв'яжіться з нами для обговорення вашого проєкту. Ми допоможемо оцінити завдання та терміни. Отримайте консультацію: наші інженери проаналізують ваші дані та запропонують оптимальне рішення. Замовте консультацію сьогодні.
Технічні деталі пайплайну
Для трекінгу використовується комбінація YOLOv8-seg + Kalman filter. Сегментація тканин виконується за допомогою TransFuse. Depth estimation — гібрид стерео та DPT. Весь пайплайн оптимізований з TensorRT і запускається на IGX Orin з latency < 50 ms.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.