Хірург, що працює через консоль da Vinci, бачить операційне поле через стереокамеру з 10-кратним збільшенням. Рухи його рук масштабуються та фільтруються від тремору. Але навіть найкраща роботизована система не дає відповіді на ключові питання: чи не зачеплена артерія? чи достатньо натягу тканини? Ми розробляємо AI-системи комп'ютерного зору, які додають цей контекст у реальному часі. Наша CV-система відстежує положення інструментів, сегментує анатомічні структури і будує 3D-карту операційного поля. Це не дослідницький прототип — це production-ready рішення, сертифіковані за IEC 62304. Наш досвід — 10+ років у машинному зорі та 5 проєктів у медичній робототехніці. Отримайте консультацію: оцінимо ваш проєкт за 2 дні.
Нижче розберемо три ключові завдання: трекінг інструментів, сегментацію тканин і depth estimation для AR-overlay. Покажемо, які моделі працюють в операційній, і розповімо про терміни впровадження.
Задачі CV в хірургічній робототехніці
Трекінг хірургічних інструментів
Базова задача, без якої не працює більшість іншого. Система повинна знати в реальному часі: де знаходиться кожен інструмент (затискач, ножиці, голка), його орієнтацію в 3D-просторі, швидкість руху.
Instance segmentation підхід: Mask R-CNN або YOLOv8m-seg для сегментації кожного інструмента попіксельно. На датасеті Cholec80 (80 відео лапароскопічних холецистектомій) fine-tuned YOLOv8m-seg дає mAP50 = 0.89 для детекції інструментів. YOLOv8m-seg швидший за Mask R-CNN у 3 рази при порівнянній точності.
Keypoint detection підхід: для точної оцінки орієнтації — детекція ключових точок інструмента (кінчик, з'єднання бранш, рукоятка). ViTPose або HRNet адаптовані для хірургічних інструментів.
Як вирішується проблема окклюзій інструментів?
Часткова видимість та окклюзії — коли інструменти перекривають один одного або виходять за край кадру. Temporal prediction (калманівський фільтр або RNN) відновлює трек при тимчасовій втраті. У наших проєктах ми використовуємо комбінацію YOLOv8-seg і Kalman filter з спостережуваністю на 5-10 кадрів назад.
Сегментація анатомічних структур
Розрізнення критичних структур (жовчна протока, артерії, нерви) від навколишніх тканин — задача з найвищими вимогами до точності. Помилка тут = травма пацієнта.
Специфіка: інтраопераційне зображення — не чиста анатомія підручника. Кров, дим від електрокоагулятора, деформація тканин при маніпуляціях. Модель повинна бути стійкою до цих артефактів.
Датасети: CholecSeg8k (8 000 анотованих кадрів холецистектомій, 13 класів тканин), Endoscapes (ендоскопічні сцени), KidneyVSS. Архітектура: TransFuse (CNN + Transformer fusion) або HardNet — спеціалізовані для медичної сегментації.
Чому depth estimation — найскладніша задача?
Технічно найбільш складна частина. Хірург оперує в 3D-просторі, але бачить 2D-зображення (якщо немає стереосистеми). Depth estimation дозволяє відновлювати 3D з монокулярного лапароскопічного відео.
Чому це складно
Ендоскопічне зображення порушує більшість припущень, на яких працюють стандартні depth estimation моделі:
- Дисторсія об'єктива значна (ширококутна оптика ендоскопа)
- Відсутність текстури на однорідних тканинах (моделі не бачать parallax)
- Specular highlights — відблиски від вологих тканин обманюють модель
- Деформація м'яких тканин — на відміну від статичних сцен, тканини рухаються та деформуються
Підходи
Self-supervised depth estimation (Monodepth2, DynDepth): навчання без розмічених глибинних карт, тільки з послідовностей кадрів. Фотометрична loss + ego-motion prediction. На лапароскопічних даних: AbsRel ≈ 0.12–0.18 — прийнятно для відносних оцінок.
Стерео + structured light: da Vinci Xi має stereo endoscope. Disparity з stereo matching (RAFT-Stereo, CFNet) дає точну абсолютну глибину. AbsRel < 0.05 при правильному калібруванні.
Гібридний підхід: depth estimation як prior + sparse 3D landmarks з feature matching (SuperGlue + SuperPoint) для уточнення. Використовується для AR-overlay анатомічного атласу поверх відео.
| Метод | AbsRel | Вимагає стерео | Затримка (мс) |
|---|---|---|---|
| Monodepth2 (self-sup) | 0.16 | Ні | 12 |
| RAFT-Stereo | 0.04 | Так | 28 |
| DPT (mono) | 0.14 | Ні | 18 |
| Гібрид (Stereo + DPT) | 0.03 | Так | 35 |
Augmented Reality overlay
Накладання анатомічного атласу (структури, які не можна зачепити) поверх хірургічного відео в реальному часі. Pipeline: Depth estimation → 3D registration з передопераційним CT/MRI → деформаційна модель тканини (для врахування рухів) → AR-рендер.
Latency вимога: < 50 ms кінець-в-кінець. Це диктує вибір архітектури: тільки легкі моделі або спеціалізоване GPU.
Процес розробки AI-системи під ключ
Ми застосовуємо покроковий підхід, щоб мінімізувати ризики та забезпечити відповідність медичним стандартам.
- Аналіз задачі: збір вимог, вибір цільових задач (трекінг, сегментація, depth estimation), оцінка доступних даних.
- Збір і розмітка даних: анотація кадрів (маски інструментів, ключові точки, глибинні карти). Використовуємо внутрішні тули для семантичної сегментації. Економія часу на етапі розмітки — до 40% за рахунок активного навчання.
- Навчання та валідація: підбір архітектури, fine-tuning на медичних датасетах, оцінка за AbsRel, mAP, latency.
- Інтеграція та оптимізація: ONNX Runtime або TensorRT для прискорення, розгортання на платформі NVIDIA IGX Orin.
- Тестування та сертифікація: перевірка на репрезентативних даних, документування за IEC 62304.
- Деплой та підтримка: встановлення в операційній, навчання персоналу, гарантійне обслуговування.
Що входить у роботу
- Документація: модель карта, опис архітектури, інструкція з експлуатації.
- Навчання команди клієнта роботі з системою.
- Технічна підтримка на етапі впровадження та гарантійний період.
- Адаптація під конкретну операційну та інтеграція з існуючим обладнанням.
Вимоги до системи в OR
Медичні вимоги жорсткі: IEC 62304 (життєвий цикл ПЗ медичного пристрою), FDA 510(k) або CE MDR для використання в клініці. Це не просто CV-розробка — це медична розробка з відповідною документацією, валідацією та сертифікацією.
Обчислювальна платформа: NVIDIA IGX Orin (medically-qualified platform) або NVIDIA Clara Holoscan для real-time медичних AI-систем. Підтримує обробку 4K 60fps при затримці < 1 frame.
Порівняння методів сегментації інструментів
| Метод | mAP50 | Latency (ms) | Стійкість до окклюзій |
|---|---|---|---|
| Mask R-CNN | 0.91 | 45 | Середня |
| YOLOv8m-seg | 0.89 | 12 | Висока |
| HRNet + Kalman | 0.87 | 18 | Дуже висока |
Терміни
Дослідницька система для конкретної задачі (трекінг інструментів або сегментація однієї структури): 3–5 місяців. Production-ready система з медичною валідацією: 9–18 місяців з урахуванням регуляторних вимог. Вартість розробки розраховується індивідуально залежно від складності та обсягу робіт.
Зв'яжіться з нами для обговорення вашого проєкту. Ми допоможемо оцінити завдання та терміни. Отримайте консультацію: наші інженери проаналізують ваші дані та запропонують оптимальне рішення. Замовте консультацію сьогодні.
Технічні деталі пайплайну
Для трекінгу використовується комбінація YOLOv8-seg + Kalman filter. Сегментація тканин виконується за допомогою TransFuse. Depth estimation — гібрид стерео та DPT. Весь пайплайн оптимізований з TensorRT і запускається на IGX Orin з latency < 50 ms.







