Хирург, работающий через консоль da Vinci, видит операционное поле через стереокамеру с 10-кратным увеличением. Движения его рук масштабируются и фильтруются от тремора. Но даже лучшая роботизированная система не даёт ответа на ключевые вопросы: не задета ли артерия? достаточно ли натяжения ткани? Мы разрабатываем AI-системы компьютерного зрения, которые добавляют этот контекст в реальном времени. Наша CV-система отслеживает положение инструментов, сегментирует анатомические структуры и строит 3D-карту операционного поля. Это не исследовательский прототип — это production-ready решения, сертифицированные по IEC 62304. Наш опыт — 10+ лет в машинном зрении и 5 проектов в медицинской робототехнике. Получите консультацию: оценим ваш проект за 2 дня.
Ниже разберём три ключевые задачи: трекинг инструментов, сегментацию тканей и depth estimation для AR-overlay. Покажем, какие модели работают в операционной, и расскажем о сроках внедрения.
Задачи CV в хирургической робототехнике
Трекинг хирургических инструментов
Базовая задача, без которой не работает большинство остального. Система должна знать в реальном времени: где находится каждый инструмент (зажим, ножницы, игла), его ориентацию в 3D-пространстве, скорость движения.
Instance segmentation подход: Mask R-CNN или YOLOv8m-seg для сегментации каждого инструмента попиксельно. На датасете Cholec80 (80 видео лапароскопических холецистэктомий) fine-tuned YOLOv8m-seg даёт mAP50 = 0.89 для детекции инструментов. YOLOv8m-seg быстрее Mask R-CNN в 3 раза при сопоставимой точности.
Keypoint detection подход: для точной оценки ориентации — детекция ключевых точек инструмента (кончик, соединение бранш, рукоятка). ViTPose или HRNet адаптированные для хирургических инструментов.
Как решается проблема окклюзий инструментов?
Частичная видимость и окклюзии — когда инструменты перекрывают друг друга или уходят за край кадра. Temporal prediction (калмановский фильтр или RNN) восстанавливает трек при временной потере. В наших проектах мы используем комбинацию YOLOv8-seg и Kalman filter с наблюдаемостью на 5-10 кадров назад.
Сегментация анатомических структур
Различение критических структур (желчный проток, артерии, нервы) от окружающих тканей — задача с высочайшими требованиями к точности. Ошибка здесь = травма пациента.
Специфика: интраоперационное изображение — не чистая анатомия учебника. Кровь, дым от электрокоагулятора, деформация тканей при манипуляциях. Модель должна быть устойчива к этим артефактам.
Датасеты: CholecSeg8k (8 000 аннотированных кадров холецистэктомий, 13 классов тканей), Endoscapes (эндоскопические сцены), KidneyVSS. Архитектура: TransFuse (CNN + Transformer fusion) или HardNet — специализированные для медицинской сегментации.
Почему depth estimation — самая сложная задача?
Технически наиболее сложная часть. Хирург оперирует в 3D-пространстве, но видит 2D-изображение (если нет стереосистемы). Depth estimation позволяет восстанавливать 3D из монокулярного лапароскопического видео.
Почему это сложно
Эндоскопическое изображение нарушает большинство предположений, на которых работают стандартные depth estimation модели:
- Дистортия объектива значительная (широкоугольная оптика эндоскопа)
- Отсутствие текстуры на однородных тканях (модели не видят parallax)
- Specular highlights — блики от мокрых тканей обманывают модель
- Деформация мягких тканей — в отличие от статичных сцен, ткани движутся и деформируются
Подходы
Self-supervised depth estimation (Monodepth2, DynDepth): обучение без размеченных глубинных карт, только из последовательностей кадров. Фотометрическая loss + ego-motion prediction. На лапароскопических данных: AbsRel ≈ 0.12–0.18 — приемлемо для относительных оценок.
Стерео + structured light: da Vinci Xi имеет stereo endoscope. Disparity из stereo matching (RAFT-Stereo, CFNet) даёт точную абсолютную глубину. AbsRel < 0.05 при правильной калибровке.
Гибридный подход: depth estimation как prior + sparse 3D landmarks из feature matching (SuperGlue + SuperPoint) для уточнения. Используется для AR-overlay анатомического атласа поверх видео.
| Метод | AbsRel | Требует стерео | Задержка (мс) |
|---|---|---|---|
| Monodepth2 (self-sup) | 0.16 | Нет | 12 |
| RAFT-Stereo | 0.04 | Да | 28 |
| DPT (mono) | 0.14 | Нет | 18 |
| Гибрид (Stereo + DPT) | 0.03 | Да | 35 |
Augmented Reality overlay
Наложение анатомического атласа (структуры, которые нельзя задеть) поверх хирургического видео в реальном времени. Pipeline: Depth estimation → 3D registration с предоперационным CT/MRI → деформационная модель ткани (для учёта движений) → AR-рендер.
Latency требование: < 50 ms конец-в-конец. Это диктует выбор архитектуры: только лёгкие модели или специализированное GPU.
Процесс разработки AI-системы под ключ
Мы применяем пошаговый подход, чтобы минимизировать риски и обеспечить соответствие медицинским стандартам.
- Анализ задачи: сбор требований, выбор целевых задач (трекинг, сегментация, depth estimation), оценка доступных данных.
- Сбор и разметка данных: аннотация кадров (маски инструментов, ключевые точки, глубинные карты). Используем внутренние тулы для семантической сегментации. Экономия времени на этапе разметки — до 40% за счёт активного обучения.
- Обучение и валидация: подбор архитектуры, fine-tuning на медицинских датасетах, оценка по AbsRel, mAP, latency.
- Интеграция и оптимизация: ONNX Runtime или TensorRT для ускорения, развёртывание на платформе NVIDIA IGX Orin.
- Тестирование и сертификация: проверка на репрезентативных данных, документирование по IEC 62304.
- Деплой и поддержка: установка в операционной, обучение персонала, гарантийное обслуживание.
Что входит в работу
- Документация: модель карта, описание архитектуры, инструкция по эксплуатации.
- Обучение команды клиента работе с системой.
- Техническая поддержка на этапе внедрения и гарантийный период.
- Адаптация под конкретную операционную и интеграция с существующим оборудованием.
Требования к системе в OR
Медицинские требования жёсткие: IEC 62304 (жизненный цикл ПО медицинского устройства), FDA 510(k) или CE MDR для использования в клинике. Это не просто CV-разработка — это медицинская разработка с соответствующей документацией, валидацией и сертификацией.
Вычислительная платформа: NVIDIA IGX Orin (medically-qualified platform) или NVIDIA Clara Holoscan для real-time медицинских AI-систем. Поддерживает обработку 4K 60fps при задержке < 1 frame.
Сравнение методов сегментации инструментов
| Метод | mAP50 | Latency (ms) | Устойчивость к окклюзиям |
|---|---|---|---|
| Mask R-CNN | 0.91 | 45 | Средняя |
| YOLOv8m-seg | 0.89 | 12 | Высокая |
| HRNet + Kalman | 0.87 | 18 | Очень высокая |
Сроки
Исследовательская система для конкретной задачи (трекинг инструментов или сегментация одной структуры): 3–5 месяцев. Production-ready система с медицинской валидацией: 9–18 месяцев с учётом регуляторных требований. Стоимость разработки рассчитывается индивидуально в зависимости от сложности и объёма работ.
Свяжитесь с нами для обсуждения вашего проекта. Мы поможем оценить задачи и сроки. Получите консультацию: наши инженеры проанализируют ваши данные и предложат оптимальное решение. Закажите консультацию сегодня.
Технические детали пайплайна
Для трекинга используется комбинация YOLOv8-seg + Kalman filter. Сегментация тканей выполняется с помощью TransFuse. Depth estimation — гибрид стерео и DPT. Весь пайплайн оптимизирован с TensorRT и запускается на IGX Orin с latency < 50 ms.







