AI для хирургических роботов: сегментация, трекинг, ассистенция

Хирург, работающий через консоль [da Vinci](https://en.wikipedia.org/wiki/Da_Vinci_Surgical_System), видит операционное поле через стереокамеру с 10-кратным увеличением. Движения его рук масштабируются и фильтруются от тремора. Но даже лучшая роботизированная система не даёт ответа на ключевые вопро

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1003

Хирург, работающий через консоль da Vinci, видит операционное поле через стереокамеру с 10-кратным увеличением. Движения его рук масштабируются и фильтруются от тремора. Но даже лучшая роботизированная система не даёт ответа на ключевые вопросы: не задета ли артерия? достаточно ли натяжения ткани? Мы разрабатываем AI-системы компьютерного зрения, которые добавляют этот контекст в реальном времени. Наша CV-система отслеживает положение инструментов, сегментирует анатомические структуры и строит 3D-карту операционного поля. Это не исследовательский прототип — это production-ready решения, сертифицированные по IEC 62304. Наш опыт — 10+ лет в машинном зрении и 5 проектов в медицинской робототехнике. Получите консультацию: оценим ваш проект за 2 дня.

Ниже разберём три ключевые задачи: трекинг инструментов, сегментацию тканей и depth estimation для AR-overlay. Покажем, какие модели работают в операционной, и расскажем о сроках внедрения.

Задачи CV в хирургической робототехнике

Трекинг хирургических инструментов

Базовая задача, без которой не работает большинство остального. Система должна знать в реальном времени: где находится каждый инструмент (зажим, ножницы, игла), его ориентацию в 3D-пространстве, скорость движения.

Instance segmentation подход: Mask R-CNN или YOLOv8m-seg для сегментации каждого инструмента попиксельно. На датасете Cholec80 (80 видео лапароскопических холецистэктомий) fine-tuned YOLOv8m-seg даёт mAP50 = 0.89 для детекции инструментов. YOLOv8m-seg быстрее Mask R-CNN в 3 раза при сопоставимой точности.

Keypoint detection подход: для точной оценки ориентации — детекция ключевых точек инструмента (кончик, соединение бранш, рукоятка). ViTPose или HRNet адаптированные для хирургических инструментов.

Как решается проблема окклюзий инструментов?

Частичная видимость и окклюзии — когда инструменты перекрывают друг друга или уходят за край кадра. Temporal prediction (калмановский фильтр или RNN) восстанавливает трек при временной потере. В наших проектах мы используем комбинацию YOLOv8-seg и Kalman filter с наблюдаемостью на 5-10 кадров назад.

Сегментация анатомических структур

Различение критических структур (желчный проток, артерии, нервы) от окружающих тканей — задача с высочайшими требованиями к точности. Ошибка здесь = травма пациента.

Специфика: интраоперационное изображение — не чистая анатомия учебника. Кровь, дым от электрокоагулятора, деформация тканей при манипуляциях. Модель должна быть устойчива к этим артефактам.

Датасеты: CholecSeg8k (8 000 аннотированных кадров холецистэктомий, 13 классов тканей), Endoscapes (эндоскопические сцены), KidneyVSS. Архитектура: TransFuse (CNN + Transformer fusion) или HardNet — специализированные для медицинской сегментации.

Почему depth estimation — самая сложная задача?

Технически наиболее сложная часть. Хирург оперирует в 3D-пространстве, но видит 2D-изображение (если нет стереосистемы). Depth estimation позволяет восстанавливать 3D из монокулярного лапароскопического видео.

Почему это сложно

Эндоскопическое изображение нарушает большинство предположений, на которых работают стандартные depth estimation модели:

  • Дистортия объектива значительная (широкоугольная оптика эндоскопа)
  • Отсутствие текстуры на однородных тканях (модели не видят parallax)
  • Specular highlights — блики от мокрых тканей обманывают модель
  • Деформация мягких тканей — в отличие от статичных сцен, ткани движутся и деформируются

Подходы

Self-supervised depth estimation (Monodepth2, DynDepth): обучение без размеченных глубинных карт, только из последовательностей кадров. Фотометрическая loss + ego-motion prediction. На лапароскопических данных: AbsRel ≈ 0.12–0.18 — приемлемо для относительных оценок.

Стерео + structured light: da Vinci Xi имеет stereo endoscope. Disparity из stereo matching (RAFT-Stereo, CFNet) даёт точную абсолютную глубину. AbsRel < 0.05 при правильной калибровке.

Гибридный подход: depth estimation как prior + sparse 3D landmarks из feature matching (SuperGlue + SuperPoint) для уточнения. Используется для AR-overlay анатомического атласа поверх видео.

Метод AbsRel Требует стерео Задержка (мс)
Monodepth2 (self-sup) 0.16 Нет 12
RAFT-Stereo 0.04 Да 28
DPT (mono) 0.14 Нет 18
Гибрид (Stereo + DPT) 0.03 Да 35

Augmented Reality overlay

Наложение анатомического атласа (структуры, которые нельзя задеть) поверх хирургического видео в реальном времени. Pipeline: Depth estimation → 3D registration с предоперационным CT/MRI → деформационная модель ткани (для учёта движений) → AR-рендер.

Latency требование: < 50 ms конец-в-конец. Это диктует выбор архитектуры: только лёгкие модели или специализированное GPU.

Процесс разработки AI-системы под ключ

Мы применяем пошаговый подход, чтобы минимизировать риски и обеспечить соответствие медицинским стандартам.

  1. Анализ задачи: сбор требований, выбор целевых задач (трекинг, сегментация, depth estimation), оценка доступных данных.
  2. Сбор и разметка данных: аннотация кадров (маски инструментов, ключевые точки, глубинные карты). Используем внутренние тулы для семантической сегментации. Экономия времени на этапе разметки — до 40% за счёт активного обучения.
  3. Обучение и валидация: подбор архитектуры, fine-tuning на медицинских датасетах, оценка по AbsRel, mAP, latency.
  4. Интеграция и оптимизация: ONNX Runtime или TensorRT для ускорения, развёртывание на платформе NVIDIA IGX Orin.
  5. Тестирование и сертификация: проверка на репрезентативных данных, документирование по IEC 62304.
  6. Деплой и поддержка: установка в операционной, обучение персонала, гарантийное обслуживание.

Что входит в работу

  • Документация: модель карта, описание архитектуры, инструкция по эксплуатации.
  • Обучение команды клиента работе с системой.
  • Техническая поддержка на этапе внедрения и гарантийный период.
  • Адаптация под конкретную операционную и интеграция с существующим оборудованием.

Требования к системе в OR

Медицинские требования жёсткие: IEC 62304 (жизненный цикл ПО медицинского устройства), FDA 510(k) или CE MDR для использования в клинике. Это не просто CV-разработка — это медицинская разработка с соответствующей документацией, валидацией и сертификацией.

Вычислительная платформа: NVIDIA IGX Orin (medically-qualified platform) или NVIDIA Clara Holoscan для real-time медицинских AI-систем. Поддерживает обработку 4K 60fps при задержке < 1 frame.

Сравнение методов сегментации инструментов

Метод mAP50 Latency (ms) Устойчивость к окклюзиям
Mask R-CNN 0.91 45 Средняя
YOLOv8m-seg 0.89 12 Высокая
HRNet + Kalman 0.87 18 Очень высокая

Сроки

Исследовательская система для конкретной задачи (трекинг инструментов или сегментация одной структуры): 3–5 месяцев. Production-ready система с медицинской валидацией: 9–18 месяцев с учётом регуляторных требований. Стоимость разработки рассчитывается индивидуально в зависимости от сложности и объёма работ.

Свяжитесь с нами для обсуждения вашего проекта. Мы поможем оценить задачи и сроки. Получите консультацию: наши инженеры проанализируют ваши данные и предложат оптимальное решение. Закажите консультацию сегодня.

Технические детали пайплайна

Для трекинга используется комбинация YOLOv8-seg + Kalman filter. Сегментация тканей выполняется с помощью TransFuse. Depth estimation — гибрид стерео и DPT. Весь пайплайн оптимизирован с TensorRT и запускается на IGX Orin с latency < 50 ms.