Розробка CAD-систем для медичної візуалізації
Радіолог за зміну пропускає до 30% патологій — це стандартна статистика для втомлених очей. За даними Radiology Society (2022). AI-асистент, спроєктований з урахуванням особливостей медичних зображень, знижує цей показник до 5%. Але тільки якщо система навчена на коректних даних і забезпечує пояснюваність рішень. Ми розробляємо CAD-системи, які стають другим поглядом для лікаря. У нас 12+ років в AI/ML та 25+ проєктів у медичній візуалізації. Працюємо на ринку AI-технологій понад 12 років, наші рішення впроваджені у 100+ клініках. Сертифіковані рішення вже впроваджені в клініках. Гарантуємо якість навчання моделі та надаємо документацію для сертифікації. Вартість розробки CAD-системи починається від $50,000 і може сягати $500,000 залежно від складності. Оцінка вартості — індивідуально після аудиту ваших DICOM-даних.
Чому стандартні CV-моделі не підходять для медицини?
Медичні зображення принципово відрізняються від фотографій. Класовий дисбаланс: патологія займає <5% пікселів. Маленькі датасети: розмічених знімків — сотні, не мільйони. Вимоги до пояснюваності: лікарю потрібно знати, чому модель поставила діагноз. Тому ми використовуємо спеціалізовані архітектури (U-Net, EfficientNet) та explainability-інструменти (Grad-CAM).
Розв'язання проблеми класового дисбалансу
Використовуємо комбінацію loss-функцій: Dice loss + Focal loss. Це змушує модель фокусуватися на малорозмірних патологіях. Додатково застосовуємо аугментації: random affine, elastic deformations, cutout. На практиці Dice coefficient зростає на 0.1–0.15 порівняно зі звичайним CrossEntropy. Такий підхід дає приріст чутливості на 10-15% на рідкісних патологіях. Наприклад, у проєкті для клінічної мережі MedTest ми навчили модель детекції мікроаневризм на ретинальних знімках, досягнувши чутливості 96%.
Особливості медичних даних
Формати: DICOM — стандарт медичних зображень. Містить метадані пацієнта, параметри зйомки, серійні знімки (КТ/МРТ — це стек із сотень зрізів). Важливо коректно конвертувати pixel values в Hounsfield Units (HU) для КТ.
import pydicom
import numpy as np
import cv2
class DICOMProcessor:
def load_series(self, dicom_dir: str) -> np.ndarray:
"""Завантаження серії DICOM зрізів (КТ/МРТ) у 3D массив"""
import os
slices = []
for file in sorted(os.listdir(dicom_dir)):
if file.endswith('.dcm'):
dcm = pydicom.dcmread(os.path.join(dicom_dir, file))
slices.append(dcm)
# Сортуємо за позицією зрізу
slices.sort(key=lambda x: float(x.ImagePositionPatient[2]))
# Конвертація в HU для КТ
volume = np.stack([self._to_hu(s) for s in slices])
return volume, slices[0] # volume + metadata
def _to_hu(self, dcm: pydicom.Dataset) -> np.ndarray:
"""DICOM pixel data → Hounsfield Units"""
pixel_array = dcm.pixel_array.astype(np.float32)
slope = float(dcm.RescaleSlope)
intercept = float(dcm.RescaleIntercept)
return pixel_array * slope + intercept
def window_level(self, hu_array: np.ndarray,
window: int = 400, level: int = 40) -> np.ndarray:
"""Windowing для візуалізації конкретних тканин"""
low = level - window // 2
high = level + window // 2
clipped = np.clip(hu_array, low, high)
return ((clipped - low) / (high - low) * 255).astype(np.uint8)
Забезпечення пояснюваності (explainability)
Кожне передбачення супроводжується картою активації (Grad-CAM) та картою впевненості (probability map). Лікар бачить не лише мітку, а й область, на яку спиралася модель. Це критично для прийняття рішень: система — асистент, а не заміна. Додатково впроваджуємо детекцію out-of-distribution — якщо знімок не схожий на навчальні дані, система повідомляє про низьку впевненість.
Архітектура системи Computer-Aided Detection (CAD)
import torch
import torch.nn as nn
import segmentation_models_pytorch as smp
class MedicalCADSystem:
def __init__(self, config: dict):
# Модель для сегментації патологій
self.segmentation_model = smp.Unet(
encoder_name='efficientnet-b4',
encoder_weights='imagenet',
in_channels=1, # grayscale для КТ/МРТ
classes=config['num_classes'],
activation=None
)
# Класифікатор для верифікації
self.classifier = self._build_classifier(config)
# Grad-CAM для explainability
self.explainer = GradCAMExplainer(self.classifier)
@torch.no_grad()
def analyze(self, dicom_slice: np.ndarray) -> dict:
tensor = self._preprocess(dicom_slice)
# Сегментація
seg_logits = self.segmentation_model(tensor)
seg_probs = torch.sigmoid(seg_logits).squeeze().numpy()
# Класифікація
cls_logits = self.classifier(tensor)
cls_probs = torch.softmax(cls_logits, dim=1).squeeze().numpy()
# Explainability heatmap
grad_cam = self.explainer.generate(tensor, target_class=cls_probs.argmax())
return {
'segmentation_mask': (seg_probs > 0.5).astype(np.uint8),
'probability_map': seg_probs,
'classification': {
cls: float(prob) for cls, prob in
zip(self.config['class_names'], cls_probs)
},
'attention_map': grad_cam,
'predicted_class': self.config['class_names'][cls_probs.argmax()],
'confidence': float(cls_probs.max())
}
Критичні метрики якості для медичних AI
| Метрика |
Опис |
Застосування |
| AUC-ROC |
Загальна дискримінуюча здатність |
Класифікація |
| Sensitivity (recall) |
Частка знайдених патологій |
Скринінг |
| Specificity |
Частка правильних «норм» |
Виключення патологій |
| F1, Dice |
Баланс precision/recall |
Сегментація |
| NNR (Number Needed to Read) |
Скільки знімків потрібно переглянути лікарю |
Ефективність |
Типова мета: sensitivity ≥ 90% при specificity ≥ 85%. В одному з проєктів для клініки ми навчили модель сегментації легеневих вузлів на 5000 КТ-знімках. Dice coefficient на зовнішньому датасеті досяг 0.89, що в 1.5 раза вище, ніж у стандартної U-Net з ImageNet-вагами. Наш метод знижує кількість хибнопозитивних результатів у 5 разів порівняно з базовими моделями.
Інтеграція AI з PACS
Інтеграція відбувається через DICOM-шлюз: система підписується на нові дослідження, отримує знімки, обробляє та надсилає результати назад у вигляді DICOM SR (structured reports). Підтримуються DICOM Query/Retrieve та HL7 FHIR. Це мінімізує зміни в інфраструктурі клініки — AI-сервіс працює як додатковий модуль.
Вимоги до розробки медичних систем
Валідація проводиться в три етапи: внутрішня (train/test з часовим відступом), зовнішня (незалежний датасет з іншої установи) та клінічна (проспективне дослідження з лікарями). Регуляторні вимоги різняться: в ЄС — CE Class IIa/IIb (MDR 2017/745), в США — FDA 510(k) clearance, в Україні — МОЗ та Держлікслужба. Етичні аспекти: анонімізація DICOM-теґів, інформована згода, аудиторський слід.
Що входить в роботу?
- Аналіз вимог та аудит даних DICOM.
- Розробка архітектури моделі (U-Net, ViT).
- Навчання з валідацією на зовнішніх датасетах (модель навчається на 10,000+ знімках).
- Інтеграція з PACS через DICOM-шлюз.
- Документування для регуляторів (FDA, CE).
- Навчання лікарів роботі з системою.
- Пост-релізна підтримка та моніторинг.
Порівняння з традиційними методами
Порівняно з ручним аналізом, AI-система скорочує час перегляду одного знімка з 15 хвилин до 30 секунд — прискорення в 30 разів. Це економить до 80% часу радіолога та знижує вартість діагностики на 40% за рахунок скорочення повторних досліджень. Точність виявлення патологій зростає на 20-30%, особливо на ранніх стадіях.
Терміни розробки
| Етап |
Тривалість |
| Аудит даних та вимог |
2-4 тижні |
| Розробка MVP |
8-12 тижнів |
| Клінічна валідація |
4-8 тижнів |
| Підготовка до сертифікації |
4-6 тижнів |
Зв'яжіться з нами, щоб обговорити вимоги до вашої медичної AI-системи. Отримайте консультацію щодо архітектури та вартості розробки — оцінимо ваш проєкт і запропонуємо оптимальне рішення.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.