AI-система аналізу медичних зображень
Уявіть: рентгенолог переглядає 100 знімків на день, втома наростає, а пропущений вузлик у легені — це вже клінічний випадок. Ми стикалися з ситуацією, коли модель дає 99% accuracy, але на рідкісній патології помиляється з катастрофічною впевненістю. Саме тому ми будуємо медичні CV-системи, які не просто детектують аномалії, але й чесно повідомляють про невпевненість, а лікар залишається в контурі прийняття рішень.
Медичний CV вимагає не тільки високої accuracy, але й каліброваної впевненості, інтерпретовності (Grad-CAM, SHAP), відповідності регуляторам (MDR, FDA 510(k)) та обов'язкового human-in-the-loop для високоризикових рішень. Наш досвід — 7+ років в ML для охорони здоров'я, 12+ комерційних проєктів, включаючи сертифіковані системи. Гарантуємо прозорість кожного етапу — від прототипу до клінічного застосування.
Які архітектури оптимальні для медичної CV?
Вибір backbone залежить від модальності. DenseNet121 показує найкраще співвідношення якість/швидкість для рентгену — на 15% вище AUC порівняно з ResNet50 на CheXpert. Для КТ використовуємо 3D ResNet або 2.5D ensemble (3 ортогональні зрізи). В гістології ефективна EfficientNet з патч-стратегією (слайд розбивається на 512x512 тайли). За нашими тестами, EfficientNet-B3 перевершує DenseNet121 за F1 на 0.03 при рівній швидкості виведення, але потребує більше GPU пам'яті.
Чому пояснюваність критична в медичному AI?
Лікар ніколи не повірить "чорному ящику". Grad-CAM показує, на якому регіоні модель фокусується: затемнення в легені, потовщення плеври. Дослідження Rajpurkar et al. (2017) показало, що CheXNet досягає AUC 0.92, але без пояснення модель марна в клініці. Ми завжди постачаємо heatmap разом з передбаченням, а для критичних випадків додаємо SHAP-значення. Більше про Grad-CAM.
Як ми будуємо надійний пайплайн попередньої обробки?
Попередня обробка — основа будь-якої медичної CV-системи. DICOM-файли містять метадані (RescaleSlope, WindowCenter) та піксельні масиви в Hounsfield units для КТ. Без правильного windowing модель буде бачити «шум» замість патології. Ми використовуємо pydicom (офіційна документація) для читання та перетворення. Для рентгену — перцентильне масштабування (1-99%), для КТ — віконне з налаштовуваними параметрами.
Також обов'язкова аугментація: RandomRotation, ElasticTransform, але з обережністю — медичні дані чутливі до геометричних спотворень.
import pydicom import numpy as np import cv2 def dicom_to_array( dcm_path: str, target_modality: str = 'xray', window_center: float = None, window_width: float = None ) -> np.ndarray: """ Нормалізація DICOM в діапазон [0, 255] uint8. Для КТ обов'язково windowing по HU. """ dcm = pydicom.dcmread(dcm_path) array = dcm.pixel_array.astype(np.float32) slope = float(getattr(dcm, 'RescaleSlope', 1)) intercept = float(getattr(dcm, 'RescaleIntercept', 0)) array = array * slope + intercept if target_modality == 'ct': wc = window_center or float(getattr(dcm, 'WindowCenter', -600)) ww = window_width or float(getattr(dcm, 'WindowWidth', 1500)) lower = wc - ww / 2 upper = wc + ww / 2 array = np.clip(array, lower, upper) elif target_modality == 'xray': p1, p99 = np.percentile(array, [1, 99]) array = np.clip(array, p1, p99) arr_min, arr_max = array.min(), array.max() if arr_max > arr_min: array = (array - arr_min) / (arr_max - arr_min) * 255 return array.astype(np.uint8) Детекція патологій на рентгені: CheXNet-підхід
import torch import torch.nn as nn import timm from torch.cuda.amp import autocast PATHOLOGY_CLASSES = [ 'Atelectasis', 'Cardiomegaly', 'Consolidation', 'Edema', 'Enlarged Cardiomediastinum', 'Fracture', 'Lung Lesion', 'Lung Opacity', 'No Finding', 'Pleural Effusion', 'Pleural Other', 'Pneumonia', 'Pneumothorax', 'Support Devices' ] class ChestXRayClassifier(nn.Module): def __init__( self, backbone: str = 'densenet121', num_classes: int = 14, pretrained: bool = True ): super().__init__() self.backbone = timm.create_model( backbone, pretrained=pretrained, num_classes=0, global_pool='avg' ) feat_dim = self.backbone.num_features self.classifier = nn.Sequential( nn.Linear(feat_dim, 512), nn.ReLU(), nn.Dropout(0.3), nn.Linear(512, num_classes) ) def forward(self, x: torch.Tensor) -> torch.Tensor: features = self.backbone(x) return self.classifier(features) class WeightedBCEWithLogitsLoss(nn.Module): def __init__(self, pos_weights: torch.Tensor): """ pos_weights[i] = n_neg[i] / n_pos[i] для класу i. CheXpert: типовий дисбаланс 15:1 - 100:1. """ super().__init__() self.loss_fn = nn.BCEWithLogitsLoss(pos_weight=pos_weights) def forward(self, logits, targets): return self.loss_fn(logits, targets) Grad-CAM для пояснюваності
Інтерпретовність обов'язкова — лікар бачить, де модель помиляється або права. Grad-CAM генерує теплову карту, що накладається на оригінал.
import torch import numpy as np import cv2 class GradCAM: def __init__(self, model: nn.Module, target_layer: nn.Module): self.model = model self.gradients = None self.activations = None target_layer.register_forward_hook( lambda m, i, o: setattr(self, 'activations', o) ) target_layer.register_backward_hook( lambda m, gi, go: setattr(self, 'gradients', go[0]) ) def generate( self, image_tensor: torch.Tensor, target_class: int, original_size: tuple ) -> np.ndarray: self.model.eval() output = self.model(image_tensor) self.model.zero_grad() output[0, target_class].backward() weights = self.gradients.mean(dim=[2, 3], keepdim=True) cam = (weights * self.activations).sum(dim=1, keepdim=True) cam = torch.relu(cam).squeeze().cpu().numpy() cam = (cam - cam.min()) / (cam.max() - cam.min() + 1e-8) cam = cv2.resize(cam, (original_size[1], original_size[0])) return cam Як ми тестуємо модель на рідкісних патологіях?
Для рідкісних захворювань (поширеність < 1%) стандартний train/test поділ не підходить. Ми використовуємо few-shot learning (модель навчається на 5-10 прикладах) і реалістичну симуляцію: підкладаємо рідкісні патології в тестовий набір з різними дозами. Метрики рахуємо окремо для частих і рідкісних класів. Якщо recall на рідкісному класі < 0.7 — включаємо додатковий детектор або rule-based фільтр. Такий підхід вже застосовувався в проєкті з виявлення інтерстиціальних захворювань легень: recall виріс з 0.4 до 0.85.
Метрики для медичної класифікації
| Метрика | Використання | Чому не accuracy |
|---|---|---|
| AUC-ROC | Основна метрика | Стійка до дисбалансу |
| Sensitivity (Recall) | Критична для скринінгу | Пропустити хворобу — гірше |
| Specificity | Баланс з sensitivity | Хибні тривоги — навантаження |
| F1 (micro/macro) | Multi-label задачі | Баланс P/R |
| Calibration (ECE) | Впевненість моделі | Для клінічної довіри |
Процес роботи
- Аналітика та аудит даних: збір вимог, оцінка якості датасету, розподіл класів.
- Проектування архітектури: вибір backbone (DenseNet, 3D ResNet, EfficientNet), стратегія fine-tuning (LoRA, full fine-tune).
- Навчання та валідація: крос-валідація, моніторинг метрик (AUC, sensitivity, ECE), тестування на рідкісних класах.
- Інтеграція пояснюваності: Grad-CAM, SHAP для кожного передбачення.
- Деплой та MLOps: Triton Inference Server, ONNX Runtime, A/B тестування, логування дрейфу.
- Документація та сертифікація: model card, звіт з валідації, підтримка при підготовці до CE/FDA.
Строки
| Задача | Строк |
|---|---|
| Класифікатор патологій рентгену (fine-tuning) | 4–6 тижнів |
| Детекція/сегментація на КТ/МРТ | 8–14 тижнів |
| Медична система з CE/FDA-документацією | 20–40 тижнів |
Готові оцінити ваш датасет і порахувати метрики на пілотному проєкті? Зв'яжіться з нами — проведемо аудит за 2 дні та запропонуємо архітектуру. Реалізуємо систему під ключ: від збору вимог до розгортання в клініці.







