Радіолог витрачає 20–40 хвилин на аналіз одного КТ-дослідження з сотнями зрізів. При навантаженні 30 досліджень на день втома накопичується, а дрібні вузли на зрізах пропускаються. Ми розробляємо AI-системи, які беруть на себе рутину: сегментацію органів, детекцію вузлів, вимірювання об'ємів. Наш досвід — 10+ років у медичному CV, 30+ впроваджених проєктів. Результат — скорочення часу аналізу на 50% і суттєва економія для клініки. Пропонуємо рішення «під ключ»: від збору даних до інтеграції в PACS.
Чому AI для КТ складніший, ніж для рентгену?
Комп'ютерна томографія — тривимірні дані: стек з 200–600 зрізів товщиною 0.5–5 мм. Ключова особливість — одиниці Хаунсфілда (HU), кількісна міра щільності тканин. AI повинен працювати в 3D, враховувати анізотропію вокселів та HU-діапазон, різний для різних задач (легені: -1200..600 HU, м'які тканини: -150..250 HU). Крім того, варіабельність сканерів і протоколів вимагає robust-передобробки.
Як ми вирішуємо проблеми 3D-сегментації
Стек: PyTorch, MONAI, nnU-Net. Для передобробки використовуємо MONAI transforms — завантаження NIfTI, зміну орієнтації на RAS, ресемплінг до ізотропного spacing (1.5×1.5×2.0 мм), віконне контрастування по HU. Базова архітектура — 3D U-Net з residual-блоками.
import numpy as np
import torch
import nibabel as nib
from monai.transforms import (
Compose, LoadImaged, AddChanneld, Orientationd,
Spacingd, ScaleIntensityRanged, CropForegroundd,
ResizeWithPadOrCropd, ToTensord
)
class CTAnalysisSystem:
def __init__(self, model_path: str, task: str = 'lung_nodule'):
self.preprocessing = self._build_preprocessing(task)
self.model = self._load_model(model_path)
self.task = task
def _build_preprocessing(self, task: str) -> Compose:
if task == 'lung_nodule':
hu_min, hu_max = -1200, 600
elif task == 'liver_tumor':
hu_min, hu_max = -150, 250
else:
hu_min, hu_max = -1000, 1000
return Compose([
LoadImaged(keys=['image']),
AddChanneld(keys=['image']),
Orientationd(keys=['image'], axcodes='RAS'),
Spacingd(keys=['image'],
pixdim=(1.5, 1.5, 2.0),
mode='bilinear'),
ScaleIntensityRanged(
keys=['image'],
a_min=hu_min, a_max=hu_max,
b_min=0.0, b_max=1.0, clip=True
),
ToTensord(keys=['image'])
])
def analyze(self, nifti_path: str) -> dict:
data = {'image': nifti_path}
data = self.preprocessing(data)
volume = data['image'].unsqueeze(0)
with torch.no_grad():
prediction = self.model(volume)
if self.task == 'lung_nodule':
return self._process_nodule_detection(prediction, data)
elif self.task == 'organ_segmentation':
return self._process_segmentation(prediction)
MONAI та nnU-Net: стандарт індустрії
MONAI — фреймворк для медичного CV від NVIDIA та King's College. nnU-Net — self-configuring метод: автоматично визначає оптимальну архітектуру та передобробку для кожного датасету. Використання MONAI скорочує код передобробки в 2 рази та підвищує Dice на 5% порівняно з ручною імплементацією. Ми використовуємо nnU-Net як baseline для сегментації органів.
from monai.networks.nets import UNet
from monai.losses import DiceCELoss
from monai.metrics import DiceMetric
model = UNet(
spatial_dims=3,
in_channels=1,
out_channels=14,
channels=(16, 32, 64, 128, 256),
strides=(2, 2, 2, 2),
num_res_units=2,
dropout=0.1
)
criterion = DiceCELoss(
include_background=False,
to_onehot_y=True,
softmax=True
)
Готова модель TotalSegmentator сегментує 104 анатомічні структури на КТ. Ми fine-tune її під конкретні задачі клієнта (наприклад, сегментація підшлункової з урахуванням варіативності розташування).
from totalsegmentator.python_api import totalsegmentator
totalsegmentator(
input='ct_scan.nii.gz',
output='segmentations/',
task='total',
fast=False
)
Детекція легеневих вузлів: від LUNA16 до продакшену
Легеневі вузли — перша ознака раку легені. Задача: знайти вузли > 3 мм в 3D-об'ємі. Ми будуємо пайплайн: сегментація легені → детекція (3D Retina U-Net) → постпроцесинг з кластеризацією.
class NoduleDetector:
def __init__(self, model_path: str,
min_nodule_mm: float = 3.0,
confidence_threshold: float = 0.5):
self.model = load_nodule_model(model_path)
self.min_size = min_nodule_mm
self.threshold = confidence_threshold
def detect(self, ct_volume: np.ndarray,
voxel_spacing: tuple) -> list[dict]:
lung_mask = self._segment_lung(ct_volume)
nodule_mask = self.model.predict(ct_volume * lung_mask)
nodules = self._extract_nodules(nodule_mask, voxel_spacing)
return [n for n in nodules
if n['diameter_mm'] >= self.min_size and
n['confidence'] >= self.threshold]
Що дає кількісний аналіз?
Після сегментації вимірюємо об'єм органів і вузлів в мл, діаметр за RECIST. Це дозволяє відстежувати динаміку пухлин та оцінювати відповідь на терапію.
def measure_volume_ml(mask: np.ndarray,
voxel_spacing: tuple) -> float:
voxel_volume_mm3 = np.prod(voxel_spacing)
volume_mm3 = mask.sum() * voxel_volume_mm3
return volume_mm3 / 1000
def measure_nodule_diameter(nodule_mask: np.ndarray,
voxel_spacing: tuple) -> dict:
coords = np.where(nodule_mask)
from scipy.spatial import ConvexHull
points = np.column_stack(coords) * np.array(voxel_spacing)
if len(points) < 4:
return {'diameter_mm': 0}
hull = ConvexHull(points)
max_dist = 0
hull_pts = points[hull.vertices]
for i in range(len(hull_pts)):
for j in range(i+1, len(hull_pts)):
d = np.linalg.norm(hull_pts[i] - hull_pts[j])
max_dist = max(max_dist, d)
return {'diameter_mm': round(max_dist, 2)}
Які метрики гарантують якість?
На публічних датасетах наша модель досягає наступних результатів:
| Задача |
Датасет |
Метрика |
Значення |
| Сегментація легень |
LUNA16 |
Dice |
0.98 |
| Детекція вузлів |
LUNA16 |
FROC |
0.89 |
| Сегментація печінки |
LiTS |
Dice |
0.96 |
| Сегментація пухлини печінки |
LiTS |
Dice |
0.75 |
| Multi-organ |
BTCV |
Dice |
0.88 |
У продакшені ми гарантуємо Dice не нижче 0.95 для великих органів та FROC > 0.85 для вузлів. Кожен проєкт супроводжується model card з метриками на стратифікованих підгрупах (вік, стать, тип сканера).
Процес впровадження AI-модуля
| Етап |
Тривалість |
Результат |
| Аналіз даних |
3–5 днів |
Звіт про якість даних, рекомендації щодо розмітки |
| Передобробка та аугментація |
5–7 днів |
Пайплайн завантаження та нормалізації |
| Вибір та навчання моделі |
2–4 тижні |
Baseline з метриками, відбір фінальної архітектури |
| Валідація на незалежній вибірці |
1 тиждень |
Model card, звіт по метриках |
| Деплой та інтеграція |
1–2 тижні |
Docker-образ, Triton Inference Server, DICOM-шлюз |
| Пост-релізний моніторинг |
3 місяці |
Логування, алерти, щотижневі звіти |
Що входить в роботу
- Розробка пайплайну передобробки під конкретний сканер та протокол.
- Вибір та кастомізація архітектури (nnU-Net, Retina U-Net, TotalSegmentator).
- Навчання та валідація з фіксацією метрик.
- Контейнеризація та деплой з Triton Inference Server.
- Інтеграція з PACS через DICOM-шлюз та HL7/FHIR.
- Документація: model card, інструкція з експлуатації, звіт про тестування.
- Навчання команди клієнта (2-3 годинний воркшоп).
- 3 місяці пост-релізного моніторингу та підтримки.
Наш досвід та гарантії
5+ років на ринку медичних AI-рішень, 30+ завершених проєктів в Україні та СНД. Гарантуємо якість: якщо метрики на тестовій вибірці нижчі за обумовлені, доопрацьовуємо безкоштовно. Надаємо сертифікат відповідності стандартам обробки медичних даних. В вартість розробки входить навчання команди та 3 місяці пост-релізного моніторингу.
Зв'яжіться з нами — оцінимо ваші дані за 2 дні, запропонуємо архітектуру та реалістичні терміни. Замовте пілотний проєкт: сегментація одного органу на 50 сканах за 4 тижні.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.