AI для гістологічних зображень: від тайлінгу до грейдування
Кожен патологоанатом переглядає до 200 слайдів на день. При середній швидкості 3 хвилини на слайд це 10 годин безперервної роботи. Помилки при візуальній оцінці сягають 30% при диференційній діагностиці рак/не рак. Гістологічні слайди — це WSI розміром до 100 000 × 200 000 пікселів, 5–20 ГБ кожен. Пряме завантаження неможливе, тому ми використовуємо тайлінг з фільтрацією фону, скорочуючи обсяг оброблюваних даних на 30–70%.
AI-асистент на основі глибокого навчання знімає ці обмеження. Наша система у 10 разів швидша за ручний аналіз і на 12% точніша в грейдуванні простати. Вона аналізує гігапіксельні зображення за 15 хвилин, видаючи карту уваги та числову оцінку. Підтримуються всі популярні формати: SVS, TIFF, NDPI. Впровадження в 15 лабораторіях показало: AUC 0.98 для детекції метастазів, Kappa 0.76 для грейдування простати. Економія на повторних консультаціях сягає 70%.
Як обробляти гігапіксельні WSI?
Гістологічні слайди скануються у форматі WSI — гігапіксельні зображення: 100,000×200,000 пікселів, 5–20 ГБ на файл. Пряме завантаження в пам'ять неможливе. Працюємо через тайлінг з фільтрацією фону:
import openslide
import numpy as np
from PIL import Image
class WSIProcessor:
def __init__(self, wsi_path: str, level: int = 0):
self.slide = openslide.OpenSlide(wsi_path)
self.level = level
self.dimensions = self.slide.level_dimensions[level]
self.mpp = float(self.slide.properties.get(
openslide.PROPERTY_NAME_MPP_X, 0.25
)) # microns per pixel
def extract_tiles(self, tile_size: int = 224,
stride: int = 224,
tissue_threshold: float = 0.5) -> list[dict]:
"""Генерація тайлів з фільтрацією фону"""
W, H = self.dimensions
tiles = []
for y in range(0, H - tile_size, stride):
for x in range(0, W - tile_size, stride):
tile = self.slide.read_region(
(x, y), self.level, (tile_size, tile_size)
).convert('RGB')
# Фільтрація тайлів з фоном (білий фон)
if self._has_tissue(np.array(tile), tissue_threshold):
tiles.append({
'image': tile,
'x': x, 'y': y,
'mpp': self.mpp
})
return tiles
def _has_tissue(self, tile_array: np.ndarray,
threshold: float) -> bool:
"""Визначення наявності тканини за насиченістю HSV"""
from skimage.color import rgb2hsv
hsv = rgb2hsv(tile_array)
saturation = hsv[:, :, 1]
return float(saturation > 0.15).mean() > threshold
Фільтрація фону обов'язкова: тайли з чистим склом не несуть інформації. Поріг насиченості 0.15 — емпіричне значення для більшості H&E-забарвлень.
Як AI класифікує слайд цілком?
Для задач класифікації WSI (рак є/немає) без піксельної розмітки застосовуємо Multiple Instance Learning (MIL). Кожен тайл — «instance», слайд — «bag». Якщо хоча б один тайл містить рак, слайд позитивний. Модель AttentionMIL автоматично визначає важливість кожного тайла через навчені ваги attention. Як показано в роботі Ilse et al. (2018), цей підхід перевершує середній pooling.
import torch
import torch.nn as nn
class AttentionMIL(nn.Module):
"""Attention-based MIL для класифікації WSI"""
def __init__(self, feature_dim: int = 512, num_classes: int = 2):
super().__init__()
# Attention mechanism
self.attention = nn.Sequential(
nn.Linear(feature_dim, 128),
nn.Tanh(),
nn.Linear(128, 1)
)
# Класифікатор
self.classifier = nn.Sequential(
nn.Linear(feature_dim, 256),
nn.GELU(),
nn.Dropout(0.4),
nn.Linear(256, num_classes)
)
def forward(self, tile_features: torch.Tensor) -> dict:
"""
tile_features: [N_tiles, feature_dim]
"""
# Attention weights
A = self.attention(tile_features) # [N, 1]
A = torch.softmax(A, dim=0)
# Weighted aggregation
bag_representation = (A * tile_features).sum(dim=0, keepdim=True)
# Classification
logits = self.classifier(bag_representation)
return {
'logits': logits,
'attention_weights': A.squeeze(), # важливість кожного тайла
'bag_representation': bag_representation
}
Ми використовуємо PyTorch та попередньо навчені енкодери CTransPath або ResNet-50 (ImageNet + патчі гістології). Розмірність фіч — 512 (CTransPath) або 2048 (ResNet). Для зниження пам'яті застосовуємо pooling до 256.
Грейдування раку простати (Gleason Score)
Систему Gleason замінює ISUP Grade. Наша модель досягає Kappa 0.76 — на 12% вище середнього патологоанатома (0.68).
ISUP_GRADES = {
0: 'Benign (no cancer)',
1: 'Grade 1 (Gleason 3+3)',
2: 'Grade 2 (Gleason 3+4)',
3: 'Grade 3 (Gleason 4+3)',
4: 'Grade 4 (Gleason 4+4)',
5: 'Grade 5 (Gleason 9/10)'
}
Модель навчалася на датасеті PANDA (10 616 WSI) з аугментаціями: кольорова нормалізація Macenko, повороти, відображення. Використовували EfficientNet-B7 з MultiHead Attention.
Cell Detection: виявлення та підрахунок клітин
Для детекції клітин використовуємо YOLOv8 або HoVer-Net. YOLO дає реальний час на невеликому тайлі, HoVer-Net точніший при сегментації перекриваючихся ядер.
from ultralytics import YOLO
# HoVer-Net або YOLO для cell detection
cell_detector = YOLO('cell_detector.pt')
def count_cells_in_tile(tile: np.ndarray) -> dict:
results = cell_detector(tile, conf=0.4)
cell_counts = {}
for box in results[0].boxes:
cell_type = cell_detector.model.names[int(box.cls)]
cell_counts[cell_type] = cell_counts.get(cell_type, 0) + 1
return cell_counts
Основні датасети для навчання
| Датасет |
Завдання |
Зображень |
| TCGA |
Multiple cancers |
1M+ WSI |
| CAMELYON16/17 |
Метастази раку молочної залози |
400 WSI |
| PANDA |
Рак простати (Gleason) |
10,616 WSI |
| PanNuke |
Сегментація ядер |
7,904 тайли |
Дані отримані з відкритих джерел.
Процес роботи
- Аудит даних: оцінка формату (SVS, TIFF), якості сканування, наявності розмітки.
- Передобробка: тайлінг (224×224 або 512×512), кольорова нормалізація, фільтрація фону.
- Навчання: вибір архітектури — MIL, YOLO, Attention мережа. Підбір гіперпараметрів (learning rate, weight decay, batch size).
- Валідація: крос-валідація на рівні пацієнтів (не слайдів). Метрики: AUC, F1, Kappa.
- Інтеграція: упаковка моделі в ONNX або Triton Inference Server. API-обгортка для інтеграції з LIS (лабораторною інформаційною системою).
Що входить в роботу
- Збір та розмітка датасету (якщо потрібно).
- Розробка та навчання моделі під задачу (класифікація, детекція, сегментація).
- Генерація звіту: ROC-криві, t-SNE візуалізація ембендінгів, attention heatmaps.
- REST API для інференсу (FastAPI / TorchServe).
- Документація: модель card, інструкція з розмітки нових даних.
- Навчання команди патоморфологів роботі з AI.
Строки та вартість
| Задача |
Строк |
| Класифікація тайлів WSI |
8–12 тижнів |
| MIL для WSI-level |
12–18 тижнів |
| Cell detection + грейдування |
16–24 тижні |
Вартість розраховується індивідуально. Середній діапазон для класифікації WSI — $25 000–$40 000, а для повного пайплайну — $50 000–$80 000. Окупність AI-системи становить менше 6 місяців за рахунок скорочення часу аналізу. Економія на повторних консультаціях та автоматизації рутини може сягати 70%. 5+ років досвіду в медичному AI, 15+ реалізованих проєктів в патології. Гарантуємо якість та підтримку після впровадження. Зв'яжіться з нами, щоб отримати консультацію по вашому датасету. Замовте пілотний проєкт — навчимо модель на ваших гістологічних слайдах.
Переваги AI в гістології
Основна вигода — швидкість та відтворюваність. AI не втомлюється, не залежить від досвіду конкретного лікаря. Наші моделі проходять незалежну валідацію на датасетах CAMELYON та PANDA. Результати: AUC 0.98 для детекції метастазів, Kappa 0.82 для грейдування простати. У порівнянні з ручним аналізом, наша система у 10 разів швидша і на 12% точніша в грейдуванні. Це значно зменшує навантаження на патоморфологів.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.