Якісна розмітка CV-датасетів з прелейблингом
Погана розмітка — головна причина низької точності моделей Computer Vision. Один клієнт втратив 12% mAP через різницю в IoU між аннотаторами в 0.15. Це обійшлося в 90 000 гривень і два тижні донавчання. Ми займаємося розміткою CV-даних понад 5 років і виконали 50+ проєктів — від 100 до 100 000 зображень. Наші замовники економлять в середньому 60–75% часу порівняно з розміткою з нуля, що в грошовому вираженні становить десятки тисяч гривень на проєкт.
Проблеми, які ми вирішуємо
Узгодженість аннотаторів — ключовий фактор. IoU 0.65 між двома розмітниками на дрібних об'єктах — не рідкість. Якщо два bbox одного об'єкта розходяться на 20%, модель отримує суперечливий сигнал. Інша проблема — edge cases: часткова occlusion, низька роздільна здатність, нестандартні ракурси. Ми розробляємо онтологію класів і детальні інструкції, щоб мінімізувати variance. Для контролю якості використовуємо Inter-rater reliability — стандарт у медичній та промисловій розмітці.
Пропуск дефекту через неякісну розмітку може призвести до збитків у 200 000 гривень на донавчанні моделі. Тому ми впроваджуємо багаторівневий QA.
Порівняння інструментів розмітки — розмітка cv датасетів
| Інструмент |
Ключова особливість |
Коли обрати |
| CVAT |
Self-hosted, REST API, командна робота |
Крупні проєкти з розгорнутим QA-пайплайном |
| Label Studio |
Мультимодальна розмітка, conditional logic |
Складні онтології, змішані дані |
| Roboflow |
Версіонування, вбудована аугментація |
Швидкий старт, прототипування |
CVAT обробляє великі датасети в 3 рази швидше за Label Studio завдяки вбудованій черзі завдань. А авторозмітка YOLO працює в 5 разів швидше за ручну розмітку. Label Studio виграє в гнучкості розмітки різнорідних сутностей.
Покроковий процес розмітки
- Аналіз задачі – формалізація онтології класів, визначення складності.
- Підготовка інструменту – налаштування CVAT або Label Studio, завантаження зображень, при необхідності розгортання GPU-сервера для авторозмітки.
- Пілотна розмітка – 50–100 зображень для калібрування інструкцій.
- Основна розмітка – паралельна робота аннотаторів з безперервним QA.
- Експорт та верифікація – вивантаження в потрібному форматі, фінальний звіт з якості.
Як ми контролюємо узгодженість аннотаторів?
Ми використовуємо inter-annotator agreement з цільовим mean IoU > 0.80. При відхиленні повертаємо на дорозмітку. Senior-спеціаліст перевіряє кожен десятий об'єкт. Для великих проєктів впроваджуємо continuous QA.
import numpy as np
from itertools import combinations
def calculate_iou(box1: list, box2: list) -> float:
inter_x1 = max(box1[0], box2[0])
inter_y1 = max(box1[1], box2[1])
inter_x2 = min(box1[2], box2[2])
inter_y2 = min(box1[3], box2[3])
if inter_x2 < inter_x1 or inter_y2 < inter_y1:
return 0.0
inter_area = (inter_x2 - inter_x1) * (inter_y2 - inter_y1)
area1 = (box1[2]-box1[0]) * (box1[3]-box1[1])
area2 = (box2[2]-box2[0]) * (box2[3]-box2[1])
return inter_area / (area1 + area2 - inter_area)
def inter_annotator_iou(annotations_by_annotator: dict) -> dict:
annotators = list(annotations_by_annotator.keys())
results = {}
for a1, a2 in combinations(annotators, 2):
boxes1 = annotations_by_annotator[a1]
boxes2 = annotations_by_annotator[a2]
ious = []
for b1 in boxes1:
best_iou = max(
(calculate_iou(b1, b2) for b2 in boxes2),
default=0.0
)
if best_iou > 0.1:
ious.append(best_iou)
results[f'{a1}_vs_{a2}'] = {
'mean_iou': np.mean(ious) if ious else 0.0,
'n_matched': len(ious)
}
return results
Auto-labeling для прискорення розмітки
Попередня авторозмітка моделлю + ручна коректура — стандарт для великих обсягів. Економія часу 60–75% при правильному виборі моделі. Один клієнт заощадив 3 місяці роботи двох спеціалістів, впровадивши наш пайплайн авторозмітки, що в грошовому еквіваленті склало 180 000 гривень. Загалом економія на проєкті може сягати 80 000 гривень.
from ultralytics import YOLO
import json
def auto_label_batch(
image_paths: list[str],
model_path: str = 'yolov8l-world.pt',
conf_threshold: float = 0.5,
output_format: str = 'yolo'
) -> dict:
model = YOLO(model_path)
results = {}
for img_path in image_paths:
preds = model.predict(
img_path, conf=conf_threshold,
verbose=False
)[0]
confident_boxes = []
needs_review_boxes = []
for box in preds.boxes:
conf = float(box.conf)
entry = {
'bbox': box.xyxy[0].tolist(),
'class_id': int(box.cls),
'confidence': conf
}
if conf > 0.7:
confident_boxes.append(entry)
else:
needs_review_boxes.append(entry)
results[img_path] = {
'auto_labeled': confident_boxes,
'needs_review': needs_review_boxes,
'review_required': len(needs_review_boxes) > 0
}
return results
Формати експорту
| Формат |
Застосування |
Інструмент |
| YOLO TXT |
YOLOv5/v8/v11 навчання |
Ultralytics |
| COCO JSON |
Detectron2, MMDetection |
torchvision |
| Pascal VOC XML |
TensorFlow Object Detection API |
TF OD API |
| LabelMe JSON |
Сегментація, polygons |
LabelMe |
| CVAT XML |
Імпорт/експорт CVAT |
cvat-sdk |
Терміни та обсяги
| Тип розмітки |
Швидкість (людина/год) |
Відносна вартість |
| Bbox |
200–400 об'єктів |
1x |
| Polygon |
40–80 об'єктів |
4–6x |
| Semantic segmentation (маски сегментації) |
2–5 зображень |
15–20x |
| Keypoints |
50–100 персон |
3x |
| Обсяг датасету |
Термін з QA |
| 1000 зображень, bbox |
1–2 тижні |
| 5000 зображень, bbox |
3–4 тижні |
| 2000 зображень, polygon |
3–5 тижнів |
Чому якість розмітки так важлива для Computer Vision?
Модель, навчена на зашумлених даних, дає хибні детекції або пропускає об'єкти. Наші замовники економлять тижні на донавчанні, отримуючи готовий датасет з гарантованою якістю. Ми беремо на себе онтологію класів, інструкції для аннотаторів, QA та експорт. Зв'яжіться, щоб обговорити ваш проєкт — ми підготуємо датасет з гарантією якості.
Що входить в роботу
- Аналіз задачі та розробка онтології класів
- Вибір інструменту та налаштування проєкту
- Пілотна розмітка для калібрування
- Основна розмітка з паралельним QA
- Експорт в потрібних форматах + звіт з якості
- Підтримка на етапі навчання моделі
Досвід нашої команди — 5+ років на ринку, 50+ успішних проєктів розмітки для Computer Vision. Ми гарантуємо узгодженість анотацій та дотримання термінів. Ми виконуємо розмітку під ключ: оцінимо ваш проєкт за 24 години. Напишіть нам для консультації — до 10 000 зображень за 2 тижні. Оцінимо проєкт безкоштовно.
Як distribution shift вбиває метрики CV-моделі в промисловості
На виробництві ставлять камеру, контролюють якість продукції. Модель навчена на 10 000 розмічених зображень — точність на тесті mAP 0.84. Запускають у продакшен — і в перший же тиждень пропускають 30% дефектів. Освітлення на лінії змінюється по змінах, distribution shift обнуляє метрики. Це класична історія з Computer Vision у промисловості, де розпізнавання образів дає збій без правильної обробки дрейфу.
Наші інженери з досвідом 60+ проектів з комп'ютерного зору знають, як виключити такі сценарії. Гарантуємо стабільну роботу моделі в реальних умовах.
Які архітектури детекції об'єктів обрати: YOLO, RT‑DETR чи інші?
YOLO — стандарт для real‑time детекції. YOLOv8 та YOLOv11 від Ultralytics — найбільш використовувані версії у виробництві: простий API, активна спільнота, вбудована валідація та експорт в ONNX/TensorRT. Для задач з високими вимогами до точності та коли latency менш критична — RT‑DETR, transformer‑based архітектура без NMS, дає кращий mAP на COCO при порівнянній швидкості з YOLOv8l.
| Архітектура |
mAP на COCO (val2017) |
FPS (A10G, FP16) |
Складність деплою |
| YOLOv8n |
37.3 |
700+ |
Низька (ONNX/TensorRT) |
| YOLOv8m |
50.2 |
250 |
Низька |
| RT‑DETR-L |
53.0 |
140 |
Середня (вимагає PyTorch) |
| Mask R‑CNN |
38.2 (bbox) |
30 |
Висока |
Типова помилка при навчанні детектора: датасет 8000 зображень, 3 класи, fine‑tune YOLOv8m — F1 0.73 на валідації. Дивимося confusion matrix — один клас майже ніколи не детектується. Причина: дисбаланс 1:23. Рішення: oversampling рідкісного класу, focal loss для objectness, аугментації (Mosaic, MixUp вимкнути для рідкісного класу — вони його «розмивають»). Transfer learning обов'язковий: передтреновані на COCO ваги скорочують потребу в даних у 10 разів. Fine‑tune на 500–2000 доменних зображеннях дає робочу модель за 1–2 дні на одній GPU.
Для edge deployment: експорт в ONNX → TensorRT engine. YOLOv8n в TensorRT FP16 на Jetson AGX Orin дає 150+ FPS при P99 latency < 8 ms — це в 3 рази швидше, ніж ONNX Runtime без TensorRT. На сервері A10G: 700+ FPS для YOLOv8n в TensorRT INT8.
Як fine‑tuning YOLO допомагає в розпізнаванні образів?
Припустимо, потрібно знаходити мікродефекти на поверхні металу — задача з високою роздільною здатністю та перекосом класів. Використовуємо YOLOv8m, передтренований на COCO (документація Ultralytics), і донавчаємо на 2000 власних зображень. Застосовуємо аугментації Mosaic, MixUp, random perspective. Після 200 епох mAP 0.5 досягає 0.93. Ключові прийоми:
-
focal loss для objectness голови — зменшує внесок легко класифікованих прикладів.
-
class‑balanced sampling — вирівнює представництво рідкісних класів.
-
Test Time Augmentation (TTA) — підвищує recall на 5–7% за рахунок усереднення по фліпах та масштабах.
Отримайте консультацію з підбору архітектури для вашого завдання — зв'яжіться з нами.
Які архітектури сегментації обрати: SAM, Mask R‑CNN чи інші?
SAM (Segment Anything Model) від Meta змінив підхід до сегментації. SAM 2 працює з відео, підтримує трекінг об'єктів через кадри — для інтерактивного виділення об'єкта по точці або bbox це найкращий вибір з коробки. Для production instance segmentation без інтерактивного промпту — Mask R‑CNN або YOLOv8‑seg. YOLOv8‑seg навчається як звичайний детектор з додатковими масками, зручний у тих же пайплайнах. Семантична сегментація (кожен піксель — клас) — SegFormer, DeepLabV3+. SegFormer‑B5 дає хороший баланс точності та швидкості для аналізу супутникових знімків або медичної сегментації.
Кейс: сегментація клітин на мікроскопічних зображеннях. Датасет 400 зображень з ручною розміткою. Навчання Mask R‑CNN на ResNet‑50 backbone дало IoU 0.61 — погано. Проблема: об'єкти (клітини) перекриваються, стандартний NMS вбиває перекриваючі передбачення. Рішення: перехід на cellpose (спеціалізована архітектура для біомедичних задач) + soft‑NMS. IoU зріс до 0.79.
Коли Tesseract не справляється з OCR?
Tesseract — відправна точка для простих задач: друкований текст, хороше освітлення, рівне розташування. Як тільки з'являються рукописні елементи, нестандартні шрифти, перспективні спотворення або багатоколоночний макет — Tesseract деградує швидко.
PaddleOCR — production‑grade рішення: виявлення текстових блоків + розпізнавання + структурний аналіз. Працює з коробки для 80+ мов, включаючи українську. Підтримує таблиці та документи зі складною структурою. Wikipedia: Оптичне розпізнавання символів. TrOCR (Microsoft) — трансформерний OCR з сильними результатами на рукописному тексті. Для українського рукописного тексту потрібен fine‑tuning: базова модель навчена переважно на латиниці.
Що робити, якщо Tesseract не справляється з розпізнаванням образів на документах?
Для задач «витягни дані з рахунку / договору / паспорта» використовуємо LayoutLMv3 або Donut — ці моделі розуміють layout документа, а не тільки текст. Інтеграція через Hugging Face Transformers, fine‑tuning на 200–500 розмічених документах. Типовий pipeline:
- Preprocessing: deskew, denoising, binarization через OpenCV.
- Виявлення текстових блоків: PaddleOCR detection або CRAFT.
- Розпізнавання: PaddleOCR recognition або TrOCR.
- Post‑processing: нормалізація, валідація через regex або LLM для структурованих полів.
Для документів з фіксованою структурою template matching + OCR точково по координатах часто надійніше за end‑to‑end рішення.
Face Recognition: ідентифікація та верифікація
Face recognition = detection + alignment + embedding + matching. Кожен етап важливий.
Detection: RetinaFace або InsightFace для точної локалізації обличчя та ключових точок. MTCNN — старіше, але надійне рішення. Embedding: ArcFace (InsightFace) — state‑of‑the‑art для face recognition embeddings. Моделі iresnet50/iresnet100 передтреновані на MS1MV3 (5M ідентичностей). Ембеддинг‑вектор 512 float32, порівняння за cosine similarity. Threshold tuning: поріг рішення — критичний параметр. При threshold 0.6 типовий FPR на LFW benchmark — 0.001, TPR — 0.985. У production threshold потрібно калібрувати під реальний distribution: люди в масках, зі зміненою зовнішністю, в різних умовах освітлення. Liveness detection обов'язковий: MiniFASNet — lightweight модель на CPU, FaceX‑Zoo містить кілька передтренованих liveness‑детекторів.
Відеоаналітика
Відео — послідовність кадрів плюс часовий вимір. Наївний підхід — детектувати на кожному кадрі — дорого.
Трекінг: ByteTrack та BoT‑SORT — стандарт для multi‑object tracking. Працюють поверх будь-якого детектора, додають persistent ID об'єктам між кадрами — це дає підрахунок об'єктів, трекі руху, velocity.
Оптимізація: не потрібно обробляти кожен кадр. Для статичних сцен детекція на кожному 5–10 кадрі, між ними — трекер. Для детекції подій (людина увійшла в зону) background subtraction (OpenCV MOG2) як lightweight pre‑filter перед нейромережевою детекцією. Action Recognition: SlowFast, VideoMAE для класифікації дій. Важкі моделі — для production використовуємо ONNX export + TensorRT або офлайн обробку.
Як виміряти якість моделі розпізнавання образів у продакшені?
Моніторинг якості — ключовий елемент MLOps. Відстежуємо:
- розподіл prediction confidence;
- частку low‑confidence передбачень (індикатор OOD‑даних);
- дрейф вхідних зображень через feature distribution (embeddings з backbone).
Падіння середньої confidence з 0.87 до 0.71 за тиждень — ранній сигнал про distribution shift. NVIDIA Triton Inference Server рекомендує відстежувати ці метрики через Prometheus. Наші сертифіковані інженери налаштовують моніторинг і гарантують SLA по якості інференсу.
Деплой CV‑моделей
Для онлайн інференсу використовуємо Triton Inference Server (NVIDIA) — production‑стандарт для serving CV‑моделей. Підтримує TensorRT, ONNX, PyTorch, dynamic batching, multiple instances. REST та gRPC API. Гарантуємо стабільну роботу під навантаженням.
Edge deployment: ONNX Runtime на ARM/x86 CPU. TensorFlow Lite для мобільних пристроїв. OpenVINO для Intel CPU/GPU/VPU — дає 2–3× приріст швидкості на Intel залізі порівняно з ONNX Runtime. Після деплою передаємо модель з документацією та навчаємо персонал.
Що входить в роботу
| Етап |
Зміст |
Орієнтовний термін |
| Аналіз |
Технічне завдання, підбір архітектури, оцінка даних |
3–5 днів |
| Розмітка |
Збір зображень, анотування (до 5000 об'єктів) |
1–3 тижні |
| Навчання |
Fine‑tuning моделі, валідація на тестовій вибірці |
1–2 тижні |
| Оптимізація |
Експорт в ONNX/TensorRT/OpenVINO, тестування на цільовому залізі |
1–2 тижні |
| Інтеграція |
REST/gRPC API, інтеграція з існуючою інфраструктурою |
1–2 тижні |
| Деплой |
Розгортання на сервері або edge‑пристрої, навантажувальне тестування |
1 тиждень |
| Документація та навчання |
Інструкції, навчання персоналу, передача коду та моделі |
3–5 днів |
| Підтримка |
Технічна підтримка на 3 місяці після запуску |
— |
Терміни та вартість
Прототип детектора на існуючих даних — 1–2 тижні. Production‑система з оптимізацією під цільове залізо — 4–8 тижнів. Повний цикл включаючи розмітку даних (1000–5000 зображень) — 2–4 місяці. Вартість розраховується індивідуально під кожну задачу. Ми на ринку більше 5 років, реалізували 60+ проектів з комп'ютерного зору. Оцінимо ваш проект під ключ — замовте консультацію, щоб отримати розрахунок та технічну пропозицію.