Вы собрали датасет дефектов на производстве, запустили yolo train — а [email protected] упёрся в 0.6. Знакомая ситуация? Мы сталкиваемся с этим на каждом втором проекте. Наша команда помогает компаниям обучать детекторы объектов под их задачи: от сбора и разметки данных до оптимизации под TensorRT. Гарантируем mAP50 > 90% на контрольной выборке. Оценим ваш проект бесплатно — свяжитесь с нами. Свяжитесь с нами для обсуждения вашего проекта.
Как настроить гиперпараметры для мелких объектов?
YOLOv8 — практический стандарт детекции для большинства production-задач. Но между «запустить yolo train» и получить [email protected] > 0.85 на реальных данных — дистанция в несколько итераций, каждая с конкретными решениями. При работе с мелкими объектами (менее 5% площади изображения) критично правильно подобрать гиперпараметры. Вот типовой конфиг для моделей среднего размера:
Пример конфигурации и кода обучения
model: yolov8m.pt data: dataset.yaml imgsz: 640 batch: 16 epochs: 200 optimizer: AdamW lr0: 0.001 lrf: 0.01 momentum: 0.937 weight_decay: 0.0005 warmup_epochs: 3.0 mosaic: 1.0 mixup: 0.15 copy_paste: 0.1 degrees: 10.0 translate: 0.1 scale: 0.5 flipud: 0.0 fliplr: 0.5 hsv_h: 0.015 hsv_s: 0.7 hsv_v: 0.4 from ultralytics import YOLO model = YOLO('yolov8m.pt') results = model.train( data='dataset/data.yaml', imgsz=640, batch=16, epochs=200, device='0', project='runs/detect', name='defect_v1', save_period=10, val=True, plots=True, patience=50 ) Если imgsz увеличить до 1280, [email protected] для мелких объектов (15–40 px) растёт на 5–8%, но время обучения увеличивается в 4 раза, а VRAM — до 24 ГБ. Для сцен с мелкими объектами мы также отключаем mosaic в последних 10 эпохах и снижаем его вес до 0.5.
Типовые проблемы обучения: разбор трёх причин
Самая частая ситуация: loss падает, val mAP растёт до ~0.6 и стагнирует. Анализ confusion matrix показывает систематические FP одного класса. Три основные причины:
1. Аннотационные ошибки. Даже 5% неправильных bbox разрушают обучение мелких классов. Инструмент диагностики — скрипт аудита, который проверяет выход за границы, микро-bbox и дубликаты.
import numpy as np from pathlib import Path def audit_annotation_quality(labels_dir: str) -> dict: issues = {'out_of_bounds': [], 'tiny_boxes': [], 'duplicates': []} for label_path in Path(labels_dir).glob('*.txt'): boxes = np.loadtxt(label_path, ndmin=2) if boxes.shape[0] == 0: continue cls_ids, cx, cy, bw, bh = (boxes[:, i] for i in range(5)) oob = (cx - bw/2 < 0) | (cx + bw/2 > 1) | \ (cy - bh/2 < 0) | (cy + bh/2 > 1) if oob.any(): issues['out_of_bounds'].append(str(label_path)) tiny = (bw * bh) < 0.0004 if tiny.any(): issues['tiny_boxes'].append(str(label_path)) return issues 2. Несбалансированный датасет. YOLOv8 anchor-free, но spatial bias — объекты одного класса в одной области кадра — приводит к тому, что модель выучит корреляции с фоном. Решение — стратифицированная разбивка и аугментации: RandomPerspective, Copy-Paste.
3. Слишком агрессивный mosaic. Для мелких объектов mosaic уменьшает их в 2–4 раза, делая недетектируемыми. Мы включаем mosaic только на первых 90% эпох, а для датасетов с объектами < 20 px снижаем его вес до 0.5 и комбинируем с MixUp.
Как проходит обучение: пошаговый план
- Анализ данных. Проверяем количество объектов на класс, размеры bbox, распределение по изображениям. Если данных меньше 500 объектов на класс — используем предобученные веса YOLOv8m и фиксируем backbone.
- Конфигурация. Подбираем imgsz, batch size, optimiser, LR schedule. Для мелких объектов — imgsz=960 или 1280, уменьшаем mosaic.
- Запуск тренировки. Используем Ultralytics HUB или локальный скрипт с мониторингом через TensorBoard/WandB. Останавливаем по patience=50.
- Валидация. Смотрим confusion matrix, Precision-Recall кривые, [email protected]:0.95. Если [email protected] < 0.8 — возвращаемся к шагу 1.
- Экспорт. Конвертируем в TensorRT (FP16) или ONNX. Проверяем latency на целевых GPU.
Когда YOLO не хватает? Преимущества RT-DETR
RT-DETR (Real-Time DEtection TRansformer) — трансформерная детекция без NMS. Превосходит YOLOv8 на сценах с сильными окклюзиями и нестандартными соотношениями сторон объектов. На задаче детекции мелких дефектов (объекты 15–40px) RT-DETR-L даёт [email protected] на 7% выше YOLOv8m при всего на 4ms больше latency. Как указано в документации Ultralytics, RT-DETR обеспечивает state-of-the-art соотношение точности и скорости. Сравнение:
| Модель | [email protected] | [email protected]:0.95 | Latency (RTX3080) | VRAM |
|---|---|---|---|---|
| YOLOv8n | 0.724 | 0.421 | 2.3ms | 2.1GB |
| YOLOv8m | 0.811 | 0.513 | 5.1ms | 5.8GB |
| YOLOv8l | 0.837 | 0.541 | 8.2ms | 8.1GB |
| RT-DETR-L | 0.869 | 0.574 | 9.8ms | 9.4GB |
| YOLO11l | 0.845 | 0.553 | 7.9ms | 7.8GB |
Пример обучения RT-DETR:
from ultralytics import RTDETR model = RTDETR('rtdetr-l.pt') model.train( data='dataset/data.yaml', imgsz=640, batch=8, epochs=100, device='0', optimizer='AdamW', lr0=0.0001, warmup_epochs=2 ) TensorRT для production
Для продакшена экспортируем обученную модель в TensorRT с FP16 — это даёт ~2x ускорение инференса по сравнению с PyTorch при падении mAP не более 0.5%. Рассматриваем также INT8-квантование, если допустимо снижение точности до 1% (экономия памяти до 50%). Пример экспорта:
from ultralytics import YOLO trained_model = YOLO('runs/detect/defect_v1/weights/best.pt') trained_model.export( format='engine', device=0, half=True, dynamic=False, imgsz=640, batch=1, workspace=4 ) Что входит в нашу работу
- Анализ задачи и подбор архитектуры (YOLO / RT-DETR / Detectron2 / кастомные трансформеры)
- Сбор и разметка датасета (конвертация из COCO, Pascal VOC, Supervisely, CVAT)
- Обучение с оптимизацией гиперпараметров и аугментаций (Grid Search, Bayesian Optimization)
- Валидация на контрольной выборке: mAP, confusion matrix, PR-curve, FPS
- Экспорт в TensorRT / ONNX с квантованием FP16/INT8
- Документация по модели (model card) и инференс-скрипт
- Поддержка после внедрения (2 недели)
Сроки и стоимость
| Задача | Срок |
|---|---|
| Fine-tuning YOLOv8 (готовый датасет) | 1–2 недели |
| Полный цикл: данные → обучение → оптимизация | 4–7 недель |
| Кастомный detector (новая архитектура head) | 8–14 недель |
Стоимость рассчитывается индивидуально под каждую задачу. Включает фиксированный SLA — мы гарантируем достижение целевой метрики ([email protected] > 90%) или дорабатываем модель бесплатно. Получите консультацию по вашему проекту — расскажем, какой подход даст максимальную точность при ваших ограничениях по бюджету и времени.
Об опыте команды
Более 10 лет в компьютерном зрении. Обучили 50+ моделей для задач: дефектоскопия на производстве, детекция объектов на спутниковых снимках, подсчёт людей в retail, распознавание животных на фермах. Работаем с YOLO, RT-DETR, Detectron2, DETR, Swin Transformer. Полный стек: PyTorch, TensorRT, ONNX, NVIDIA Triton. Наши специалисты — участники Kaggle Grandmaster и авторы open-source CV-библиотек.
Свяжитесь с нами для обсуждения вашего проекта.







