Обучение модели детекции объектов (YOLOv8, YOLO11, RT-DETR)

Вы собрали датасет дефектов на производстве, запустили `yolo train` — а [email protected] упёрся в 0.6. Знакомая ситуация? Мы сталкиваемся с этим на каждом втором проекте. Наша команда помогает компаниям обучать детекторы объектов под их задачи: от сбора и разметки данных до оптимизации под TensorRT. Гарантир

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1302
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    714
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1006

Вы собрали датасет дефектов на производстве, запустили yolo train — а [email protected] упёрся в 0.6. Знакомая ситуация? Мы сталкиваемся с этим на каждом втором проекте. Наша команда помогает компаниям обучать детекторы объектов под их задачи: от сбора и разметки данных до оптимизации под TensorRT. Гарантируем mAP50 > 90% на контрольной выборке. Оценим ваш проект бесплатно — свяжитесь с нами. Свяжитесь с нами для обсуждения вашего проекта.

Как настроить гиперпараметры для мелких объектов?

YOLOv8 — практический стандарт детекции для большинства production-задач. Но между «запустить yolo train» и получить [email protected] > 0.85 на реальных данных — дистанция в несколько итераций, каждая с конкретными решениями. При работе с мелкими объектами (менее 5% площади изображения) критично правильно подобрать гиперпараметры. Вот типовой конфиг для моделей среднего размера:

Пример конфигурации и кода обучения
model: yolov8m.pt data: dataset.yaml imgsz: 640 batch: 16 epochs: 200 optimizer: AdamW lr0: 0.001 lrf: 0.01 momentum: 0.937 weight_decay: 0.0005 warmup_epochs: 3.0 mosaic: 1.0 mixup: 0.15 copy_paste: 0.1 degrees: 10.0 translate: 0.1 scale: 0.5 flipud: 0.0 fliplr: 0.5 hsv_h: 0.015 hsv_s: 0.7 hsv_v: 0.4 
from ultralytics import YOLO model = YOLO('yolov8m.pt') results = model.train( data='dataset/data.yaml', imgsz=640, batch=16, epochs=200, device='0', project='runs/detect', name='defect_v1', save_period=10, val=True, plots=True, patience=50 ) 

Если imgsz увеличить до 1280, [email protected] для мелких объектов (15–40 px) растёт на 5–8%, но время обучения увеличивается в 4 раза, а VRAM — до 24 ГБ. Для сцен с мелкими объектами мы также отключаем mosaic в последних 10 эпохах и снижаем его вес до 0.5.

Типовые проблемы обучения: разбор трёх причин

Самая частая ситуация: loss падает, val mAP растёт до ~0.6 и стагнирует. Анализ confusion matrix показывает систематические FP одного класса. Три основные причины:

1. Аннотационные ошибки. Даже 5% неправильных bbox разрушают обучение мелких классов. Инструмент диагностики — скрипт аудита, который проверяет выход за границы, микро-bbox и дубликаты.

import numpy as np from pathlib import Path def audit_annotation_quality(labels_dir: str) -> dict: issues = {'out_of_bounds': [], 'tiny_boxes': [], 'duplicates': []} for label_path in Path(labels_dir).glob('*.txt'): boxes = np.loadtxt(label_path, ndmin=2) if boxes.shape[0] == 0: continue cls_ids, cx, cy, bw, bh = (boxes[:, i] for i in range(5)) oob = (cx - bw/2 < 0) | (cx + bw/2 > 1) | \ (cy - bh/2 < 0) | (cy + bh/2 > 1) if oob.any(): issues['out_of_bounds'].append(str(label_path)) tiny = (bw * bh) < 0.0004 if tiny.any(): issues['tiny_boxes'].append(str(label_path)) return issues 

2. Несбалансированный датасет. YOLOv8 anchor-free, но spatial bias — объекты одного класса в одной области кадра — приводит к тому, что модель выучит корреляции с фоном. Решение — стратифицированная разбивка и аугментации: RandomPerspective, Copy-Paste.

3. Слишком агрессивный mosaic. Для мелких объектов mosaic уменьшает их в 2–4 раза, делая недетектируемыми. Мы включаем mosaic только на первых 90% эпох, а для датасетов с объектами < 20 px снижаем его вес до 0.5 и комбинируем с MixUp.

Как проходит обучение: пошаговый план

  1. Анализ данных. Проверяем количество объектов на класс, размеры bbox, распределение по изображениям. Если данных меньше 500 объектов на класс — используем предобученные веса YOLOv8m и фиксируем backbone.
  2. Конфигурация. Подбираем imgsz, batch size, optimiser, LR schedule. Для мелких объектов — imgsz=960 или 1280, уменьшаем mosaic.
  3. Запуск тренировки. Используем Ultralytics HUB или локальный скрипт с мониторингом через TensorBoard/WandB. Останавливаем по patience=50.
  4. Валидация. Смотрим confusion matrix, Precision-Recall кривые, [email protected]:0.95. Если [email protected] < 0.8 — возвращаемся к шагу 1.
  5. Экспорт. Конвертируем в TensorRT (FP16) или ONNX. Проверяем latency на целевых GPU.

Когда YOLO не хватает? Преимущества RT-DETR

RT-DETR (Real-Time DEtection TRansformer) — трансформерная детекция без NMS. Превосходит YOLOv8 на сценах с сильными окклюзиями и нестандартными соотношениями сторон объектов. На задаче детекции мелких дефектов (объекты 15–40px) RT-DETR-L даёт [email protected] на 7% выше YOLOv8m при всего на 4ms больше latency. Как указано в документации Ultralytics, RT-DETR обеспечивает state-of-the-art соотношение точности и скорости. Сравнение:

Модель [email protected] [email protected]:0.95 Latency (RTX3080) VRAM
YOLOv8n 0.724 0.421 2.3ms 2.1GB
YOLOv8m 0.811 0.513 5.1ms 5.8GB
YOLOv8l 0.837 0.541 8.2ms 8.1GB
RT-DETR-L 0.869 0.574 9.8ms 9.4GB
YOLO11l 0.845 0.553 7.9ms 7.8GB

Пример обучения RT-DETR:

from ultralytics import RTDETR model = RTDETR('rtdetr-l.pt') model.train( data='dataset/data.yaml', imgsz=640, batch=8, epochs=100, device='0', optimizer='AdamW', lr0=0.0001, warmup_epochs=2 ) 

TensorRT для production

Для продакшена экспортируем обученную модель в TensorRT с FP16 — это даёт ~2x ускорение инференса по сравнению с PyTorch при падении mAP не более 0.5%. Рассматриваем также INT8-квантование, если допустимо снижение точности до 1% (экономия памяти до 50%). Пример экспорта:

from ultralytics import YOLO trained_model = YOLO('runs/detect/defect_v1/weights/best.pt') trained_model.export( format='engine', device=0, half=True, dynamic=False, imgsz=640, batch=1, workspace=4 ) 

Что входит в нашу работу

  • Анализ задачи и подбор архитектуры (YOLO / RT-DETR / Detectron2 / кастомные трансформеры)
  • Сбор и разметка датасета (конвертация из COCO, Pascal VOC, Supervisely, CVAT)
  • Обучение с оптимизацией гиперпараметров и аугментаций (Grid Search, Bayesian Optimization)
  • Валидация на контрольной выборке: mAP, confusion matrix, PR-curve, FPS
  • Экспорт в TensorRT / ONNX с квантованием FP16/INT8
  • Документация по модели (model card) и инференс-скрипт
  • Поддержка после внедрения (2 недели)

Сроки и стоимость

Задача Срок
Fine-tuning YOLOv8 (готовый датасет) 1–2 недели
Полный цикл: данные → обучение → оптимизация 4–7 недель
Кастомный detector (новая архитектура head) 8–14 недель

Стоимость рассчитывается индивидуально под каждую задачу. Включает фиксированный SLA — мы гарантируем достижение целевой метрики ([email protected] > 90%) или дорабатываем модель бесплатно. Получите консультацию по вашему проекту — расскажем, какой подход даст максимальную точность при ваших ограничениях по бюджету и времени.

Об опыте команды

Более 10 лет в компьютерном зрении. Обучили 50+ моделей для задач: дефектоскопия на производстве, детекция объектов на спутниковых снимках, подсчёт людей в retail, распознавание животных на фермах. Работаем с YOLO, RT-DETR, Detectron2, DETR, Swin Transformer. Полный стек: PyTorch, TensorRT, ONNX, NVIDIA Triton. Наши специалисты — участники Kaggle Grandmaster и авторы open-source CV-библиотек.

Свяжитесь с нами для обсуждения вашего проекта.