Разработка системы компьютерного зрения (CV) под ключ

Дрейф данных — главный враг CV-модели в продакшене. Мы сталкивались с этим в каждом втором проекте: модель с mAP 0.95 на валидации падает до 0.6 через месяц после деплоя. Причина — изменилось освещение, угол камеры или добавился новый класс объектов. Чтобы этого избежать, нужно строить не просто мод

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1460
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1314
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    1012
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1275
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    727
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1018

Дрейф данных — главный враг CV-модели в продакшене. Мы сталкивались с этим в каждом втором проекте: модель с mAP 0.95 на валидации падает до 0.6 через месяц после деплоя. Причина — изменилось освещение, угол камеры или добавился новый класс объектов. Чтобы этого избежать, нужно строить не просто модель, а пайплайн компьютерного зрения с мониторингом дрейфа и автоматическим переобучением. Мы делаем именно так.

Какие задачи решает компьютерное зрение?

На производстве — дефектоскопия выявляет брак с точностью до 99.5%, экономя до 70% затрат на контроль качества. В ритейле — распознавание товаров ускоряет кассы в 5 раз. В логистике — трекинг объектов (паллет, ящиков) и чтение штрихкодов сокращает операционные расходы на 30%. Каждая задача требует своего подхода к data engineering и выбору архитектуры. Например, для детекции в реальном времени (30 FPS) нужна лёгкая модель YOLOv8-nano (в три раза быстрее YOLOv8-large), а для сегментации медицинских снимков — тяжёлая U-Net или SAM. Средняя окупаемость инвестиций в CV-систему составляет 6–12 месяцев за счёт снижения затрат на контроль качества и сокращения простоев.

Типовой стек CV-системы

Современная CV-система строится на трёх уровнях: модель, инференс-сервер, интеграционный слой. Модели (выбор зависит от задачи):

  • Классификация: EfficientNet-B4/B7, ViT-B/16, ConvNeXt
  • Детекция: YOLOv8/YOLO11, RT-DETR, DINO
  • Сегментация: Segment Anything Model (SAM), Mask R-CNN, YOLOv8-seg
  • Генеративные: Stable Diffusion, DALL-E 3 (для аугментации)

Инференс-серверы:

  • NVIDIA Triton Inference Server — для GPU-деплоя, батчинг, model ensemble
  • TorchServe — для PyTorch-моделей
  • ONNX Runtime — для edge/CPU деплоя
  • TensorFlow Serving — для TF-моделей

Оптимизация для production:

  • TensorRT — ускорение на NVIDIA GPU: 2–5x по сравнению с PyTorch
  • ONNX export -> quantization INT8 — для CPU или edge устройств
  • Pruning — удаление незначимых весов при допустимой просадке accuracy

NVIDIA TensorRT documentation подтверждает, что квантизация INT8 снижает размер модели на 75% и ускоряет инференс на CPU до 3x.

Как оптимизировать модель для деплоя?

  1. Профилируем модель через NVIDIA Nsight, выявляем узкие места.
  2. Конвертируем в TensorRT engine с FP16 или INT8 квантизацией.
  3. Настраиваем динамический батчинг (например, batch=8).
  4. Деплоим в Triton Inference Server с грейсфул выключением и A/B тестом.
  5. Включаем мониторинг дрейфа данных — если распределение изменилось, модель переобучается автоматически.
Пример экспорта YOLOv8 в TensorRT
from ultralytics import YOLO model = YOLO('best.pt') model.export(format='engine', # TensorRT engine device=0, half=True, # FP16 dynamic=False, imgsz=640, batch=8) 

Для продакшена важна не только точность, но и скорость. TensorRT c FP16 даёт выигрыш в 2–5x без значимой потери метрик. После деплоя включаем мониторинг дрейфа данных — если распределение изменилось, модель переобучается автоматически.

Пайплайн разработки

Этап 1: Анализ задачи и данных Определение типа задачи (классификация / детекция / сегментация / etc), требования к latency (real-time < 50ms или batch?), целевое железо (GPU/CPU/Edge). Аудит имеющихся данных: количество, качество, баланс классов.

Этап 2: Data Engineering Сбор данных при недостатке. Разметка: CVAT, Label Studio, Roboflow. Аугментация: albumentations (геометрические и цветовые преобразования), Mosaic для детекции. Разбивка: train/val/test стратифицированная.

Этап 3: Обучение и эксперименты MLflow для трекинга экспериментов. Трансфер лернинг от COCO/ImageNet pretrained. Hyperparameter search через Optuna или Ray Tune.

Этап 4: Оценка и анализ ошибок Confusion matrix, precision/recall кривые, анализ worst cases. Для детекции: [email protected], [email protected]:0.95. Тест на OOD (out-of-distribution) данных.

Этап 5: Оптимизация и деплой TensorRT/ONNX, профилирование через NVIDIA Nsight. Docker-контейнер, Kubernetes деплой, A/B тест против baseline.

Требования к данным

Задача Минимум Рекомендуется
Классификация (2–5 классов) 200 фото/класс 1000+ фото/класс
Детекция объектов 500 размеченных фото 2000+
Сегментация 300 размеченных фото 1500+
Кастомный OCR 100 примеров/символ 500+
Сложность системы Срок разработки
Простая классификация, готовые данные 2–3 недели
Детекция/сегментация, сбор данных 4–8 недель
Комплексная система, edge деплой 8–16 недель

Что входит в работу

  • Документация пайплайна (архитектура, обучение, деплой)
  • Обучение команды заказчика работе с моделью и её переобучению
  • Интеграция с MLOps-инструментами (MLflow, Kubeflow)
  • Мониторинг дрейфа данных и уведомления
  • SLA 99.9% аптайм инференс-сервера

Почему выбирают нас

Более 10 лет экспертизы в Computer Vision, сертифицированные инженеры (NVIDIA DLI, TensorRT). Мы реализовали более 50 проектов — от распознавания номеров на СТО до сегментации спутниковых снимков. Каждый проект сопровождается замером business KPIs: снижение ошибок на 40%, ускорение процессов в 5 раз.

Закажите разработку CV-системы под ключ — мы оценим ваш проект и предложим оптимальное решение. Получите консультацию инженера для детальной оценки.