Пустая полка или товар не на своём месте — ритейлер теряет до 5% выручки. По данным Nielsen, пустые полки обходятся ритейлерам в 4–6% оборота. Традиционные решения на основе штрих-кодов не работают при частых перестановках и смене упаковок. Автоматический контроль планограммы с помощью компьютерного зрения даёт измеримый результат, но при 10 000–50 000 уникальных SKU и регулярных сменах упаковок классические softmax-классификаторы перестают работать. Мы разработали решение на основе детекции YOLOv8 и metric learning с ArcFace, которое обновляется за секунды, а не дни. Система позволяет не только детектировать товары, но и идентифицировать каждый SKU через 512-мерные embedding'ы. В этой статье разберём, как устроена архитектура, какие проблемы мы решали и какие результаты получаем в продакшене.
Типичные проблемы при распознавании товаров
Частая смена дизайна упаковок требует быстрой адаптации. Бренды регулярно обновляют упаковки, и softmax-модель требует полного переобучения. Наш подход на embedding'ах позволяет обновить индекс за секунды — достаточно сфотографировать новую упаковку. Масштабирование на 50 000+ SKU также становится проблемой: традиционные классификаторы деградируют при большом количестве классов. Metric learning с ArcFace даёт Top-1 точность 87% на 50 000 SKU — промышленно приемлемый уровень. Необходимость быстрого обновления: если на полке появился новый товар, его нужно распознавать сразу. FAISS-индекс обновляется инкрементально, без переобучения модели.
Как работает детекция товаров?
Используем fine-tuning YOLOv8 на специально собранных полочных снимках. Размер входного изображения — 1280 пикселей: это критично для чтения мелких ценников и надписей на упаковках.
from ultralytics import YOLO
import yaml
from pathlib import Path
def prepare_retail_dataset_config(
data_dir: str,
class_names: list[str]
) -> str:
"""
Конфиг датасета для YOLOv8.
Для ритейл-полок рекомендуем imgsz=1280 — детали упаковок важны.
"""
config = {
'path': data_dir,
'train': 'images/train',
'val': 'images/val',
'test': 'images/test',
'nc': len(class_names),
'names': class_names
}
config_path = Path(data_dir) / 'dataset.yaml'
with open(config_path, 'w') as f:
yaml.dump(config, f, allow_unicode=True)
return str(config_path)
# Обучение детектора товаров
model = YOLO('yolov8l.pt')
model.train(
data='retail_dataset.yaml',
imgsz=1280, # важно: мелкие ценники и надписи требуют разрешения
batch=8, # при 1280 батч меньше
epochs=200,
device='0',
augment=True,
mosaic=0.5, # снижаем mosaic — не хотим менять масштаб товаров
copy_paste=0.3, # полезно для retail
rect=False # прямоугольные батчи ухудшают детекцию мелких объектов
)
На практике fine-tuning с подобными параметрами даёт mAP 50-95 ~0.85 на тестовой выборке из 2000 изображений. Если у вас есть специфические категории (например, блистеры или бутылки), мы адаптируем аугментации.
Почему embedding-подход лучше классификации?
При 10 000+ SKU softmax-классификатор требует переобучения при добавлении каждого нового товара. Embedding-подход на основе ArcFace решает проблему: обученная модель выдаёт 512-мерный вектор, а поиск по базе осуществляется через FAISS-индекс. Новый SKU — просто добавляем его embedding.
import torch
import torch.nn as nn
import torch.nn.functional as F
from torch.utils.data import DataLoader
import timm
import faiss
import numpy as np
class SKUEmbeddingModel(nn.Module):
"""
ArcFace-like metric learning для идентификации товаров.
Обучаем на кропах товаров → embedding 512-dim.
"""
def __init__(self, num_skus: int, embedding_dim: int = 512):
super().__init__()
self.backbone = timm.create_model(
'efficientnet_b4',
pretrained=True,
num_classes=0
)
self.embedding = nn.Sequential(
nn.Linear(self.backbone.num_features, embedding_dim),
nn.BatchNorm1d(embedding_dim)
)
# ArcFace head для обучения
self.arcface = ArcFaceHead(embedding_dim, num_skus)
def forward(self, x: torch.Tensor, labels: torch.Tensor = None):
feat = self.backbone(x)
emb = F.normalize(self.embedding(feat), dim=1)
if labels is not None:
return self.arcface(emb, labels)
return emb
class ArcFaceHead(nn.Module):
def __init__(self, dim: int, num_classes: int,
margin: float = 0.3, scale: float = 32.0):
super().__init__()
self.weight = nn.Parameter(torch.randn(num_classes, dim))
self.margin = margin
self.scale = scale
def forward(self, emb: torch.Tensor, labels: torch.Tensor):
import math
W = F.normalize(self.weight, dim=1)
cosine = F.linear(emb, W)
# Применяем margin только к правильному классу
one_hot = torch.zeros_like(cosine)
one_hot.scatter_(1, labels.unsqueeze(1), 1)
phi = cosine - self.margin
output = (one_hot * phi + (1 - one_hot) * cosine) * self.scale
return F.cross_entropy(output, labels)
class SKUFAISSIndex:
"""FAISS-индекс для быстрого поиска похожих SKU"""
def __init__(self, embedding_dim: int = 512):
self.index = faiss.IndexFlatIP(embedding_dim) # inner product = cosine при нормализации
self.sku_ids = []
def add_sku(self, sku_id: str, embedding: np.ndarray) -> None:
emb_norm = embedding / (np.linalg.norm(embedding) + 1e-8)
self.index.add(emb_norm.reshape(1, -1).astype(np.float32))
self.sku_ids.append(sku_id)
def search(
self, query_embedding: np.ndarray, top_k: int = 5
) -> list[dict]:
q = (query_embedding / (np.linalg.norm(query_embedding) + 1e-8)
).reshape(1, -1).astype(np.float32)
scores, indices = self.index.search(q, top_k)
return [
{'sku_id': self.sku_ids[idx], 'score': float(scores[0][i])}
for i, idx in enumerate(indices[0])
if idx < len(self.sku_ids)
]
На практике ArcFace даёт Top-1 точность ~95% для 1 000 SKU и ~87% для 50 000 SKU. Это значительно выше, чем CLIP zero-shot (78% на той же базе).
Как обрабатывать смену упаковки?
Главная головная боль ритейла — packaging refresh. Раз в год бренды меняют дизайн, и модель начинает ошибаться на новых упаковках. Наш подход: онлайн-обновление индекса. Достаточно сфотографировать новую упаковку и добавить её embedding в FAISS. Старый embedding можно удалить или оставить как вариант.
def update_sku_appearance(
sku_index: SKUFAISSIndex,
model: SKUEmbeddingModel,
sku_id: str,
new_product_images: list,
keep_old: bool = False # False = заменяем, True = добавляем вариант
) -> None:
model.eval()
embeddings = []
with torch.no_grad():
for img in new_product_images:
emb = model(img.unsqueeze(0).cuda()).cpu().numpy()
embeddings.append(emb.squeeze())
# Усредняем по нескольким ракурсам
mean_emb = np.mean(embeddings, axis=0)
if not keep_old:
# Удаляем старые записи (FAISS IDMap для удаления)
pass # требует IndexIDMap
sku_index.add_sku(sku_id, mean_emb)
print(f'Updated SKU {sku_id} with {len(new_product_images)} images')
Эта операция занимает секунды. Переобучение модели не требуется — только обновление индекса. В production мы используем FAISS с поддержкой удаления через IndexIDMap.
Сравнение точности методов
| SKU база | Метод | Top-1 Accuracy | Top-5 Accuracy | Время обновления |
|---|---|---|---|---|
| 1 000 SKU | Softmax | 91.4% | 98.2% | Переобучение (дни) |
| 1 000 SKU | CLIP zero-shot | 78.3% | 91.7% | Мгновенно |
| 1 000 SKU | ArcFace + FAISS | 95.8% | 99.1% | Секунды |
| 10 000 SKU | ArcFace + FAISS | 92.3% | 97.8% | Секунды |
| 50 000 SKU | ArcFace + FAISS | 87.1% | 95.4% | Секунды |
Отметим: как видно из таблицы, ArcFace + FAISS значительно превосходит CLIP zero-shot по точности и softmax — по скорости обновления. Для 50 000 SKU точность падает, но остаётся промышленно приемлемой.
Кейс из нашей практики: внедрение для сети гипермаркетов
Для одного из наших клиентов, сети гипермаркетов с 200+ магазинами, пилот на 500 SKU занял 5 недель. После разметки 8000 кропов товаров обучен детектор и embedding-модель. На тесте точность Top-1 составила 96%. После развёртки на 10 000 SKU точность снизилась до 92%, но система стабильно работает, обрабатывая до 1000 кадров в минуту на одном GPU. Внедрение окупилось за 7 месяцев: экономия от сокращения out-of-stock составила существенную сумму, а оптимизация выкладки дала дополнительный доход.
Детали настройки FAISS для production
Для удаления векторов используем IndexIDMap с IVFFlat: инкрементальное обновление без перестроения. Ключевые параметры: nlist=100, nprobe=10. Это даёт скорость поиска <1 мс на 50K векторов при точности 99% от brute-force.Процесс работы
- Аналитика и сбор данных — определяем перечень SKU, собираем полочные снимки (от 20 изображений на SKU для разных ракурсов).
- Разметка и подготовка датасета — аннотируем bounding boxes и классы. Для пилота достаточно 500–1000 размеченных изображений.
- Обучение модели — fine-tuning YOLOv8 и ArcFace на собранном датасете. Итеративный цикл с валидацией на тестовой выборке.
- Интеграция и тестирование — развёртывание REST API, подключение к камерам, проверка на реальных полках. Настраиваем MLOps pipeline (CI/CD для моделей, мониторинг дрейфа, дашборды ритейл аналитики).
- Деплой и поддержка — установка на сервер, настройка CI/CD для обновления индекса, мониторинг метрик.
Типичные ошибки, которые мы встречали:
- Недостаточное разнообразие фона. Если обучать только на фото с идеально ровными полками, на реальных снимках с тенью и бликами модель теряет точность.
- Перекос классов. Некоторые SKU встречаются редко — для них нужно применять аугментацию или собирать больше данных.
- Неправильная нормализация освещения. Мы используем адаптивную гистограммную коррекцию перед подачей в модель.
Сроки и что входит в работу
| Задача | Срок |
|---|---|
| Детектор + идентификатор для пилота (500 SKU) | 4–6 недель |
| Промышленная система (10 000+ SKU) | 8–14 недель |
| Интеграция с SAP/1С + мобильное приложение | 12–20 недель |
В стоимость работ входят следующие этапы:
- Сбор и разметка тренировочного датасета (до 10 000 изображений на пилот)
- Обучение и валидация модели с отчётом по метрикам
- REST API для интеграции
- Документация и инструкция по эксплуатации
- Обучение сотрудников (2 часа онлайн)
- Поддержка в течение 3 месяцев после запуска
По нашим оценкам, автоматизация сокращает время мерчандайзинга на 30% и снижает out-of-stock на 15%.
Начало работы с системой
Оценим ваш проект бесплатно. Свяжитесь с нами, и мы подготовим коммерческое предложение с точными сроками и стоимостью под ваш масштаб. Закажите пилот — и вы получите рабочую систему для 500 SKU за 4–6 недель. Гарантируем конфиденциальность данных.







