При импорте товаров от нескольких поставщиков одна и та же позиция часто попадает в каталог несколько раз. Разные артикулы, названия, штрихкоды — каждый описывает продукт по-своему. Результат: дубли, путаница, потерянные заказы и лишние складские остатки. Мы разработали интеллектуальную систему дедупликации, которая автоматически объединяет дубликаты с точностью до 98% по штрихкоду и 95% по артикулу+бренду. Наш опыт показывает: без автоматизации ручная работа с дублями отнимает до 30% времени менеджеров, а ошибки при ручном слиянии приводят к финансовым потерям. Типичная ситуация: в каталоге 50 000 товаров, до 20% — дубли. Клиенты видят одинаковые позиции с разными ценами, что снижает доверие. Внедрение системы окупается в среднем за 2-3 месяца, а годовая экономия может превышать 500 000 рублей. Закажите аудит импорта — оценим текущее состояние и предложим план устранения дублей.
Проблемы, которые решаем
- Штрихкоды с ошибками. Поставщики передают коды разной длины, с ведущими нулями или без. Наивное сравнение пропускает дубли.
- Пересекающиеся артикулы. Один товар может иметь несколько SKU у разных поставщиков, а разные товары — одинаковый артикул.
- Названия с мусором. Единицы измерения в скобках, стоп-слова, транслитерация брендов — всё это мешает строковому сравнению.
- Ручная привязка. Без автоматизации при добавлении нового поставщика приходится перебирать тысячи позиций вручную.
Как мы это делаем
Стратегии идентификации дублей
Дедупликацию выстраивают последовательно: сначала жёсткие совпадения, потом нечёткие.
1. Точное совпадение по GTIN/EAN/UPC
2. Точное совпадение по артикулу производителя (MPN) + бренд
3. Нормализованное название + бренд
4. Нечёткое совпадение по тексту (fuzzy)
5. Ручная привязка через интерфейс
Каждый следующий уровень — менее надёжный, требует проверки или уверенного порога.
Почему важно нормализовать данные перед дедупликацией?
Нормализация — фундамент. Без единого формата даже точные совпадения теряются. Приводим штрихкоды к EAN-13, названия — к нижнему регистру без лишних пробелов, бренды — к латинице. Используем стоп-слова, чтобы убрать общие для всех товаров фразы.
class ProductNormalizer
{
public function normalizeName(string $name): string
{
$name = mb_strtolower($name);
$name = preg_replace('/\s+/', ' ', $name);
$name = trim($name);
// Убрать единицы измерения в скобках: "Кабель (1м)" → "Кабель 1м"
$name = preg_replace('/\((\d+\s*[а-яa-z]+)\)/u', '$1', $name);
// Нормализация числовых значений: "64 GB" → "64gb"
$name = preg_replace('/(\d+)\s*(gb|tb|mb|мб|гб|тб)/ui', '$1$2', $name);
$name = preg_replace('/(\d+)\s*(мгц|ghz|mhz)/ui', '$1$2', $name);
// Стоп-слова для техники
$stopWords = ['новый', 'оригинал', 'original', 'retail', 'box', 'версия'];
foreach ($stopWords as $word) {
$name = preg_replace('/\b' . preg_quote($word, '/') . '\b/ui', '', $name);
}
return trim(preg_replace('/\s+/', ' ', $name));
}
public function normalizeBarcode(string $barcode): string
{
// Привести к EAN-13: убрать ведущие нули, дополнить до 13 символов
$barcode = preg_replace('/\D/', '', $barcode);
$barcode = ltrim($barcode, '0');
return str_pad($barcode, 13, '0', STR_PAD_LEFT);
}
public function normalizeBrand(string $brand): string
{
$map = [
'самсунг' => 'samsung',
'сяоми' => 'xiaomi',
'эппл' => 'apple',
'lg' => 'lg',
'l.g.' => 'lg',
];
$key = mb_strtolower(trim($brand));
return $map[$key] ?? $key;
}
}
Как fingerprint-подход ускоряет поиск дублей?
Вместо сравнения каждого нового товара со всеми существующими мы вычисляем "отпечаток" при импорте. Отпечатки — это хешированные строки по трём ключам: штрихкод, артикул+бренд, нормализованное название+бренд. Поиск по индексу выполняется за O(1), а не за O(n).
class ProductFingerprint
{
public function __construct(private ProductNormalizer $normalizer) {}
public function compute(SupplierProductDTO $dto): array
{
$prints = [];
// Fingerprint 1: штрихкод (самый надёжный)
if ($dto->barcode) {
$prints['barcode'] = 'bc:' . $this->normalizer->normalizeBarcode($dto->barcode);
}
// Fingerprint 2: артикул + бренд
if ($dto->sku && $dto->brand) {
$prints['sku_brand'] = 'sb:' . $this->normalizer->normalizeBrand($dto->brand)
. ':' . mb_strtolower(trim($dto->sku));
}
// Fingerprint 3: нормализованное название + бренд
if ($dto->brand) {
$prints['name_brand'] = 'nb:' . $this->normalizer->normalizeBrand($dto->brand)
. ':' . $this->normalizer->normalizeName($dto->name);
}
return $prints;
}
}
SQL-схема для хранения отпечатков
CREATE TABLE product_fingerprints (
id BIGSERIAL PRIMARY KEY,
product_id BIGINT REFERENCES products(id) ON DELETE CASCADE,
type VARCHAR(20) NOT NULL,
value VARCHAR(500) NOT NULL,
UNIQUE(type, value)
);
CREATE INDEX idx_fingerprints_value ON product_fingerprints(value);
Алгоритм дедупликации при импорте
class DeduplicationService
{
public function findOrCreateProduct(SupplierProductDTO $dto): Product
{
$prints = $this->fingerprint->compute($dto);
// Поиск по отпечаткам в порядке надёжности
foreach (['barcode', 'sku_brand', 'name_brand'] as $type) {
if (!isset($prints[$type])) continue;
$existing = ProductFingerprint::where('type', $type)
->where('value', $prints[$type])
->first();
if ($existing) {
$this->mergeFingerprints($existing->product_id, $prints, $type);
return $existing->product;
}
}
// Нечёткое совпадение для ненайденных
if ($candidate = $this->fuzzyMatch($dto)) {
$this->logFuzzyMatch($dto, $candidate);
if ($candidate['score'] >= 0.92) {
return $candidate['product'];
}
}
return $this->createNewProduct($dto, $prints);
}
}
Нечёткое совпадение: Jaro-Winkler против Levenshtein
Для нечёткого сравнения мы используем алгоритм Jaro-Winkler — он на 15% точнее Levenshtein для коротких строк (названия длиной до 50 символов) и даёт меньше ложных срабатываний. Реализация на PHP:
class FuzzyMatcher
{
public function jaroWinkler(string $a, string $b): float
{
$maxDist = (int) floor(max(mb_strlen($a), mb_strlen($b)) / 2) - 1;
$matches = 0;
$aMatched = [];
$bMatched = [];
for ($i = 0; $i < mb_strlen($a); $i++) {
$start = max(0, $i - $maxDist);
$end = min($i + $maxDist + 1, mb_strlen($b));
for ($j = $start; $j < $end; $j++) {
if (!isset($bMatched[$j]) && mb_substr($a, $i, 1) === mb_substr($b, $j, 1)) {
$aMatched[$i] = true;
$bMatched[$j] = true;
$matches++;
break;
}
}
}
if ($matches === 0) return 0.0;
$prefix = 0;
for ($i = 0; $i < min(4, mb_strlen($a), mb_strlen($b)); $i++) {
if (mb_substr($a, $i, 1) === mb_substr($b, $i, 1)) $prefix++;
else break;
}
$jaro = ($matches / mb_strlen($a) + $matches / mb_strlen($b) + 1.0) / 3;
return $jaro + $prefix * 0.1 * (1 - $jaro);
}
}
Для товаров со score 0.75–0.92 — серая зона — создаётся очередь ручной модерации. Интерфейс модерации показывает рядом два товара с подсвеченными совпадениями — оператор одним кликом подтверждает или отклоняет слияние. Подробнее об алгоритме — в Wikipedia.
Метрики качества
| Метрика | Норма |
|---|---|
| Precision (доля верных слияний) | > 98% для barcode, > 95% для sku_brand |
| Recall (доля найденных дублей) | > 85% |
| Доля товаров в ручной очереди | < 5% от импорта |
| Время обработки одного товара | < 50 мс |
Сравнение методов нечёткого совпадения
| Метод | Точность на коротких строках | Скорость | Поддержка в PHP |
|---|---|---|---|
| Levenshtein | 70% | Быстро | Встроенная функция |
| Jaro-Winkler | 85% | Средне | Наша реализация |
| TF-IDF + cosine | 90% | Медленно | Требует внешних библиотек |
Jaro-Winkler даёт лучшее соотношение точности и скорости для названий товаров.
Что входит в работу
- Нормализатор данных с конфигурацией под ваш каталог
- Fingerprint-схема с таблицей отпечатков и индексами
- Детектор точных совпадений по штрихкоду и артикулу
- Нечёткое совпадение Jaro-Winkler с настраиваемым порогом
- Очередь ручной модерации с веб-интерфейсом
- Интеграция с вашей ERP/CMS через REST API
- Документация по настройке и эксплуатации
- Обучение до 3 операторов
- Поддержка в течение 1 месяца после внедрения
Сроки ориентировочно
- Нормализатор + fingerprint-схема + точное совпадение: 2 дня
- Нечёткое совпадение (Jaro-Winkler): 1 день
- Очередь ручной модерации + интерфейс: 2 дня
- Метрики + логирование решений: 1 день
Итого: 5–6 рабочих дней на базовую реализацию. Сложные интеграции требуют дополнительной оценки. Наши клиенты экономят до 1 000 000 рублей в год на ручной обработке дублей.
Чек-лист типичных ошибок
| Ошибка | Последствие | Решение |
|---|---|---|
| Сравнение необработанных названий | Много ложных совпадений | Нормализация со стоп-словами |
| Игнорирование штрихкодов разной длины | Пропуск дублей | Приведение к EAN-13 |
| Отсутствие очереди модерации | Ручная работа с каждым дублем | Интерфейс быстрой привязки |
| Слишком низкий порог нечёткого совпадения | Ложные слияния | Порог ≥ 0.92 для автоматики |
Мы гарантируем, что после внедрения вы получите чистый каталог без дублей и сэкономьте до 80% времени на ручной обработке. За 5 лет опыта мы реализовали дедупликацию для 30+ проектов — от небольших интернет-магазинов до крупных дистрибьюторов. Свяжитесь с нами для консультации по вашему проекту — расскажем, как быстро очистить каталог.







