Дедупликация товаров при импорте от нескольких поставщиков

При импорте товаров от нескольких поставщиков одна и та же позиция часто попадает в каталог несколько раз. Разные артикулы, названия, штрихкоды — каждый описывает продукт по-своему. Результат: дубли, путаница, потерянные заказы и лишние складские остатки. Мы разработали интеллектуальную систему деду

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Дедупликация товаров при импорте от нескольких поставщиков
Сложный
~5 дней

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    984
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    1000

При импорте товаров от нескольких поставщиков одна и та же позиция часто попадает в каталог несколько раз. Разные артикулы, названия, штрихкоды — каждый описывает продукт по-своему. Результат: дубли, путаница, потерянные заказы и лишние складские остатки. Мы разработали интеллектуальную систему дедупликации, которая автоматически объединяет дубликаты с точностью до 98% по штрихкоду и 95% по артикулу+бренду. Наш опыт показывает: без автоматизации ручная работа с дублями отнимает до 30% времени менеджеров, а ошибки при ручном слиянии приводят к финансовым потерям. Типичная ситуация: в каталоге 50 000 товаров, до 20% — дубли. Клиенты видят одинаковые позиции с разными ценами, что снижает доверие. Внедрение системы окупается в среднем за 2-3 месяца, а годовая экономия может превышать 500 000 рублей. Закажите аудит импорта — оценим текущее состояние и предложим план устранения дублей.

Проблемы, которые решаем

  • Штрихкоды с ошибками. Поставщики передают коды разной длины, с ведущими нулями или без. Наивное сравнение пропускает дубли.
  • Пересекающиеся артикулы. Один товар может иметь несколько SKU у разных поставщиков, а разные товары — одинаковый артикул.
  • Названия с мусором. Единицы измерения в скобках, стоп-слова, транслитерация брендов — всё это мешает строковому сравнению.
  • Ручная привязка. Без автоматизации при добавлении нового поставщика приходится перебирать тысячи позиций вручную.

Как мы это делаем

Стратегии идентификации дублей

Дедупликацию выстраивают последовательно: сначала жёсткие совпадения, потом нечёткие.

1. Точное совпадение по GTIN/EAN/UPC 2. Точное совпадение по артикулу производителя (MPN) + бренд 3. Нормализованное название + бренд 4. Нечёткое совпадение по тексту (fuzzy) 5. Ручная привязка через интерфейс 

Каждый следующий уровень — менее надёжный, требует проверки или уверенного порога.

Почему важно нормализовать данные перед дедупликацией?

Нормализация — фундамент. Без единого формата даже точные совпадения теряются. Приводим штрихкоды к EAN-13, названия — к нижнему регистру без лишних пробелов, бренды — к латинице. Используем стоп-слова, чтобы убрать общие для всех товаров фразы.

class ProductNormalizer { public function normalizeName(string $name): string { $name = mb_strtolower($name); $name = preg_replace('/\s+/', ' ', $name); $name = trim($name); // Убрать единицы измерения в скобках: "Кабель (1м)" → "Кабель 1м" $name = preg_replace('/\((\d+\s*[а-яa-z]+)\)/u', '$1', $name); // Нормализация числовых значений: "64 GB" → "64gb" $name = preg_replace('/(\d+)\s*(gb|tb|mb|мб|гб|тб)/ui', '$1$2', $name); $name = preg_replace('/(\d+)\s*(мгц|ghz|mhz)/ui', '$1$2', $name); // Стоп-слова для техники $stopWords = ['новый', 'оригинал', 'original', 'retail', 'box', 'версия']; foreach ($stopWords as $word) { $name = preg_replace('/\b' . preg_quote($word, '/') . '\b/ui', '', $name); } return trim(preg_replace('/\s+/', ' ', $name)); } public function normalizeBarcode(string $barcode): string { // Привести к EAN-13: убрать ведущие нули, дополнить до 13 символов $barcode = preg_replace('/\D/', '', $barcode); $barcode = ltrim($barcode, '0'); return str_pad($barcode, 13, '0', STR_PAD_LEFT); } public function normalizeBrand(string $brand): string { $map = [ 'самсунг' => 'samsung', 'сяоми' => 'xiaomi', 'эппл' => 'apple', 'lg' => 'lg', 'l.g.' => 'lg', ]; $key = mb_strtolower(trim($brand)); return $map[$key] ?? $key; } } 

Как fingerprint-подход ускоряет поиск дублей?

Вместо сравнения каждого нового товара со всеми существующими мы вычисляем "отпечаток" при импорте. Отпечатки — это хешированные строки по трём ключам: штрихкод, артикул+бренд, нормализованное название+бренд. Поиск по индексу выполняется за O(1), а не за O(n).

class ProductFingerprint { public function __construct(private ProductNormalizer $normalizer) {} public function compute(SupplierProductDTO $dto): array { $prints = []; // Fingerprint 1: штрихкод (самый надёжный) if ($dto->barcode) { $prints['barcode'] = 'bc:' . $this->normalizer->normalizeBarcode($dto->barcode); } // Fingerprint 2: артикул + бренд if ($dto->sku && $dto->brand) { $prints['sku_brand'] = 'sb:' . $this->normalizer->normalizeBrand($dto->brand) . ':' . mb_strtolower(trim($dto->sku)); } // Fingerprint 3: нормализованное название + бренд if ($dto->brand) { $prints['name_brand'] = 'nb:' . $this->normalizer->normalizeBrand($dto->brand) . ':' . $this->normalizer->normalizeName($dto->name); } return $prints; } } 
SQL-схема для хранения отпечатков
CREATE TABLE product_fingerprints ( id BIGSERIAL PRIMARY KEY, product_id BIGINT REFERENCES products(id) ON DELETE CASCADE, type VARCHAR(20) NOT NULL, value VARCHAR(500) NOT NULL, UNIQUE(type, value) ); CREATE INDEX idx_fingerprints_value ON product_fingerprints(value); 

Алгоритм дедупликации при импорте

class DeduplicationService { public function findOrCreateProduct(SupplierProductDTO $dto): Product { $prints = $this->fingerprint->compute($dto); // Поиск по отпечаткам в порядке надёжности foreach (['barcode', 'sku_brand', 'name_brand'] as $type) { if (!isset($prints[$type])) continue; $existing = ProductFingerprint::where('type', $type) ->where('value', $prints[$type]) ->first(); if ($existing) { $this->mergeFingerprints($existing->product_id, $prints, $type); return $existing->product; } } // Нечёткое совпадение для ненайденных if ($candidate = $this->fuzzyMatch($dto)) { $this->logFuzzyMatch($dto, $candidate); if ($candidate['score'] >= 0.92) { return $candidate['product']; } } return $this->createNewProduct($dto, $prints); } } 

Нечёткое совпадение: Jaro-Winkler против Levenshtein

Для нечёткого сравнения мы используем алгоритм Jaro-Winkler — он на 15% точнее Levenshtein для коротких строк (названия длиной до 50 символов) и даёт меньше ложных срабатываний. Реализация на PHP:

class FuzzyMatcher { public function jaroWinkler(string $a, string $b): float { $maxDist = (int) floor(max(mb_strlen($a), mb_strlen($b)) / 2) - 1; $matches = 0; $aMatched = []; $bMatched = []; for ($i = 0; $i < mb_strlen($a); $i++) { $start = max(0, $i - $maxDist); $end = min($i + $maxDist + 1, mb_strlen($b)); for ($j = $start; $j < $end; $j++) { if (!isset($bMatched[$j]) && mb_substr($a, $i, 1) === mb_substr($b, $j, 1)) { $aMatched[$i] = true; $bMatched[$j] = true; $matches++; break; } } } if ($matches === 0) return 0.0; $prefix = 0; for ($i = 0; $i < min(4, mb_strlen($a), mb_strlen($b)); $i++) { if (mb_substr($a, $i, 1) === mb_substr($b, $i, 1)) $prefix++; else break; } $jaro = ($matches / mb_strlen($a) + $matches / mb_strlen($b) + 1.0) / 3; return $jaro + $prefix * 0.1 * (1 - $jaro); } } 

Для товаров со score 0.75–0.92 — серая зона — создаётся очередь ручной модерации. Интерфейс модерации показывает рядом два товара с подсвеченными совпадениями — оператор одним кликом подтверждает или отклоняет слияние. Подробнее об алгоритме — в Wikipedia.

Метрики качества

Метрика Норма
Precision (доля верных слияний) > 98% для barcode, > 95% для sku_brand
Recall (доля найденных дублей) > 85%
Доля товаров в ручной очереди < 5% от импорта
Время обработки одного товара < 50 мс

Сравнение методов нечёткого совпадения

Метод Точность на коротких строках Скорость Поддержка в PHP
Levenshtein 70% Быстро Встроенная функция
Jaro-Winkler 85% Средне Наша реализация
TF-IDF + cosine 90% Медленно Требует внешних библиотек

Jaro-Winkler даёт лучшее соотношение точности и скорости для названий товаров.

Что входит в работу

  • Нормализатор данных с конфигурацией под ваш каталог
  • Fingerprint-схема с таблицей отпечатков и индексами
  • Детектор точных совпадений по штрихкоду и артикулу
  • Нечёткое совпадение Jaro-Winkler с настраиваемым порогом
  • Очередь ручной модерации с веб-интерфейсом
  • Интеграция с вашей ERP/CMS через REST API
  • Документация по настройке и эксплуатации
  • Обучение до 3 операторов
  • Поддержка в течение 1 месяца после внедрения

Сроки ориентировочно

  • Нормализатор + fingerprint-схема + точное совпадение: 2 дня
  • Нечёткое совпадение (Jaro-Winkler): 1 день
  • Очередь ручной модерации + интерфейс: 2 дня
  • Метрики + логирование решений: 1 день

Итого: 5–6 рабочих дней на базовую реализацию. Сложные интеграции требуют дополнительной оценки. Наши клиенты экономят до 1 000 000 рублей в год на ручной обработке дублей.

Чек-лист типичных ошибок

Ошибка Последствие Решение
Сравнение необработанных названий Много ложных совпадений Нормализация со стоп-словами
Игнорирование штрихкодов разной длины Пропуск дублей Приведение к EAN-13
Отсутствие очереди модерации Ручная работа с каждым дублем Интерфейс быстрой привязки
Слишком низкий порог нечёткого совпадения Ложные слияния Порог ≥ 0.92 для автоматики

Мы гарантируем, что после внедрения вы получите чистый каталог без дублей и сэкономьте до 80% времени на ручной обработке. За 5 лет опыта мы реализовали дедупликацию для 30+ проектов — от небольших интернет-магазинов до крупных дистрибьюторов. Свяжитесь с нами для консультации по вашему проекту — расскажем, как быстро очистить каталог.