Дедуплікація товарів при імпорті від кількох постачальників

При імпорті товарів від кількох постачальників одна й та сама позиція часто потрапляє до каталогу кілька разів. Різні артикули, назви, штрихкоди — кожен описує продукт по-своєму. Результат: дублі, плутанина, втрачені замовлення та зайві складські залишки. Ми розробили інтелектуальну систему дедуплік

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Дедуплікація товарів при імпорті від кількох постачальників
Складний
~5 днів

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    984
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    1000

При імпорті товарів від кількох постачальників одна й та сама позиція часто потрапляє до каталогу кілька разів. Різні артикули, назви, штрихкоди — кожен описує продукт по-своєму. Результат: дублі, плутанина, втрачені замовлення та зайві складські залишки. Ми розробили інтелектуальну систему дедуплікації, яка автоматично об'єднує дублікати з точністю до 98% за штрихкодом і 95% за артикулом+брендом. Наш досвід показує: без автоматизації ручна робота з дублями забирає до 30% часу менеджерів, а помилки при ручному злитті призводять до фінансових втрат. Типова ситуація: в каталозі 50 000 товарів, до 20% — дублі. Клієнти бачать однакові позиції з різними цінами, що знижує довіру. Впровадження системи окупається в середньому за 2-3 місяці. Замовте аудит імпорту — оцінимо поточний стан і запропонуємо план усунення дублів.

Проблеми, які вирішуємо

  • Штрихкоди з помилками. Постачальники передають коди різної довжини, з ведучими нулями або без. Наївне порівняння пропускає дублі.
  • Пересічні артикули. Один товар може мати кілька SKU у різних постачальників, а різні товари — однаковий артикул.
  • Назви зі сміттям. Одиниці виміру в дужках, стоп-слова, транслітерація брендів — все це заважає рядковому порівнянню.
  • Ручна прив'язка. Без автоматизації при додаванні нового постачальника доводиться перебирати тисячі позицій вручну.

Як ми це робимо

Стратегії ідентифікації дублів

Дедуплікацію вибудовують послідовно: спочатку жорсткі співпадіння, потім нечіткі.

1. Точне співпадіння за GTIN/EAN/UPC 2. Точне співпадіння за артикулом виробника (MPN) + бренд 3. Нормалізована назва + бренд 4. Нечітке співпадіння за текстом (fuzzy) 5. Ручна прив'язка через інтерфейс 

Кожен наступний рівень — менш надійний, вимагає перевірки або впевненого порогу.

Чому важливо нормалізувати дані перед дедуплікацією?

Нормалізація — фундамент. Без єдиного формату навіть точні співпадіння втрачаються. Приводимо штрихкоди до EAN-13, назви — до нижнього регістру без зайвих пробілів, бренди — до латиниці. Використовуємо стоп-слова, щоб прибрати спільні для всіх товарів фрази.

class ProductNormalizer { public function normalizeName(string $name): string { $name = mb_strtolower($name); $name = preg_replace('/\s+/', ' ', $name); $name = trim($name); // Прибрати одиниці виміру в дужках: "Кабель (1м)" → "Кабель 1м" $name = preg_replace('/\((\d+\s*[а-яa-z]+)\)/u', '$1', $name); // Стоп-слова для техніки $stopWords = ['новий', 'оригінал', 'original', 'retail', 'box', 'версія']; foreach ($stopWords as $word) { $name = preg_replace('/\b' . preg_quote($word, '/') . '\b/ui', '', $name); } return trim(preg_replace('/\s+/', ' ', $name)); } public function normalizeBarcode(string $barcode): string { // Привести до EAN-13: прибрати ведучі нулі, доповнити до 13 символів $barcode = preg_replace('/\D/', '', $barcode); $barcode = ltrim($barcode, '0'); return str_pad($barcode, 13, '0', STR_PAD_LEFT); } public function normalizeBrand(string $brand): string { $map = [ 'самсунг' => 'samsung', 'сяомі' => 'xiaomi', 'еппл' => 'apple', 'lg' => 'lg', 'l.g.' => 'lg', ]; $key = mb_strtolower(trim($brand)); return $map[$key] ?? $key; } } 

Як fingerprint-підхід прискорює пошук дублів?

Замість порівняння кожного нового товару з усіма існуючими ми обчислюємо "відбиток" при імпорті. Відбитки — це хешовані рядки за трьома ключами: штрихкод, артикул+бренд, нормалізована назва+бренд. Пошук за індексом виконується за O(1), а не за O(n).

class ProductFingerprint { public function __construct(private ProductNormalizer $normalizer) {} public function compute(SupplierProductDTO $dto): array { $prints = []; // Fingerprint 1: штрихкод (найнадійніший) if ($dto->barcode) { $prints['barcode'] = 'bc:' . $this->normalizer->normalizeBarcode($dto->barcode); } // Fingerprint 2: артикул + бренд if ($dto->sku && $dto->brand) { $prints['sku_brand'] = 'sb:' . $this->normalizer->normalizeBrand($dto->brand) . ':' . mb_strtolower(trim($dto->sku)); } // Fingerprint 3: нормалізована назва + бренд if ($dto->brand) { $prints['name_brand'] = 'nb:' . $this->normalizer->normalizeBrand($dto->brand) . ':' . $this->normalizer->normalizeName($dto->name); } return $prints; } } 
SQL-схема для зберігання відбитків
CREATE TABLE product_fingerprints ( id BIGSERIAL PRIMARY KEY, product_id BIGINT REFERENCES products(id) ON DELETE CASCADE, type VARCHAR(20) NOT NULL, value VARCHAR(500) NOT NULL, UNIQUE(type, value) ); CREATE INDEX idx_fingerprints_value ON product_fingerprints(value); 

Алгоритм дедуплікації при імпорті

class DeduplicationService { public function findOrCreateProduct(SupplierProductDTO $dto): Product { $prints = $this->fingerprint->compute($dto); // Пошук за відбитками в порядку надійності foreach (['barcode', 'sku_brand', 'name_brand'] as $type) { if (!isset($prints[$type])) continue; $existing = ProductFingerprint::where('type', $type) ->where('value', $prints[$type]) ->first(); if ($existing) { $this->mergeFingerprints($existing->product_id, $prints, $type); return $existing->product; } } // Нечітке співпадіння для незнайдених if ($candidate = $this->fuzzyMatch($dto)) { $this->logFuzzyMatch($dto, $candidate); if ($candidate['score'] >= 0.92) { return $candidate['product']; } } return $this->createNewProduct($dto, $prints); } } 

Нечітке співпадіння: Jaro-Winkler проти Levenshtein

Для нечіткого порівняння ми використовуємо алгоритм Jaro-Winkler — він на 15% точніший за Levenshtein для коротких рядків (назви довжиною до 50 символів) і дає менше хибних спрацьовувань. Реалізація на PHP:

class FuzzyMatcher { public function jaroWinkler(string $a, string $b): float { $maxDist = (int) floor(max(mb_strlen($a), mb_strlen($b)) / 2) - 1; $matches = 0; $aMatched = []; $bMatched = []; for ($i = 0; $i < mb_strlen($a); $i++) { $start = max(0, $i - $maxDist); $end = min($i + $maxDist + 1, mb_strlen($b)); for ($j = $start; $j < $end; $j++) { if (!isset($bMatched[$j]) && mb_substr($a, $i, 1) === mb_substr($b, $j, 1)) { $aMatched[$i] = true; $bMatched[$j] = true; $matches++; break; } } } if ($matches === 0) return 0.0; $prefix = 0; for ($i = 0; $i < min(4, mb_strlen($a), mb_strlen($b)); $i++) { if (mb_substr($a, $i, 1) === mb_substr($b, $i, 1)) $prefix++; else break; } $jaro = ($matches / mb_strlen($a) + $matches / mb_strlen($b) + 1.0) / 3; return $jaro + $prefix * 0.1 * (1 - $jaro); } } 

Для товарів зі score 0.75–0.92 — сіра зона — створюється черга ручної модерації. Інтерфейс модерації показує поруч два товари з підсвіченими співпадіннями — оператор одним кліком підтверджує або відхиляє злиття. Детальніше про алгоритм — у Wikipedia.

Метрики якості

Метрика Норма
Precision (частка вірних злиттів) > 98% для barcode, > 95% для sku_brand
Recall (частка знайдених дублів) > 85%
Частка товарів у ручній черзі < 5% від імпорту
Час обробки одного товару < 50 мс

Порівняння методів нечіткого співпадіння

Метод Точність на коротких рядках Швидкість Підтримка в PHP
Levenshtein 70% Швидко Вбудована функція
Jaro-Winkler 85% Середньо Наша реалізація
TF-IDF + cosine 90% Повільно Вимагає зовнішніх бібліотек

Jaro-Winkler дає краще співвідношення точності та швидкості для назв товарів.

Що входить у роботу

  • Нормалізатор даних з конфігурацією під ваш каталог
  • Fingerprint-схема з таблицею відбитків та індексами
  • Детектор точних співпадінь за штрихкодом та артикулом
  • Нечітке співпадіння Jaro-Winkler з налаштовуваним порогом
  • Черга ручної модерації з веб-інтерфейсом
  • Інтеграція з вашою ERP/CMS через REST API
  • Документація з налаштування та експлуатації
  • Навчання до 3 операторів
  • Підтримка протягом 1 місяця після впровадження

Терміни орієнтовно

  • Нормалізатор + fingerprint-схема + точне співпадіння: 2 дні
  • Нечітке співпадіння (Jaro-Winkler): 1 день
  • Черга ручної модерації + інтерфейс: 2 дні
  • Метрики + логування рішень: 1 день

Разом: 5–6 робочих днів на базову реалізацію. Складні інтеграції вимагають додаткової оцінки.

Чек-лист типових помилок

Помилка Наслідок Рішення
Порівняння необроблених назв Багато хибних співпадінь Нормалізація зі стоп-словами
Ігнорування штрихкодів різної довжини Пропуск дублів Приведення до EAN-13
Відсутність черги модерації Ручна робота з кожним дублем Інтерфейс швидкої прив'язки
Занадто низький поріг нечіткого співпадіння Хибні злиття Поріг ≥ 0.92 для автоматики

Ми гарантуємо, що після впровадження ви отримаєте чистий каталог без дублів і заощадите до 80% часу на ручній обробці. За 5 років досвіду ми реалізували дедуплікацію для 30+ проектів — від невеликих інтернет-магазинів до великих дистриб'юторів. Зв'яжіться з нами для консультації щодо вашого проекту — розповімо, як швидко очистити каталог.