При імпорті товарів від кількох постачальників одна й та сама позиція часто потрапляє до каталогу кілька разів. Різні артикули, назви, штрихкоди — кожен описує продукт по-своєму. Результат: дублі, плутанина, втрачені замовлення та зайві складські залишки. Ми розробили інтелектуальну систему дедуплікації, яка автоматично об'єднує дублікати з точністю до 98% за штрихкодом і 95% за артикулом+брендом. Наш досвід показує: без автоматизації ручна робота з дублями забирає до 30% часу менеджерів, а помилки при ручному злитті призводять до фінансових втрат. Типова ситуація: в каталозі 50 000 товарів, до 20% — дублі. Клієнти бачать однакові позиції з різними цінами, що знижує довіру. Впровадження системи окупається в середньому за 2-3 місяці. Замовте аудит імпорту — оцінимо поточний стан і запропонуємо план усунення дублів.
Проблеми, які вирішуємо
- Штрихкоди з помилками. Постачальники передають коди різної довжини, з ведучими нулями або без. Наївне порівняння пропускає дублі.
- Пересічні артикули. Один товар може мати кілька SKU у різних постачальників, а різні товари — однаковий артикул.
- Назви зі сміттям. Одиниці виміру в дужках, стоп-слова, транслітерація брендів — все це заважає рядковому порівнянню.
- Ручна прив'язка. Без автоматизації при додаванні нового постачальника доводиться перебирати тисячі позицій вручну.
Як ми це робимо
Стратегії ідентифікації дублів
Дедуплікацію вибудовують послідовно: спочатку жорсткі співпадіння, потім нечіткі.
1. Точне співпадіння за GTIN/EAN/UPC
2. Точне співпадіння за артикулом виробника (MPN) + бренд
3. Нормалізована назва + бренд
4. Нечітке співпадіння за текстом (fuzzy)
5. Ручна прив'язка через інтерфейс
Кожен наступний рівень — менш надійний, вимагає перевірки або впевненого порогу.
Чому важливо нормалізувати дані перед дедуплікацією?
Нормалізація — фундамент. Без єдиного формату навіть точні співпадіння втрачаються. Приводимо штрихкоди до EAN-13, назви — до нижнього регістру без зайвих пробілів, бренди — до латиниці. Використовуємо стоп-слова, щоб прибрати спільні для всіх товарів фрази.
class ProductNormalizer
{
public function normalizeName(string $name): string
{
$name = mb_strtolower($name);
$name = preg_replace('/\s+/', ' ', $name);
$name = trim($name);
// Прибрати одиниці виміру в дужках: "Кабель (1м)" → "Кабель 1м"
$name = preg_replace('/\((\d+\s*[а-яa-z]+)\)/u', '$1', $name);
// Стоп-слова для техніки
$stopWords = ['новий', 'оригінал', 'original', 'retail', 'box', 'версія'];
foreach ($stopWords as $word) {
$name = preg_replace('/\b' . preg_quote($word, '/') . '\b/ui', '', $name);
}
return trim(preg_replace('/\s+/', ' ', $name));
}
public function normalizeBarcode(string $barcode): string
{
// Привести до EAN-13: прибрати ведучі нулі, доповнити до 13 символів
$barcode = preg_replace('/\D/', '', $barcode);
$barcode = ltrim($barcode, '0');
return str_pad($barcode, 13, '0', STR_PAD_LEFT);
}
public function normalizeBrand(string $brand): string
{
$map = [
'самсунг' => 'samsung',
'сяомі' => 'xiaomi',
'еппл' => 'apple',
'lg' => 'lg',
'l.g.' => 'lg',
];
$key = mb_strtolower(trim($brand));
return $map[$key] ?? $key;
}
}
Як fingerprint-підхід прискорює пошук дублів?
Замість порівняння кожного нового товару з усіма існуючими ми обчислюємо "відбиток" при імпорті. Відбитки — це хешовані рядки за трьома ключами: штрихкод, артикул+бренд, нормалізована назва+бренд. Пошук за індексом виконується за O(1), а не за O(n).
class ProductFingerprint
{
public function __construct(private ProductNormalizer $normalizer) {}
public function compute(SupplierProductDTO $dto): array
{
$prints = [];
// Fingerprint 1: штрихкод (найнадійніший)
if ($dto->barcode) {
$prints['barcode'] = 'bc:' . $this->normalizer->normalizeBarcode($dto->barcode);
}
// Fingerprint 2: артикул + бренд
if ($dto->sku && $dto->brand) {
$prints['sku_brand'] = 'sb:' . $this->normalizer->normalizeBrand($dto->brand)
. ':' . mb_strtolower(trim($dto->sku));
}
// Fingerprint 3: нормалізована назва + бренд
if ($dto->brand) {
$prints['name_brand'] = 'nb:' . $this->normalizer->normalizeBrand($dto->brand)
. ':' . $this->normalizer->normalizeName($dto->name);
}
return $prints;
}
}
SQL-схема для зберігання відбитків
CREATE TABLE product_fingerprints (
id BIGSERIAL PRIMARY KEY,
product_id BIGINT REFERENCES products(id) ON DELETE CASCADE,
type VARCHAR(20) NOT NULL,
value VARCHAR(500) NOT NULL,
UNIQUE(type, value)
);
CREATE INDEX idx_fingerprints_value ON product_fingerprints(value);
Алгоритм дедуплікації при імпорті
class DeduplicationService
{
public function findOrCreateProduct(SupplierProductDTO $dto): Product
{
$prints = $this->fingerprint->compute($dto);
// Пошук за відбитками в порядку надійності
foreach (['barcode', 'sku_brand', 'name_brand'] as $type) {
if (!isset($prints[$type])) continue;
$existing = ProductFingerprint::where('type', $type)
->where('value', $prints[$type])
->first();
if ($existing) {
$this->mergeFingerprints($existing->product_id, $prints, $type);
return $existing->product;
}
}
// Нечітке співпадіння для незнайдених
if ($candidate = $this->fuzzyMatch($dto)) {
$this->logFuzzyMatch($dto, $candidate);
if ($candidate['score'] >= 0.92) {
return $candidate['product'];
}
}
return $this->createNewProduct($dto, $prints);
}
}
Нечітке співпадіння: Jaro-Winkler проти Levenshtein
Для нечіткого порівняння ми використовуємо алгоритм Jaro-Winkler — він на 15% точніший за Levenshtein для коротких рядків (назви довжиною до 50 символів) і дає менше хибних спрацьовувань. Реалізація на PHP:
class FuzzyMatcher
{
public function jaroWinkler(string $a, string $b): float
{
$maxDist = (int) floor(max(mb_strlen($a), mb_strlen($b)) / 2) - 1;
$matches = 0;
$aMatched = [];
$bMatched = [];
for ($i = 0; $i < mb_strlen($a); $i++) {
$start = max(0, $i - $maxDist);
$end = min($i + $maxDist + 1, mb_strlen($b));
for ($j = $start; $j < $end; $j++) {
if (!isset($bMatched[$j]) && mb_substr($a, $i, 1) === mb_substr($b, $j, 1)) {
$aMatched[$i] = true;
$bMatched[$j] = true;
$matches++;
break;
}
}
}
if ($matches === 0) return 0.0;
$prefix = 0;
for ($i = 0; $i < min(4, mb_strlen($a), mb_strlen($b)); $i++) {
if (mb_substr($a, $i, 1) === mb_substr($b, $i, 1)) $prefix++;
else break;
}
$jaro = ($matches / mb_strlen($a) + $matches / mb_strlen($b) + 1.0) / 3;
return $jaro + $prefix * 0.1 * (1 - $jaro);
}
}
Для товарів зі score 0.75–0.92 — сіра зона — створюється черга ручної модерації. Інтерфейс модерації показує поруч два товари з підсвіченими співпадіннями — оператор одним кліком підтверджує або відхиляє злиття. Детальніше про алгоритм — у Wikipedia.
Метрики якості
| Метрика | Норма |
|---|---|
| Precision (частка вірних злиттів) | > 98% для barcode, > 95% для sku_brand |
| Recall (частка знайдених дублів) | > 85% |
| Частка товарів у ручній черзі | < 5% від імпорту |
| Час обробки одного товару | < 50 мс |
Порівняння методів нечіткого співпадіння
| Метод | Точність на коротких рядках | Швидкість | Підтримка в PHP |
|---|---|---|---|
| Levenshtein | 70% | Швидко | Вбудована функція |
| Jaro-Winkler | 85% | Середньо | Наша реалізація |
| TF-IDF + cosine | 90% | Повільно | Вимагає зовнішніх бібліотек |
Jaro-Winkler дає краще співвідношення точності та швидкості для назв товарів.
Що входить у роботу
- Нормалізатор даних з конфігурацією під ваш каталог
- Fingerprint-схема з таблицею відбитків та індексами
- Детектор точних співпадінь за штрихкодом та артикулом
- Нечітке співпадіння Jaro-Winkler з налаштовуваним порогом
- Черга ручної модерації з веб-інтерфейсом
- Інтеграція з вашою ERP/CMS через REST API
- Документація з налаштування та експлуатації
- Навчання до 3 операторів
- Підтримка протягом 1 місяця після впровадження
Терміни орієнтовно
- Нормалізатор + fingerprint-схема + точне співпадіння: 2 дні
- Нечітке співпадіння (Jaro-Winkler): 1 день
- Черга ручної модерації + інтерфейс: 2 дні
- Метрики + логування рішень: 1 день
Разом: 5–6 робочих днів на базову реалізацію. Складні інтеграції вимагають додаткової оцінки.
Чек-лист типових помилок
| Помилка | Наслідок | Рішення |
|---|---|---|
| Порівняння необроблених назв | Багато хибних співпадінь | Нормалізація зі стоп-словами |
| Ігнорування штрихкодів різної довжини | Пропуск дублів | Приведення до EAN-13 |
| Відсутність черги модерації | Ручна робота з кожним дублем | Інтерфейс швидкої прив'язки |
| Занадто низький поріг нечіткого співпадіння | Хибні злиття | Поріг ≥ 0.92 для автоматики |
Ми гарантуємо, що після впровадження ви отримаєте чистий каталог без дублів і заощадите до 80% часу на ручній обробці. За 5 років досвіду ми реалізували дедуплікацію для 30+ проектів — від невеликих інтернет-магазинів до великих дистриб'юторів. Зв'яжіться з нами для консультації щодо вашого проекту — розповімо, як швидко очистити каталог.







