Дедупликация товаров при импорте от нескольких поставщиков

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Дедупликация товаров при импорте от нескольких поставщиков
Сложный
~5 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    958
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    949

При импорте товаров от нескольких поставщиков одна и та же позиция часто попадает в каталог несколько раз. Разные артикулы, названия, штрихкоды — каждый описывает продукт по-своему. Результат: дубли, путаница, потерянные заказы и лишние складские остатки. Мы разработали интеллектуальную систему дедупликации, которая автоматически объединяет дубликаты с точностью до 98% по штрихкоду и 95% по артикулу+бренду. Наш опыт показывает: без автоматизации ручная работа с дублями отнимает до 30% времени менеджеров, а ошибки при ручном слиянии приводят к финансовым потерям. Типичная ситуация: в каталоге 50 000 товаров, до 20% — дубли. Клиенты видят одинаковые позиции с разными ценами, что снижает доверие. Внедрение системы окупается в среднем за 2-3 месяца, а годовая экономия может превышать 500 000 рублей. Закажите аудит импорта — оценим текущее состояние и предложим план устранения дублей.

Проблемы, которые решаем

  • Штрихкоды с ошибками. Поставщики передают коды разной длины, с ведущими нулями или без. Наивное сравнение пропускает дубли.
  • Пересекающиеся артикулы. Один товар может иметь несколько SKU у разных поставщиков, а разные товары — одинаковый артикул.
  • Названия с мусором. Единицы измерения в скобках, стоп-слова, транслитерация брендов — всё это мешает строковому сравнению.
  • Ручная привязка. Без автоматизации при добавлении нового поставщика приходится перебирать тысячи позиций вручную.

Как мы это делаем

Стратегии идентификации дублей

Дедупликацию выстраивают последовательно: сначала жёсткие совпадения, потом нечёткие.

1. Точное совпадение по GTIN/EAN/UPC
2. Точное совпадение по артикулу производителя (MPN) + бренд
3. Нормализованное название + бренд
4. Нечёткое совпадение по тексту (fuzzy)
5. Ручная привязка через интерфейс

Каждый следующий уровень — менее надёжный, требует проверки или уверенного порога.

Почему важно нормализовать данные перед дедупликацией?

Нормализация — фундамент. Без единого формата даже точные совпадения теряются. Приводим штрихкоды к EAN-13, названия — к нижнему регистру без лишних пробелов, бренды — к латинице. Используем стоп-слова, чтобы убрать общие для всех товаров фразы.

class ProductNormalizer
{
    public function normalizeName(string $name): string
    {
        $name = mb_strtolower($name);
        $name = preg_replace('/\s+/', ' ', $name);
        $name = trim($name);

        // Убрать единицы измерения в скобках: "Кабель (1м)" → "Кабель 1м"
        $name = preg_replace('/\((\d+\s*[а-яa-z]+)\)/u', '$1', $name);

        // Нормализация числовых значений: "64 GB" → "64gb"
        $name = preg_replace('/(\d+)\s*(gb|tb|mb|мб|гб|тб)/ui', '$1$2', $name);
        $name = preg_replace('/(\d+)\s*(мгц|ghz|mhz)/ui', '$1$2', $name);

        // Стоп-слова для техники
        $stopWords = ['новый', 'оригинал', 'original', 'retail', 'box', 'версия'];
        foreach ($stopWords as $word) {
            $name = preg_replace('/\b' . preg_quote($word, '/') . '\b/ui', '', $name);
        }

        return trim(preg_replace('/\s+/', ' ', $name));
    }

    public function normalizeBarcode(string $barcode): string
    {
        // Привести к EAN-13: убрать ведущие нули, дополнить до 13 символов
        $barcode = preg_replace('/\D/', '', $barcode);
        $barcode = ltrim($barcode, '0');
        return str_pad($barcode, 13, '0', STR_PAD_LEFT);
    }

    public function normalizeBrand(string $brand): string
    {
        $map = [
            'самсунг' => 'samsung',
            'сяоми'   => 'xiaomi',
            'эппл'    => 'apple',
            'lg'      => 'lg',
            'l.g.'    => 'lg',
        ];
        $key = mb_strtolower(trim($brand));
        return $map[$key] ?? $key;
    }
}

Как fingerprint-подход ускоряет поиск дублей?

Вместо сравнения каждого нового товара со всеми существующими мы вычисляем "отпечаток" при импорте. Отпечатки — это хешированные строки по трём ключам: штрихкод, артикул+бренд, нормализованное название+бренд. Поиск по индексу выполняется за O(1), а не за O(n).

class ProductFingerprint
{
    public function __construct(private ProductNormalizer $normalizer) {}

    public function compute(SupplierProductDTO $dto): array
    {
        $prints = [];

        // Fingerprint 1: штрихкод (самый надёжный)
        if ($dto->barcode) {
            $prints['barcode'] = 'bc:' . $this->normalizer->normalizeBarcode($dto->barcode);
        }

        // Fingerprint 2: артикул + бренд
        if ($dto->sku && $dto->brand) {
            $prints['sku_brand'] = 'sb:' . $this->normalizer->normalizeBrand($dto->brand)
                . ':' . mb_strtolower(trim($dto->sku));
        }

        // Fingerprint 3: нормализованное название + бренд
        if ($dto->brand) {
            $prints['name_brand'] = 'nb:' . $this->normalizer->normalizeBrand($dto->brand)
                . ':' . $this->normalizer->normalizeName($dto->name);
        }

        return $prints;
    }
}
SQL-схема для хранения отпечатков
CREATE TABLE product_fingerprints (
    id          BIGSERIAL PRIMARY KEY,
    product_id  BIGINT REFERENCES products(id) ON DELETE CASCADE,
    type        VARCHAR(20) NOT NULL,
    value       VARCHAR(500) NOT NULL,
    UNIQUE(type, value)
);
CREATE INDEX idx_fingerprints_value ON product_fingerprints(value);

Алгоритм дедупликации при импорте

class DeduplicationService
{
    public function findOrCreateProduct(SupplierProductDTO $dto): Product
    {
        $prints = $this->fingerprint->compute($dto);

        // Поиск по отпечаткам в порядке надёжности
        foreach (['barcode', 'sku_brand', 'name_brand'] as $type) {
            if (!isset($prints[$type])) continue;

            $existing = ProductFingerprint::where('type', $type)
                ->where('value', $prints[$type])
                ->first();

            if ($existing) {
                $this->mergeFingerprints($existing->product_id, $prints, $type);
                return $existing->product;
            }
        }

        // Нечёткое совпадение для ненайденных
        if ($candidate = $this->fuzzyMatch($dto)) {
            $this->logFuzzyMatch($dto, $candidate);
            if ($candidate['score'] >= 0.92) {
                return $candidate['product'];
            }
        }

        return $this->createNewProduct($dto, $prints);
    }
}

Нечёткое совпадение: Jaro-Winkler против Levenshtein

Для нечёткого сравнения мы используем алгоритм Jaro-Winkler — он на 15% точнее Levenshtein для коротких строк (названия длиной до 50 символов) и даёт меньше ложных срабатываний. Реализация на PHP:

class FuzzyMatcher
{
    public function jaroWinkler(string $a, string $b): float
    {
        $maxDist = (int) floor(max(mb_strlen($a), mb_strlen($b)) / 2) - 1;
        $matches = 0;
        $aMatched = [];
        $bMatched = [];

        for ($i = 0; $i < mb_strlen($a); $i++) {
            $start = max(0, $i - $maxDist);
            $end   = min($i + $maxDist + 1, mb_strlen($b));

            for ($j = $start; $j < $end; $j++) {
                if (!isset($bMatched[$j]) && mb_substr($a, $i, 1) === mb_substr($b, $j, 1)) {
                    $aMatched[$i] = true;
                    $bMatched[$j] = true;
                    $matches++;
                    break;
                }
            }
        }

        if ($matches === 0) return 0.0;

        $prefix = 0;
        for ($i = 0; $i < min(4, mb_strlen($a), mb_strlen($b)); $i++) {
            if (mb_substr($a, $i, 1) === mb_substr($b, $i, 1)) $prefix++;
            else break;
        }

        $jaro = ($matches / mb_strlen($a) + $matches / mb_strlen($b) + 1.0) / 3;
        return $jaro + $prefix * 0.1 * (1 - $jaro);
    }
}

Для товаров со score 0.75–0.92 — серая зона — создаётся очередь ручной модерации. Интерфейс модерации показывает рядом два товара с подсвеченными совпадениями — оператор одним кликом подтверждает или отклоняет слияние. Подробнее об алгоритме — в Wikipedia.

Метрики качества

Метрика Норма
Precision (доля верных слияний) > 98% для barcode, > 95% для sku_brand
Recall (доля найденных дублей) > 85%
Доля товаров в ручной очереди < 5% от импорта
Время обработки одного товара < 50 мс

Сравнение методов нечёткого совпадения

Метод Точность на коротких строках Скорость Поддержка в PHP
Levenshtein 70% Быстро Встроенная функция
Jaro-Winkler 85% Средне Наша реализация
TF-IDF + cosine 90% Медленно Требует внешних библиотек

Jaro-Winkler даёт лучшее соотношение точности и скорости для названий товаров.

Что входит в работу

  • Нормализатор данных с конфигурацией под ваш каталог
  • Fingerprint-схема с таблицей отпечатков и индексами
  • Детектор точных совпадений по штрихкоду и артикулу
  • Нечёткое совпадение Jaro-Winkler с настраиваемым порогом
  • Очередь ручной модерации с веб-интерфейсом
  • Интеграция с вашей ERP/CMS через REST API
  • Документация по настройке и эксплуатации
  • Обучение до 3 операторов
  • Поддержка в течение 1 месяца после внедрения

Сроки ориентировочно

  • Нормализатор + fingerprint-схема + точное совпадение: 2 дня
  • Нечёткое совпадение (Jaro-Winkler): 1 день
  • Очередь ручной модерации + интерфейс: 2 дня
  • Метрики + логирование решений: 1 день

Итого: 5–6 рабочих дней на базовую реализацию. Сложные интеграции требуют дополнительной оценки. Наши клиенты экономят до 1 000 000 рублей в год на ручной обработке дублей.

Чек-лист типичных ошибок

Ошибка Последствие Решение
Сравнение необработанных названий Много ложных совпадений Нормализация со стоп-словами
Игнорирование штрихкодов разной длины Пропуск дублей Приведение к EAN-13
Отсутствие очереди модерации Ручная работа с каждым дублем Интерфейс быстрой привязки
Слишком низкий порог нечёткого совпадения Ложные слияния Порог ≥ 0.92 для автоматики

Мы гарантируем, что после внедрения вы получите чистый каталог без дублей и сэкономьте до 80% времени на ручной обработке. За 5 лет опыта мы реализовали дедупликацию для 30+ проектов — от небольших интернет-магазинов до крупных дистрибьюторов. Свяжитесь с нами для консультации по вашему проекту — расскажем, как быстро очистить каталог.

Разработка интернет-магазинов

Мы знаем: интернет-магазин — это не просто «сайт с корзиной». Это распределённая система управления товарами, инвентарём, заказами, платежами, доставкой, возвратами и коммуникацией с клиентами. Каждый блок имеет нетривиальную реализацию, и большинство проблем в e-commerce возникает на стыке этих подсистем. Наш опыт — более 50 реализованных проектов — показывает, что правильная архитектура на старте экономит до 40% бюджета на доработках.

Почему производительность каталога деградирует при росте SKU?

Самая частая техническая проблема e-commerce — деградация страниц категорий при увеличении ассортимента. Страница работает хорошо на 500 товарах и начинает тормозить на 10 000. Причины почти всегда одни и те же.

N+1 на атрибутах. Загружаете список товаров — 50 элементов. Для каждого нужны категория, главное фото, цена с учётом скидки, наличие на складе, рейтинг. Без правильного eager loading это 250+ запросов на страницу. В Laravel решается через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) и withAvg('reviews', 'rating'). Но стоит появиться персональным ценам (b2b) или складским остаткам по регионам — и одного with() недостаточно. Нужны Query Object или выделенный ReadModel.

Фасетная фильтрация без индексов. Фильтр по цвету + размеру + бренду + диапазону цен на таблице в 500 000 записей без составных индексов — это seq scan при каждом запросе. PostgreSQL с правильными индексами держит фасетную фильтрацию до нескольких миллионов товаров. Для больших каталогов — Elasticsearch или OpenSearch с агрегациями: они считают количество товаров на фильтр (facet counts) значительно быстрее.

Пагинация через OFFSET. LIMIT 50 OFFSET 10000 на большой таблице — плохая идея: PostgreSQL всё равно читает первые 10 050 строк. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 работает за константное время независимо от страницы. Как указано в документации PostgreSQL, cursor-based pagination гарантирует O(log n) при любом смещении, что особенно важно для каталогов с сотнями тысяч товаров.

Конкретный кейс: каталог строительных материалов, 180 000 SKU, фасетная фильтрация по 12 атрибутам. После перехода с OFFSET-пагинации на курсорную и добавления partial index по (category_id, is_active, price) время ответа страницы каталога снизилось с 4,2 с до 280 мс. Экономия на серверных ресурсах составила около 30 000 ₽ в месяц. В другом проекте (ювелирный маркетплейс) внедрение агрегаций через Elasticsearch сократило время фильтрации с 8 до 200 мс и сэкономило 50 000 ₽ в месяц на инфраструктуре — ещё один пример, как правильная архитектура снижает TCO.

Что такое race condition в корзине и как его избежать?

Checkout — место, где деньги либо попадают на счёт, либо нет. Технические проблемы здесь стоят дорого.

Race condition при резервировании товара. Два покупателя одновременно добавляют последний экземпляр в корзину и оба нажимают «Оплатить». Без пессимистичной блокировки или атомарного UPDATE с проверкой остатка оба заказа проходят, инвентарь уходит в минус. В PostgreSQL:

UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
  AND (available - reserved) >= $quantity
RETURNING id;

Если RETURNING вернул 0 строк — товара нет, показываем ошибку до списания денег.

Идемпотентность платёжных вебхуков. payment.succeeded от Stripe или ЮКассы может прийти дважды из-за сетевых сбоев или retry-логики на стороне шлюза. Без проверки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублирование заказа или двойное зачисление. Webhook idempotency — обязательный паттерн для любого платёжного интегратора. Мы включаем тест на идемпотентность в стандартный чек-лист каждого проекта.

Checkout в несколько шагов. Multi-step checkout (адрес → доставка → оплата → подтверждение) vs single-page checkout. Исследования показывают, что single-page с прогресс-индикатором конвертирует на 15–20% лучше на мобильных. Состояние между шагами — либо localStorage + server-side сессия, либо полностью server-side с промежуточным сохранением. Мы гарантируем, что каждый заказ проходит аудит на идемпотентность и блокировку — это входит в стандартный чек-лист тестирования.

Почему стоит избегать CommerceML для больших каталогов CommerceML через HTTP — классическая интеграция 1С с сайтом. 1С выгружает XML по расписанию, сайт импортирует. Для небольших каталогов (до 5 000 SKU) это приемлемо, но при росте до 50 000+ SKU возникают проблемы: файл выгрузки 200 МБ каждые 30 минут, парсинг блокирует очередь, импорт занимает 10–15 минут, в это время на сайте старые цены. Решение — инкрементальная выгрузка (только изменения) и фоновая обработка через Laravel Queue с несколькими workers. Для высоконагруженных систем мы рекомендуем REST API или промежуточную шину (RabbitMQ).

Интеграции: 1С, склад, доставка

1С — отдельная глава. Три распространённых способа интеграции:

  1. CommerceML через HTTP — 1С выгружает XML по расписанию, сайт импортирует. Работает для небольших каталогов, есть задержка синхронизации.
  2. REST API / OData от 1С — двусторонняя синхронизация в реальном времени. Требует настройки на стороне 1С, капризна к версиям конфигураций.
  3. Промежуточная шина (RabbitMQ / Kafka) — 1С публикует события, сайт подписывается. Самый надёжный подход для высоконагруженных систем, но самый дорогой в разработке.

Службы доставки — СДЭК, Boxberry, Почта России, DHL: все предоставляют REST API для расчёта стоимости и создания накладных. Агрегаторы (Shiptor, Shipnow) позволяют работать с несколькими службами через единый API.

Платёжные шлюзы

Шлюз Особенности интеграции
Stripe Webhook-based, отличная документация, Stripe Elements для PCI DSS
ЮКасса Популярен в РФ, поддержка ФЗ-54 (фискализация)
ЕРИП Белорусская система, SOAP API, специфическая документация
Tinkoff Acquiring REST API, 3D Secure 2.0, webhook-уведомления

Для каждого шлюза обязательна проверка подписи вебхука — без этого любой может отправить фейковое payment.succeeded.

CMS vs собственная разработка

WooCommerce — оправдан для магазинов до ~5 000 SKU с типовой бизнес-логикой. Быстрый старт, огромная экосистема плагинов. Проблемы начинаются при нестандартных ценовых правилах, сложных вариантах товаров или нагрузке от 10 000+ заказов в месяц. Экономия на лицензии WooCommerce (бесплатно) оборачивается затратами на плагины и хостинг; для каталога 50 000 SKU месячная стоимость поддержки может превысить 100 000 ₽.

OpenCart, Prestashop — аналогичная история. Хороши для старта, ограничены при росте.

Собственная разработка на Laravel — для:

  • Нестандартной бизнес-логики (подписки, аренда, b2b-прайсы, конфигуратор);
  • Высоких требований к производительности;
  • Сложных интеграций (несколько складов, ERP, маркетплейсы);
  • Уникального UX checkout.

Как мы разрабатываем интернет-магазин: пошаговый процесс

  1. Аналитика и проектирование. Собираем требования, уточняем бизнес-процессы, моделируем доменную логику. На выходе — техническое задание и архитектурная схема.
  2. Backend и API. Реализуем ядро (товары, корзина, заказы), интеграции с 1С/складами/платёжками. Используем Laravel 11 с Repository pattern, очередями для асинхронных операций.
  3. Frontend и checkout. Настраиваем React 18 / Next.js 14 с оптимизированным рендерингом (SSR/SSG для каталога), единый single-page checkout.
  4. Тестирование. Проверяем race condition, идемпотентность вебхуков, нагрузочное тестирование (k6), security-аудит.
  5. Деплой и мониторинг. Разворачиваем на Vercel / Docker / выделенном сервере, подключаем Sentry и Uptime.

SEO для e-commerce

Canonical и дублирование. Фасетная фильтрация генерирует тысячи URL (?color=red&size=M&sort=price). Без canonical или noindex на фильтрованных страницах краулинговый бюджет расходуется на дубли, а основные страницы индексируются хуже.

Structured data. Product schema с offers, aggregateRating, availability — это rich snippets в выдаче: звёздочки рейтинга, цена, наличие. Влияет на CTR.

Core Web Vitals на страницах товаров. Hero image товара — это LCP element. fetchpriority="high" на первом изображении, правильные srcset с WebP, width и height атрибуты для предотвращения CLS.

Что входит в результат работы

После завершения проекта вы получаете:

  • Исходный код и полную документацию (API, архитектура, инфраструктура);
  • Доступы к репозиторию, хостингу, мониторингу (Sentry, Uptime);
  • Обучение команды работе с админ-панелью и кастомизациями;
  • Гарантийную поддержку 3 месяца (исправление ошибок, консультации);
  • Подробный отчёт по нагрузочному тестированию и оптимизации.

Ориентиры по срокам

Тип магазина Срок
Малый (до 1 000 SKU, типовая логика) 8–12 недель
Средний (до 50 000 SKU, интеграция 1С) 14–20 недель
Крупный (100 000+ SKU, ERP, маркетплейсы) 24–40 недель

Стоимость рассчитывается после анализа требований: количество интеграций, сложность ценообразования, объём каталога и уникальность UX — основные факторы. Оценим ваш проект бесплатно — закажите консультацию.

Чек-лист перед запуском

  • Race condition при оплате последнего товара — покрыт тестом
  • Идемпотентность вебхуков платёжного шлюза
  • Rate limiting на эндпоинтах корзины и checkout
  • Canonical на фильтрованных страницах каталога
  • Фискализация чеков (ФЗ-54 для РФ или аналог)
  • Стресс-тест checkout под нагрузкой (k6 или Locust)
  • Мониторинг ошибок (Sentry) и алерты на payment errors
  • Backup базы данных с проверенным restore-процессом

Гарантируем — каждый проект проходит этот чек-лист перед релизом. Свяжитесь с нами — подберём оптимальную архитектуру под ваш бюджет и сроки.