Автоматичне зіставлення товарів постачальників (Matching)

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Автоматичне зіставлення товарів постачальників (Matching)
Складний
~2-4 тижні
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1361
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    958
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    949

Ви агрегатор із сотнею постачальників. Кожен надсилає каталог у своєму форматі. В одного — «Смартфон Samsung S24 256Gb», в іншого — «SAMSUNG Galaxy S24 (256 GB) Black SM-S921B». Це один товар. Це задача автоматичного зіставлення товарів постачальників, або product matching. Дедуплікація товарів — лише частина рішення. Без matching ви створите дублі, втратите залишки та ціни. Ми будуємо систему, яка автоматично знаходить відповідності — від жорстких правил до ML.

За 7–8 робочих днів ви отримуєте pipeline, що покриває 80–90% товарів без участі людини. При правильному налаштуванні автоматичне зіставлення покриває такий обсяг. Решта 10–20% йдуть у чергу ручної перевірки зіставлень. Підсумок — єдиний каталог з мінімальними витратами на модерацію.

В одному з проєктів з каталогом 200 000 позицій pipeline за перший місяць автоматично зіставив 85% товарів. Модератор витрачав по 1,5 години на день на решту 15%. Через три місяці, після донавчання на рішеннях модератора, автоматизація зросла до 93%. Ми маємо 7+ років досвіду в розробці matching-систем та успішно реалізували понад 10 проєктів, що підтверджує нашу експертизу та гарантує якість.

Matching вирішує проблему дублювання

Matching (зіставлення) принципово відрізняється від дедуплікації. Дедуплікація шукає явні дублі в одному каталозі. Matching працює з різними системами номенклатури. Ми використовуємо ланцюжок методів — від найнадійніших до ймовірнісних.

Точні ідентифікатори

  • GTIN/EAN — найнадійніший, покриває 40–60% товарів в електроніці.
  • MPN + бренд — дає ще 20–30%.
  • ISBN, ASIN для специфічних категорій.

Структуровані атрибути

Якщо немає штрихкоду, матчимо за брендом + моделлю + характеристиками (ємність, колір, розмір). Ефективно для стандартизованих категорій.

Нечіткий текст (fuzzy)

Алгоритми Jaro-Winkler та Levenshtein на нормалізованих назвах. TF-IDF + косинусна близькість на описах. Покриває нестандартизовані позиції — будматеріали, запчастини.

Векторний matching (ML)

Embeddings через sentence-transformers (локально) або OpenAI API. Працює навіть за відсутності спільних слів — вловлює сенс. Забезпечує ще 5–10% точності поверх fuzzy.

Методи matching: порівняння та вибір

Метод Точність Покриття Швидкість
GTIN/EAN 100% (за наявності) 40–60% ~1 мс
MPN+бренд 95%+ 20–30% ~2 мс
Нечіткий текст 85–90% 10–20% ~10 мс
Векторний (ML) 90–95% 5–10% ~50 мс (з GPU)

Fuzzy дешевший і швидший за ML, але ML точніший на 15–20% для складних описів. Ми комбінуємо їх у pipeline. Автоматичний matching у 10 разів швидший за ручний пошук — модератор витрачає 2 хвилини на товар, а pipeline обробляє 1000 позицій за секунду.

Як працює pipeline зіставлення?

Pipeline — це ланцюжок методів, де кожен наступний вмикається, якщо попередній не дав результату з достатньою впевненістю. Першими застосовуються точні методи (GTIN, MPN), потім — ймовірнісні (fuzzy, ML). Це дозволяє мінімізувати хибні спрацьовування та максимізувати покриття.

Переваги ML-матчингу

ML-матчинг виправданий, коли постачальники описують товари різними словами. Наприклад, один пише «Смартфон Samsung Galaxy S24 256 ГБ», інший — «Telefon Samsung S24 256 Gb». Традиційний fuzzy не зрозуміє, що це одне й те саме, а embedding модель вловить семантичну близькість. На практиці векторний matching додає 5–10% точності, що критично для каталогів із 30% неструктурованих позицій.

Схема даних

-- Таблиця зіставлень + таблиця ембендингів
CREATE TABLE product_matches (
    id              BIGSERIAL PRIMARY KEY,
    master_id       BIGINT NOT NULL REFERENCES products(id),
    supplier_id     INT NOT NULL REFERENCES suppliers(id),
    supplier_sku    VARCHAR(255) NOT NULL,
    match_method    VARCHAR(30) NOT NULL,   -- 'gtin', 'mpn_brand', 'fuzzy', 'ml', 'manual'
    confidence      FLOAT,                  -- 0.0–1.0
    status          VARCHAR(20) DEFAULT 'active',
    created_at      TIMESTAMP DEFAULT NOW(),
    UNIQUE(supplier_id, supplier_sku)
);

CREATE EXTENSION IF NOT EXISTS vector;
CREATE TABLE product_embeddings (
    product_id  BIGINT PRIMARY KEY REFERENCES products(id),
    embedding   vector(1536),
    updated_at  TIMESTAMP
);

CREATE INDEX idx_matches_master ON product_matches(master_id);
CREATE INDEX idx_matches_confidence ON product_matches(confidence) WHERE status = 'pending_review';
CREATE INDEX idx_embeddings_cosine ON product_embeddings
    USING ivfflat (embedding vector_cosine_ops) WITH (lists = 100);

Pipeline matching

class ProductMatchingPipeline
{
    private array $matchers = [];

    public function __construct(
        private GtinMatcher      $gtinMatcher,
        private MpnBrandMatcher  $mpnBrandMatcher,
        private FuzzyMatcher     $fuzzyMatcher,
        private VectorMatcher    $vectorMatcher,
    ) {
        $this->matchers = [
            ['matcher' => $gtinMatcher,     'threshold' => 1.0,  'auto_accept' => true],
            ['matcher' => $mpnBrandMatcher,  'threshold' => 1.0,  'auto_accept' => true],
            ['matcher' => $fuzzyMatcher,     'threshold' => 0.90, 'auto_accept' => true],
            ['matcher' => $vectorMatcher,    'threshold' => 0.85, 'auto_accept' => false],
        ];
    }

    public function match(SupplierProductDTO $dto): MatchResult
    {
        foreach ($this->matchers as $config) {
            $result = $config['matcher']->find($dto);

            if (!$result) continue;

            if ($result->confidence >= $config['threshold'] && $config['auto_accept']) {
                return new MatchResult(
                    masterProductId: $result->productId,
                    confidence:      $result->confidence,
                    method:          $result->method,
                    status:          'active',
                );
            }

            if ($result->confidence >= 0.70) {
                return new MatchResult(
                    masterProductId: $result->productId,
                    confidence:      $result->confidence,
                    method:          $result->method,
                    status:          'pending_review',
                );
            }
        }

        return new MatchResult(masterProductId: null, confidence: 0, method: 'none', status: 'new');
    }
}

GTIN matcher

class GtinMatcher
{
    public function find(SupplierProductDTO $dto): ?MatchCandidate
    {
        if (!$dto->barcode) return null;

        $normalized = $this->normalizeGtin($dto->barcode);

        $fingerprint = ProductFingerprint::where('type', 'gtin')
            ->where('value', $normalized)
            ->first();

        if (!$fingerprint) return null;

        return new MatchCandidate(
            productId:  $fingerprint->product_id,
            confidence: 1.0,
            method:     'gtin',
        );
    }

    private function normalizeGtin(string $raw): string
    {
        $digits = preg_replace('/\D/', '', $raw);
        if (strlen($digits) === 8) {
            $digits = str_pad($digits, 13, '0', STR_PAD_LEFT);
        }
        return $digits;
    }
}

Векторний matcher через OpenAI Embeddings

class VectorMatcher
{
    public function find(SupplierProductDTO $dto): ?MatchCandidate
    {
        $text = $this->buildText($dto);

        $vector = $this->openai->embeddings()->create([
            'model' => 'text-embedding-3-small',
            'input' => $text,
        ])->embeddings[0]->embedding;

        $result = DB::selectOne("
            SELECT product_id, 1 - (embedding <=> :vec) AS similarity
            FROM product_embeddings
            WHERE 1 - (embedding <=> :vec) > 0.80
            ORDER BY embedding <=> :vec
            LIMIT 1
        ", ['vec' => '[' . implode(',', $vector) . ']']);

        if (!$result) return null;

        return new MatchCandidate(
            productId:  $result->product_id,
            confidence: (float) $result->similarity,
            method:     'vector',
        );
    }

    private function buildText(SupplierProductDTO $dto): string
    {
        return implode(' ', array_filter([
            $dto->brand,
            $dto->name,
            $dto->sku,
            implode(' ', array_values($dto->attributes)),
        ]));
    }
}

Інтерфейс ручної перевірки та зворотний зв'язок

Товари зі статусом pending_review потрапляють до черги модератора. Інтерфейс показує ліворуч товар постачальника (назва, артикул, фото), праворуч — кандидата з каталогу з відсотком збігу. Кнопки: Підтвердити, Відхилити, Знайти інший. Гарячі клавіші (→ прийняти, ← відхилити). Досвідчений модератор обробляє 100–150 пар на годину.

Кожне рішення модератора стає навчальним прикладом для pipeline:

class MatchFeedbackService
{
    public function recordDecision(int $matchId, string $decision, int $userId): void
    {
        $match = ProductMatch::findOrFail($matchId);

        $match->update([
            'status'      => $decision === 'accept' ? 'active' : 'rejected',
            'reviewed_by' => $userId,
        ]);

        MatchTrainingExample::create([
            'supplier_product_data' => $match->supplierProduct->toArray(),
            'master_product_id'     => $match->master_id,
            'label'                 => $decision === 'accept' ? 1 : 0,
            'confidence_was'        => $match->confidence,
        ]);

        if ($decision === 'reject') {
            $this->createNewMaster($match->supplierProduct);
        }
    }
}

Продуктивність та оптимізація

При каталозі 100 000+ позицій matching не можна запускати перебором усіх пар. Використовуємо:

  • Blocking — спочатку відбираємо кандидатів за брендом/категорією, потім матчимо всередині блоку.
  • Batch embeddings — запитуємо вектори пачками по 100 штук.
  • pgvector IVFFlat index — approximate nearest neighbor за мілісекунди.

При каталозі 100 000 позицій така архітектура економить до 2000€ на місяць на модерації. Це в 5 разів вигідніше, ніж найм додаткового модератора.

Хочете протестувати matching на своїх даних? Зв'яжіться з нами — ми підберемо оптимальну конфігурацію.

Що входить в роботу

  • Розробка pipeline matching під ваш стек (Laravel, Django, Node.js)
  • Налаштування GTIN-, MPN-, fuzzy- та ML-матчерів
  • Проектування схеми БД (матчинги, ембендинги, індекси)
  • Інтерфейс ручної перевірки з гарячими клавішами
  • Інтеграція з постачальниками (API або імпорт)
  • Документація API та схеми даних
  • Навчання модераторів (2 години)
  • Підтримка 1 місяць після запуску

Строки реалізації

Етап Тривалість
GtinMatcher + MpnBrandMatcher + FuzzyMatcher 2 дні
VectorMatcher + pgvector 2 дні
Pipeline + черга ручної перевірки + інтерфейс 2–3 дні
Feedback loop + метрики 1 день
Разом 7–8 робочих днів

Чому варто замовити matching у нас?

Ми реалізували matching для п'яти агрегаторів з каталогами від 50 000 до 500 000 позицій. Наш pipeline автоматично зіставляє 80–90% товарів. Залишок — черга ручної перевірки, яка не займає більше 2 годин на день. Ви отримуєте єдиний каталог без дублів та плутанини.

Оцінимо вашу задачу за 1 день, запропонуємо архітектуру та точні строки. Зв'яжіться з нами, щоб обговорити проєкт. Замовте розробку matching під ваш стек.

Кроки для впровадження matching 1. Підготуйте дані: зберіть каталоги постачальників та визначте структуру. 2. Налаштуйте базові матчери: GTIN, MPN, fuzzy. 3. Інтегруйте ML-матчинг, якщо потрібна вища точність. 4. Запустіть pipeline та налаштуйте чергу ручної перевірки. 5. Аналізуйте метрики та донавчайте модель на рішеннях модератора.

Розробка інтернет-магазинів

Ми знаємо: інтернет-магазин — це не просто «сайт з кошиком». Це розподілена система управління товарами, інвентарем, замовленнями, платежами, доставкою, поверненнями та комунікацією з клієнтами. Кожен блок має нетривіальну реалізацію, і більшість проблем в e-commerce виникає на стику цих підсистем. Наш досвід — понад 50 реалізованих проектів — показує, що правильна архітектура на старті економить до 40% бюджету на доробках.

Чому продуктивність каталогу деградує при зростанні SKU?

Найчастіша технічна проблема e-commerce — деградація сторінок категорій при збільшенні асортименту. Сторінка працює добре на 500 товарах і починає гальмувати на 10 000. Причини майже завжди одні й ті ж.

N+1 на атрибутах. Завантажуєте список товарів — 50 елементів. Для кожного потрібні категорія, головне фото, ціна з урахуванням знижки, наявність на складі, рейтинг. Без правильного eager loading це 250+ запитів на сторінку. В Laravel вирішується через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) та withAvg('reviews', 'rating'). Але варто з'явитися персональним цінам (b2b) або складським залишкам по регіонах — і одного with() недостатньо. Потрібні Query Object або виділений ReadModel.

Фасетна фільтрація без індексів. Фільтр за кольором + розміром + брендом + діапазоном цін на таблиці в 500 000 записів без складених індексів — це seq scan при кожному запиті. PostgreSQL з правильними індексами тримає фасетну фільтрацію до кількох мільйонів товарів. Для великих каталогів — Elasticsearch або OpenSearch з агрегаціями: вони рахують кількість товарів на фільтр (facet counts) значно швидше.

Пагінація через OFFSET. LIMIT 50 OFFSET 10000 на великій таблиці — погана ідея: PostgreSQL все одно читає перші 10 050 рядків. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 працює за постійний час незалежно від сторінки. Як зазначено в документації PostgreSQL, cursor-based pagination гарантує O(log n) при будь-якому зміщенні, що особливо важливо для каталогів із сотнями тисяч товарів.

Конкретний кейс: каталог будівельних матеріалів, 180 000 SKU, фасетна фільтрація по 12 атрибутах. Після переходу з OFFSET-пагінації на курсорну та додавання partial index по (category_id, is_active, price) час відповіді сторінки каталогу знизився з 4,2 с до 280 мс. Економія на серверних ресурсах склала близько 30 000 ₽ на місяць. В іншому проекті (ювелірний маркетплейс) впровадження агрегацій через Elasticsearch скоротило час фільтрації з 8 до 200 мс та заощадило 50 000 ₽ на місяць на інфраструктурі — ще один приклад, як правильна архітектура знижує TCO.

Що таке race condition у кошику та як його уникнути?

Checkout — місце, де гроші або потрапляють на рахунок, або ні. Технічні проблеми тут коштують дорого.

Race condition при резервуванні товару. Два покупці одночасно додають останній екземпляр у кошик і обоє натискають «Оплатити». Без песимістичного блокування або атомарного UPDATE з перевіркою залишку обидва замовлення проходять, інвентар іде в мінус. В PostgreSQL:

UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
  AND (available - reserved) >= $quantity
RETURNING id;

Якщо RETURNING повернув 0 рядків — товару немає, показуємо помилку до списання грошей.

Ідемпотентність платіжних вебхуків. payment.succeeded від Stripe або ЮКассы може прийти двічі через мережеві збої або retry-логіку на стороні шлюзу. Без перевірки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублювання замовлення або подвійне зарахування. Webhook idempotency — обов'язковий патерн для будь-якого платіжного інтегратора. Ми включаємо тест на ідемпотентність у стандартний чек-лист кожного проекту.

Checkout у кілька кроків. Multi-step checkout (адреса → доставка → оплата → підтвердження) vs single-page checkout. Дослідження показують, що single-page з прогрес-індикатором конвертує на 15–20% краще на мобільних. Стан між кроками — або localStorage + server-side сесія, або повністю server-side з проміжним збереженням. Ми гарантуємо, що кожне замовлення проходить аудит на ідемпотентність та блокування — це входить у стандартний чек-лист тестування.

Чому варто уникати CommerceML для великих каталогів CommerceML через HTTP — класична інтеграція 1С з сайтом. 1С вивантажує XML за розкладом, сайт імпортує. Для невеликих каталогів (до 5 000 SKU) це прийнятно, але при зростанні до 50 000+ SKU виникають проблеми: файл вивантаження 200 МБ кожні 30 хвилин, парсинг блокує чергу, імпорт займає 10–15 хвилин, в цей час на сайті старі ціни. Рішення — інкрементальне вивантаження (тільки зміни) та фонова обробка через Laravel Queue з кількома workers. Для високонавантажених систем ми рекомендуємо REST API або проміжну шину (RabbitMQ).

Як інтегрувати 1С з інтернет-магазином?

1С — окрема глава. Три поширених способи інтеграції:

  1. CommerceML через HTTP — 1С вивантажує XML за розкладом, сайт імпортує. Працює для невеликих каталогів, є затримка синхронізації.
  2. REST API / OData від 1С — двостороння синхронізація в реальному часі. Вимагає налаштування на стороні 1С, примхлива до версій конфігурацій.
  3. Проміжна шина (RabbitMQ / Kafka) — 1С публікує події, сайт підписується. Найнадійніший підхід для високонавантажених систем, але найдорожчий у розробці.

Служби доставки — СДЕК, Boxberry, Пошта Росії, DHL: всі надають REST API для розрахунку вартості та створення накладних. Агрегатори (Shiptor, Shipnow) дозволяють працювати з кількома службами через єдиний API.

Платіжні шлюзи

Шлюз Особливості інтеграції
Stripe Webhook-based, відмінна документація, Stripe Elements для PCI DSS
ЮКасса Популярний в РФ, підтримка ФЗ-54 (фіскалізація)
ЄРИП Білоруська система, SOAP API, специфічна документація
Tinkoff Acquiring REST API, 3D Secure 2.0, webhook-повідомлення

Для кожного шлюзу обов'язкова перевірка підпису вебхука — без цього будь-хто може відправити фейковий payment.succeeded.

CMS vs власна розробка

WooCommerce — виправданий для магазинів до ~5 000 SKU з типовою бізнес-логікою. Швидкий старт, величезна екосистема плагінів. Проблеми починаються при нестандартних цінових правилах, складних варіантах товарів або навантаженні від 10 000+ замовлень на місяць. Економія на ліцензії WooCommerce (безкоштовно) обертається витратами на плагіни та хостинг; для каталогу 50 000 SKU місячна вартість підтримки може перевищити 100 000 ₽.

OpenCart, Prestashop — аналогічна історія. Хороші для старту, обмежені при зростанні.

Власна розробка на Laravel — для:

  • Нестандартної бізнес-логіки (підписки, оренда, b2b-прайси, конфігуратор);
  • Високих вимог до продуктивності;
  • Складних інтеграцій (кілька складів, ERP, маркетплейси);
  • Унікального UX checkout.

Як ми розробляємо інтернет-магазин: покроковий процес

  1. Аналітика та проектування. Збираємо вимоги, уточнюємо бізнес-процеси, моделюємо доменну логіку. На виході — технічне завдання та архітектурна схема.
  2. Backend та API. Реалізуємо ядро (товари, кошик, замовлення), інтеграції з 1С/складами/платіжками. Використовуємо Laravel 11 з Repository pattern, чергами для асинхронних операцій.
  3. Frontend та checkout. Налаштовуємо React 18 / Next.js 14 з оптимізованим рендерингом (SSR/SSG для каталогу), єдиний single-page checkout.
  4. Тестування. Перевіряємо race condition, ідемпотентність вебхуків, навантажувальне тестування (k6), security-аудит.
  5. Деплой та моніторинг. Розгортаємо на Vercel / Docker / виділеному сервері, підключаємо Sentry та Uptime.

SEO для e-commerce

Canonical та дублювання. Фасетна фільтрація генерує тисячі URL (?color=red&size=M&sort=price). Без canonical або noindex на фільтрованих сторінках краулінговий бюджет витрачається на дублі, а основні сторінки індексуються гірше.

Structured data. Product schema з offers, aggregateRating, availability — це rich snippets у видачі: зірочки рейтингу, ціна, наявність. Впливає на CTR.

Core Web Vitals на сторінках товарів. Hero image товару — це LCP element. fetchpriority="high" на першому зображенні, правильні srcset з WebP, width та height атрибути для запобігання CLS.

Що входить у результат роботи

Після завершення проекту ви отримуєте:

  • Вихідний код та повну документацію (API, архітектура, інфраструктура);
  • Доступи до репозиторію, хостингу, моніторингу (Sentry, Uptime);
  • Навчання команди роботі з адмін-панеллю та кастомізаціями;
  • Гарантійну підтримку 3 місяці (виправлення помилок, консультації);
  • Детальний звіт по навантажувальному тестуванню та оптимізації.

Орієнтири за термінами

Тип магазину Термін
Малий (до 1 000 SKU, типова логіка) 8–12 тижнів
Середній (до 50 000 SKU, інтеграція 1С) 14–20 тижнів
Великий (100 000+ SKU, ERP, маркетплейси) 24–40 тижнів

Вартість розраховується після аналізу вимог: кількість інтеграцій, складність ціноутворення, обсяг каталогу та унікальність UX — основні фактори. Оцінимо ваш проект безкоштовно — замовте консультацію.

Чек-лист перед запуском

  • Race condition при оплаті останнього товару — покритий тестом
  • Ідемпотентність вебхуків платіжного шлюзу
  • Rate limiting на ендпоїнтах кошика та checkout
  • Canonical на фільтрованих сторінках каталогу
  • Фіскалізація чеків (ФЗ-54 для РФ або аналог)
  • Стрес-тест checkout під навантаженням (k6 або Locust)
  • Моніторинг помилок (Sentry) та алерти на payment errors
  • Backup бази даних з перевіреним restore-процесом

Гарантуємо — кожен проект проходить цей чек-лист перед релізом. Зв'яжіться з нами — підберемо оптимальну архітектуру під ваш бюджет та терміни.