Ви заходите на сайт, вводите «Samsung A55», а він показує ціни з 20 магазинів, сортує за дешевизною та будує графік динаміки. Ми розробляємо такі price-агрегатори — платформи, які автоматично збирають ціни, зіставляють товари та показують користувачеві найкращі пропозиції. Технічно це комплексне завдання: парсинг різнорідних джерел (YML, API, HTML), нормалізація даних, нечітке зіставлення (matching) та безперервне оновлення. Кожен етап сповнений підводних каменів: від rate limiting до різниці в назвах товарів. За більш ніж 5 років роботи ми накопичили досвід у побудові відмовостійких систем збору та матчингу, які обробляють до 1 млн товарів на добу. Помилка на етапі матчингу — і користувач бачить невірні ціни або дублі. Веб-парсинг без контролю — блокування та штрафи. Ми гарантуємо стабільність і точність даних завдяки продуманій архітектурі. Це дозволяє нашим клієнтам економити до 40% бюджету, виключаючи ручні перевірки.
Як організувати збір даних з різних джерел?
Джерела даних
Дані про товари та ціни надходять трьома способами:
- Прайс-листи та фіди — магазин надає YML, XML, CSV файл з актуальним асортиментом. Найнадійніше джерело: структуровані дані, офіційне партнерство, немає ризиків бану. Яндекс.Маркет YML — де-факто стандарт для російськомовного ринку.
- API партнерів — деякі магазини надають REST API. Документація зазвичай слабка, ліміти запитів — жорсткі. Згідно з офіційною документацією Яндекса, для партнерських посилань потрібне попереднє узгодження.
- Веб-парсинг — для магазинів без фідів. Високий ризик: капча, rate limiting, зміна верстки, блокування IP. Вимагає постійної підтримки.
На старті агрегатора краще працювати тільки з фідами та API — це стійкіше. Парсинг підключаємо вибірково для ключових джерел.
Архітектура збірника даних
Scheduler (Celery Beat / Laravel Scheduler)
↓ кожні N годин
FeedFetcher workers (по одному на джерело)
↓
RawData storage (S3 або локальна FS)
↓
Parser workers (XML/CSV/JSON → нормалізовані об'єкти)
↓
Normalizer (приведення одиниць, очищення тексту)
↓
Matcher (зіставлення з товарами в БД)
↓
PriceHistory (запис в timeseries)
↓
ElasticsearchIndexer (оновлення індексу)
Черга завдань: Celery + Redis для Python-стеку, Laravel Horizon + Redis для PHP-стеку. Кожен фід обробляється незалежно, помилка в одному джерелі не блокує інші.
Парсинг Яндекс.Маркет YML
YML — XML з жорсткою схемою. Критичні поля:
<offer id="12345" available="true">
<url>https://shop.example.com/product/12345</url>
<price>4990</price>
<currencyId>RUB</currencyId>
<categoryId>14</categoryId>
<name>Samsung Galaxy A55 128GB</name>
<vendor>Samsung</vendor>
<model>Galaxy A55</model>
<barcode>8806095076783</barcode>
<param name="Цвет">Синий</param>
<param name="Объём памяти">128 ГБ</param>
</offer>
Штрихкод (barcode) — найкращий ключ для matching'у. GTIN/EAN унікальний для кожної варіації товару. Якщо штрихкод є у більшості постачальників — зіставлення стає тривіальним. Згідно з документацією Яндекс.Маркета, barcode — рекомендований елемент для точного зіставлення.
Чому product matching — ключовий етап?
Це найскладніша частина агрегатора. Завдання: визначити, що Samsung Galaxy A55 128GB Синій від магазину A і Смартфон Samsung Galaxy A55 (SM-A556B) 128 Гб синій від магазину B — один і той самий товар.
Детерміновані методи
- GTIN/EAN матчинг: якщо в обох товарів є штрихкод — однозначний збіг.
- Артикул виробника (MPN): SM-A556B унікальний в рамках бренду.
- URL-канонікалізація: деякі магазини включають GTIN в URL.
Нечіткий матчинг (fuzzy)
from rapidfuzz import fuzz
def match_score(title_a: str, title_b: str, brand_a: str, brand_b: str) -> float:
if brand_a.lower() != brand_b.lower():
return 0.0
title_similarity = fuzz.token_sort_ratio(title_a, title_b)
return title_similarity / 100
Поріг збігу: 0.85+ вважаємо автоматичним матчем, 0.65–0.85 — відправляємо на ручну перевірку, нижче — новий товар.
ML-підхід
Ембедінги назв товарів (sentence-transformers, ruBERT) + cosine similarity. Значно точніше fuzzy, особливо для різних формулювань одного товару. Модель навчається на історично підтверджених матчах.
Структура зберігання:
canonical_products (id, gtin, mpn, brand, name, category_id, attrs JSONB)
source_offers (id, source_id, external_id, canonical_product_id, price, url, in_stock, updated_at)
match_candidates (offer_id, canonical_id, score, status) -- pending | approved | rejected
Порівняння методів матчингу:
| Метод |
Точність |
Швидкість |
Складність впровадження |
| Детермінований (GTIN) |
100% |
Висока |
Низька |
| Нечіткий (fuzzy) |
80–90% |
Середня |
Середня |
| ML (ембедінги) |
95%+ |
Низька (потрібен GPU) |
Висока |
Як оновлюються ціни та зберігається історія?
Історія цін
Основна цінність агрегатора — не тільки поточна ціна, а й історія змін. Кожна зміна ціни записується, не перезаписується.
price_history (
id BIGSERIAL,
source_offer_id BIGINT,
price NUMERIC(12,2),
in_stock BOOLEAN,
recorded_at TIMESTAMPTZ DEFAULT NOW()
)
Для зберігання timeseries використовуємо TimescaleDB — розширення PostgreSQL, що партиціює таблицю за часом. Альтернатива — InfluxDB або ClickHouse для високих навантажень (до 10 000 вставок на секунду).
Графік історії цін — стандартний компонент сторінки товару. Використовуємо Chart.js або Recharts, дані агрегуємо по днях: SELECT date_trunc('day', recorded_at), min(price) FROM price_history WHERE ....
Частота оновлення
| Тип джерела |
Інтервал оновлення |
| YML-фід великого магазину |
Кожні 2–4 години |
| API з лімітами |
По ліміту, зазвичай 1–6 разів на добу |
| Парсинг сторінки |
1–2 рази на добу |
| Real-time API (рідко) |
По webhook при зміні |
При зміні ціни — інвалідація кешу сторінки товару та перерахунок мінімальної ціни в індексі.
Як налаштувати збір даних за 4 кроки
- Підключення джерел: отримайте YML-фіди від магазинів або налаштуйте API-доступ. Одне джерело — один конфіг.
- Налаштування парсингу: для фідів — готовий парсер YML/XML; для API — напишіть адаптер під документацію.
- Запуск матчингу: визначте набір правил — GTIN пріоритет, потім fuzzy, потім ML. Почніть з ручної валідації.
- Моніторинг та оновлення: налаштуйте шедулер Celery або Horizon, додайте алерти на падіння джерела.
Що входить у розробку агрегатора
У результаті ви отримуєте:
- Документацію з інтеграції джерел (опис форматів, приклади).
- Розгорнуту інфраструктуру (Docker, CI/CD, моніторинг).
- Панель управління для редагування матчингу та перегляду статистики.
- Навчання команди замовника роботі з системою.
- Технічну підтримку на 3 місяці після запуску.
- Гарантію на коректність матчингу та своєчасність оновлення цін.
Хочете обговорити ваш проєкт? Зв'яжіться з нами для безкоштовної оцінки. Отримайте консультацію інженера без зобов'язань.
Наш досвід
Більше 5 років на ринку, 40+ реалізованих проєктів. Ми не просто пишемо код — ми проєктуємо архітектуру, яка не падає під навантаженням і легко масштабується. Оцінимо ваш проєкт безкоштовно. Зв'яжіться — запропонуємо архітектуру, терміни та вартість під ключ.
Розробка інтернет-магазинів
Ми знаємо: інтернет-магазин — це не просто «сайт з кошиком». Це розподілена система управління товарами, інвентарем, замовленнями, платежами, доставкою, поверненнями та комунікацією з клієнтами. Кожен блок має нетривіальну реалізацію, і більшість проблем в e-commerce виникає на стику цих підсистем. Наш досвід — понад 50 реалізованих проектів — показує, що правильна архітектура на старті економить до 40% бюджету на доробках.
Чому продуктивність каталогу деградує при зростанні SKU?
Найчастіша технічна проблема e-commerce — деградація сторінок категорій при збільшенні асортименту. Сторінка працює добре на 500 товарах і починає гальмувати на 10 000. Причини майже завжди одні й ті ж.
N+1 на атрибутах. Завантажуєте список товарів — 50 елементів. Для кожного потрібні категорія, головне фото, ціна з урахуванням знижки, наявність на складі, рейтинг. Без правильного eager loading це 250+ запитів на сторінку. В Laravel вирішується через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) та withAvg('reviews', 'rating'). Але варто з'явитися персональним цінам (b2b) або складським залишкам по регіонах — і одного with() недостатньо. Потрібні Query Object або виділений ReadModel.
Фасетна фільтрація без індексів. Фільтр за кольором + розміром + брендом + діапазоном цін на таблиці в 500 000 записів без складених індексів — це seq scan при кожному запиті. PostgreSQL з правильними індексами тримає фасетну фільтрацію до кількох мільйонів товарів. Для великих каталогів — Elasticsearch або OpenSearch з агрегаціями: вони рахують кількість товарів на фільтр (facet counts) значно швидше.
Пагінація через OFFSET. LIMIT 50 OFFSET 10000 на великій таблиці — погана ідея: PostgreSQL все одно читає перші 10 050 рядків. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 працює за постійний час незалежно від сторінки. Як зазначено в документації PostgreSQL, cursor-based pagination гарантує O(log n) при будь-якому зміщенні, що особливо важливо для каталогів із сотнями тисяч товарів.
Конкретний кейс: каталог будівельних матеріалів, 180 000 SKU, фасетна фільтрація по 12 атрибутах. Після переходу з OFFSET-пагінації на курсорну та додавання partial index по (category_id, is_active, price) час відповіді сторінки каталогу знизився з 4,2 с до 280 мс. Економія на серверних ресурсах склала близько 30 000 ₽ на місяць. В іншому проекті (ювелірний маркетплейс) впровадження агрегацій через Elasticsearch скоротило час фільтрації з 8 до 200 мс та заощадило 50 000 ₽ на місяць на інфраструктурі — ще один приклад, як правильна архітектура знижує TCO.
Що таке race condition у кошику та як його уникнути?
Checkout — місце, де гроші або потрапляють на рахунок, або ні. Технічні проблеми тут коштують дорого.
Race condition при резервуванні товару. Два покупці одночасно додають останній екземпляр у кошик і обоє натискають «Оплатити». Без песимістичного блокування або атомарного UPDATE з перевіркою залишку обидва замовлення проходять, інвентар іде в мінус. В PostgreSQL:
UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
AND (available - reserved) >= $quantity
RETURNING id;
Якщо RETURNING повернув 0 рядків — товару немає, показуємо помилку до списання грошей.
Ідемпотентність платіжних вебхуків. payment.succeeded від Stripe або ЮКассы може прийти двічі через мережеві збої або retry-логіку на стороні шлюзу. Без перевірки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублювання замовлення або подвійне зарахування. Webhook idempotency — обов'язковий патерн для будь-якого платіжного інтегратора. Ми включаємо тест на ідемпотентність у стандартний чек-лист кожного проекту.
Checkout у кілька кроків. Multi-step checkout (адреса → доставка → оплата → підтвердження) vs single-page checkout. Дослідження показують, що single-page з прогрес-індикатором конвертує на 15–20% краще на мобільних. Стан між кроками — або localStorage + server-side сесія, або повністю server-side з проміжним збереженням. Ми гарантуємо, що кожне замовлення проходить аудит на ідемпотентність та блокування — це входить у стандартний чек-лист тестування.
Чому варто уникати CommerceML для великих каталогів
CommerceML через HTTP — класична інтеграція 1С з сайтом. 1С вивантажує XML за розкладом, сайт імпортує. Для невеликих каталогів (до 5 000 SKU) це прийнятно, але при зростанні до 50 000+ SKU виникають проблеми: файл вивантаження 200 МБ кожні 30 хвилин, парсинг блокує чергу, імпорт займає 10–15 хвилин, в цей час на сайті старі ціни. Рішення — інкрементальне вивантаження (тільки зміни) та фонова обробка через Laravel Queue з кількома workers. Для високонавантажених систем ми рекомендуємо REST API або проміжну шину (RabbitMQ).
Як інтегрувати 1С з інтернет-магазином?
1С — окрема глава. Три поширених способи інтеграції:
-
CommerceML через HTTP — 1С вивантажує XML за розкладом, сайт імпортує. Працює для невеликих каталогів, є затримка синхронізації.
-
REST API / OData від 1С — двостороння синхронізація в реальному часі. Вимагає налаштування на стороні 1С, примхлива до версій конфігурацій.
-
Проміжна шина (RabbitMQ / Kafka) — 1С публікує події, сайт підписується. Найнадійніший підхід для високонавантажених систем, але найдорожчий у розробці.
Служби доставки — СДЕК, Boxberry, Пошта Росії, DHL: всі надають REST API для розрахунку вартості та створення накладних. Агрегатори (Shiptor, Shipnow) дозволяють працювати з кількома службами через єдиний API.
Платіжні шлюзи
| Шлюз |
Особливості інтеграції |
| Stripe |
Webhook-based, відмінна документація, Stripe Elements для PCI DSS |
| ЮКасса |
Популярний в РФ, підтримка ФЗ-54 (фіскалізація) |
| ЄРИП |
Білоруська система, SOAP API, специфічна документація |
| Tinkoff Acquiring |
REST API, 3D Secure 2.0, webhook-повідомлення |
Для кожного шлюзу обов'язкова перевірка підпису вебхука — без цього будь-хто може відправити фейковий payment.succeeded.
CMS vs власна розробка
WooCommerce — виправданий для магазинів до ~5 000 SKU з типовою бізнес-логікою. Швидкий старт, величезна екосистема плагінів. Проблеми починаються при нестандартних цінових правилах, складних варіантах товарів або навантаженні від 10 000+ замовлень на місяць. Економія на ліцензії WooCommerce (безкоштовно) обертається витратами на плагіни та хостинг; для каталогу 50 000 SKU місячна вартість підтримки може перевищити 100 000 ₽.
OpenCart, Prestashop — аналогічна історія. Хороші для старту, обмежені при зростанні.
Власна розробка на Laravel — для:
- Нестандартної бізнес-логіки (підписки, оренда, b2b-прайси, конфігуратор);
- Високих вимог до продуктивності;
- Складних інтеграцій (кілька складів, ERP, маркетплейси);
- Унікального UX checkout.
Як ми розробляємо інтернет-магазин: покроковий процес
-
Аналітика та проектування. Збираємо вимоги, уточнюємо бізнес-процеси, моделюємо доменну логіку. На виході — технічне завдання та архітектурна схема.
-
Backend та API. Реалізуємо ядро (товари, кошик, замовлення), інтеграції з 1С/складами/платіжками. Використовуємо Laravel 11 з Repository pattern, чергами для асинхронних операцій.
-
Frontend та checkout. Налаштовуємо React 18 / Next.js 14 з оптимізованим рендерингом (SSR/SSG для каталогу), єдиний single-page checkout.
-
Тестування. Перевіряємо race condition, ідемпотентність вебхуків, навантажувальне тестування (k6), security-аудит.
-
Деплой та моніторинг. Розгортаємо на Vercel / Docker / виділеному сервері, підключаємо Sentry та Uptime.
SEO для e-commerce
Canonical та дублювання. Фасетна фільтрація генерує тисячі URL (?color=red&size=M&sort=price). Без canonical або noindex на фільтрованих сторінках краулінговий бюджет витрачається на дублі, а основні сторінки індексуються гірше.
Structured data. Product schema з offers, aggregateRating, availability — це rich snippets у видачі: зірочки рейтингу, ціна, наявність. Впливає на CTR.
Core Web Vitals на сторінках товарів. Hero image товару — це LCP element. fetchpriority="high" на першому зображенні, правильні srcset з WebP, width та height атрибути для запобігання CLS.
Що входить у результат роботи
Після завершення проекту ви отримуєте:
- Вихідний код та повну документацію (API, архітектура, інфраструктура);
- Доступи до репозиторію, хостингу, моніторингу (Sentry, Uptime);
- Навчання команди роботі з адмін-панеллю та кастомізаціями;
- Гарантійну підтримку 3 місяці (виправлення помилок, консультації);
- Детальний звіт по навантажувальному тестуванню та оптимізації.
Орієнтири за термінами
| Тип магазину |
Термін |
| Малий (до 1 000 SKU, типова логіка) |
8–12 тижнів |
| Середній (до 50 000 SKU, інтеграція 1С) |
14–20 тижнів |
| Великий (100 000+ SKU, ERP, маркетплейси) |
24–40 тижнів |
Вартість розраховується після аналізу вимог: кількість інтеграцій, складність ціноутворення, обсяг каталогу та унікальність UX — основні фактори. Оцінимо ваш проект безкоштовно — замовте консультацію.
Чек-лист перед запуском
- Race condition при оплаті останнього товару — покритий тестом
- Ідемпотентність вебхуків платіжного шлюзу
- Rate limiting на ендпоїнтах кошика та checkout
- Canonical на фільтрованих сторінках каталогу
- Фіскалізація чеків (ФЗ-54 для РФ або аналог)
- Стрес-тест checkout під навантаженням (k6 або Locust)
- Моніторинг помилок (Sentry) та алерти на payment errors
- Backup бази даних з перевіреним restore-процесом
Гарантуємо — кожен проект проходить цей чек-лист перед релізом. Зв'яжіться з нами — підберемо оптимальну архітектуру під ваш бюджет та терміни.