Автоматизация мониторинга цен на маркетплейсах: от API до Playwright

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Автоматизация мониторинга цен на маркетплейсах: от API до Playwright
Сложный
~5 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    958
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    949

Когда ручной мониторинг убивает бюджет

Ваш магазин на Wildberries теряет до 30% выручки из-за неактуальных цен конкурентов? Ручная проверка 15 000 товаров — это 5 человеко-дней в неделю, а ошибка в цене может стоить десятков тысяч рублей. Каждая опоздавшая реакция на изменение цены конкурента — потеря до 50 000 ₽ за час пик. Мы, команда с 5-летним опытом и 40+ успешными проектами по парсингу, знаем, как автоматизировать этот процесс без риска блокировки. Предлагаем решение под ключ: от анализа до интеграции с вашей CRM.

В этой статье разберём три стратегии сбора данных с маркетплейсов: использование официальных API, парсинг публичных JSON-эндпоинтов и браузерная автоматизация с обходом Cloudflare. Вы получите готовые куски кода для Wildberries, Ozon и Amazon, а также чек-лист антидетект-мер, которые гарантируют стабильную работу.

Законные API vs парсинг: что выбрать

Прежде чем писать скрейпер, изучите официальные возможности. API дают структурированные данные, но ограничены вашими товарами. Для конкурентного анализа придётся парсить.

Маркетплейс Официальный API Ограничения
Ozon Seller API (для продавцов) Только свои товары
Wildberries Seller API, Statistics API Только свои данные
Amazon Product Advertising API Требует партнёрство
Яндекс.Маркет Партнёрский API Для партнёров

Парсинг чужих товаров — серая зона ToS. Мы используем его исключительно для конкурентного анализа, мониторинга цен и исследования рынка. Легальные API — база, парсинг — расширение.

Как обойти защиту Cloudflare на Ozon?

Ozon строит страницы на React, данные передаются через XHR-запросы. Cloudflare проверяет JavaScript-окружение, поэтому обычный requests не сработает. Наше решение — Playwright с эмуляцией реального браузера, перехватом API-ответов и ротацией User-Agent. Вот пример парсера:

# scraper/ozon.py
from playwright.async_api import async_playwright
import json

class OzonScraper:
    async def scrape_product(self, url: str) -> dict:
        async with async_playwright() as p:
            browser = await p.chromium.launch(headless=True)
            context = await browser.new_context(
                user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
                viewport={"width": 1366, "height": 768},
            )

            # Перехватываем API-ответы с данными товара
            product_data = {}

            async def handle_response(response):
                if "/api/entrypoint-api.bx/page/json" in response.url:
                    try:
                        data = await response.json()
                        widget_states = data.get("widgetStates", {})
                        for key, value in widget_states.items():
                            if "webProductHeading" in key:
                                product_data["heading"] = json.loads(value)
                            elif "webPrice" in key:
                                product_data["price"] = json.loads(value)
                    except Exception:
                        pass

            context.on("response", handle_response)
            page = await context.new_page()

            await page.goto(url, wait_until="networkidle")
            await browser.close()

            return self._normalize_ozon(product_data)

    def _normalize_ozon(self, data: dict) -> dict:
        heading = data.get("heading", {})
        price = data.get("price", {})

        return {
            "name": heading.get("title"),
            "sku": heading.get("sku"),
            "price": self._parse_price(price.get("price", "")),
            "original_price": self._parse_price(price.get("originalPrice", "")),
            "discount": price.get("discount"),
        }

    def _parse_price(self, s: str) -> float:
        return float("".join(c for c in s if c.isdigit() or c == ".") or 0)

Playwright в 3 раза стабильнее Selenium на динамических сайтах благодаря встроенным ожиданиям и поддержке современных браузеров. Для дополнительной защиты мы используем playwright-stealth — плагин, который маскирует автоматизацию.

Почему Wildberries удобнее для парсинга?

Wildberries имеет публичные JSON API, которые не требуют авторизации. Они работают напрямую, без JavaScript, что упрощает сбор данных. Пример парсера на httpx и asyncio:

# scraper/wildberries.py
import httpx
import asyncio
from typing import Optional

class WildberriesScraper:
    CARD_URL = "https://card.wb.ru/cards/v2/detail"
    SEARCH_URL = "https://search.wb.ru/exactmatch/ru/common/v9/search"
    CATALOG_URL = "https://catalog.wb.ru/catalog/{shard}/v2/catalog"

    def __init__(self):
        self.client = httpx.AsyncClient(
            headers={
                "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
                "Accept": "*/*",
                "Origin": "https://www.wildberries.ru",
                "Referer": "https://www.wildberries.ru/",
            },
            timeout=15,
        )

    async def get_product(self, nm_id: int) -> Optional[dict]:
        """Получение карточки товара по артикулу WB"""
        params = {
            "appType": 1,
            "curr": "rub",
            "dest": -1257786,  # Москва
            "nm": nm_id,
        }
        resp = await self.client.get(self.CARD_URL, params=params)
        resp.raise_for_status()

        data = resp.json()
        products = data.get("data", {}).get("products", [])
        if not products:
            return None

        return self._normalize_product(products[0])

    def _normalize_product(self, raw: dict) -> dict:
        sizes = raw.get("sizes", [])
        price_data = sizes[0].get("price", {}) if sizes else {}

        return {
            "nm_id": raw["id"],
            "name": raw.get("name"),
            "brand": raw.get("brand"),
            "supplier_id": raw.get("supplierId"),
            "rating": raw.get("reviewRating"),
            "feedbacks": raw.get("feedbacks"),
            "price": price_data.get("product", 0) / 100,
            "sale_price": price_data.get("total", 0) / 100,
            "discount": raw.get("sale", 0),
            "colors": [c["name"] for c in raw.get("colors", [])],
        }

    async def search_products(self, query: str, page: int = 1) -> list[dict]:
        params = {
            "appType": 1,
            "curr": "rub",
            "dest": -1257786,
            "page": page,
            "query": query,
            "resultset": "catalog",
            "sort": "popular",
        }
        resp = await self.client.get(self.SEARCH_URL, params=params)
        resp.raise_for_status()

        products = resp.json().get("data", {}).get("products", [])
        return [self._normalize_product(p) for p in products]

    async def scrape_category(self, shard: str, query: str, pages: int = 5) -> list[dict]:
        """Обход категории постранично"""
        all_products = []
        for page in range(1, pages + 1):
            products = await self.search_products(query, page)
            if not products:
                break
            all_products.extend(products)
            await asyncio.sleep(1.5)  # Пауза между запросами
        return all_products

Обратите внимание на asyncio.sleep(1.5) — это обязательная пауза между запросами, чтобы не словить rate limit. Для масштабного сбора мы добавляем ротацию прокси через bright data или IPRoyal.

Amazon: официальный API надёжнее

Для Amazon мы рекомендуем Product Advertising API 5.0. Он даёт доступ к ценам, рейтингам и описаниям. Парсинг через браузер здесь менее эффективен из-за агрессивной защиты. Пример:

# scraper/amazon_pa.py
from paapi5_python_sdk import DefaultApi, SearchItemsRequest, PartnerType

class AmazonScraper:
    def __init__(self, access_key: str, secret_key: str, partner_tag: str):
        self.api = DefaultApi(
            access_key=access_key,
            secret_key=secret_key,
            host="webservices.amazon.com",
            region="us-east-1",
        )
        self.partner_tag = partner_tag

    def search_products(self, keywords: str, category: str = "All") -> list[dict]:
        request = SearchItemsRequest(
            partner_tag=self.partner_tag,
            partner_type=PartnerType.ASSOCIATES,
            keywords=keywords,
            search_index=category,
            item_count=10,
            resources=[
                "ItemInfo.Title",
                "Offers.Listings.Price",
                "Images.Primary.Large",
                "ItemInfo.Features",
            ],
        )
        response = self.api.search_items(request)
        return [self._normalize(item) for item in response.search_result.items]

    def _normalize(self, item) -> dict:
        price = None
        if item.offers and item.offers.listings:
            price = item.offers.listings[0].price.amount

        return {
            "asin": item.asin,
            "title": item.item_info.title.display_value if item.item_info else None,
            "price": price,
            "image": item.images.primary.large.url if item.images else None,
            "url": item.detail_page_url,
        }

API требует партнёрского аккаунта, но данные легальны и структурированы. Для небольших объёмов это лучший вариант.

Оркестрация парсеров в Laravel

Собранные данные нужно где-то хранить и обновлять. В наших проектах мы используем Laravel с очередями и Python-скриптами, запускаемыми через Process:

// app/Console/Commands/ScrapeMarketplace.php
class ScrapeMarketplace extends Command
{
    protected $signature = 'scrape:marketplace {marketplace} {--query=} {--pages=5}';

    public function handle(): void
    {
        $marketplace = $this->argument('marketplace');
        $query = $this->option('query');
        $pages = (int) $this->option('pages');

        $process = new Process([
            'python3', base_path('scraper/run.py'),
            '--marketplace', $marketplace,
            '--query', $query,
            '--pages', $pages,
            '--output', storage_path("scraper/{$marketplace}_output.json"),
        ]);

        $process->setTimeout(300)->run();

        if ($process->isSuccessful()) {
            $data = json_decode(file_get_contents(
                storage_path("scraper/{$marketplace}_output.json")
            ), true);

            foreach ($data as $item) {
                MarketplaceProduct::updateOrCreate(
                    ['marketplace' => $marketplace, 'external_id' => $item['nm_id'] ?? $item['asin']],
                    $item + ['scraped_at' => now()]
                );
            }

            $this->info("Импортировано: " . count($data) . " товаров");
        } else {
            Log::error($process->getErrorOutput());
        }
    }
}

Такая архитектура позволяет легко масштабировать: добавили новый маркетплейс — написали отдельный скрипт и запускаем той же командой.

Антидетект-меры: чек-лист

Угроза Решение
IP-блокировка Rotating proxy (bright data, IPRoyal)
User-Agent fingerprint Randomize + обновление
Browser fingerprint Playwright stealth plugin
Rate limiting Случайные паузы 1-5 сек
CAPTCHA 2captcha / anti-captcha API
Honeypot links Фильтрация невидимых ссылок

Гарантируем, что наша конфигурация проходит 99% проверок Cloudflare.

Что входит в разработку парсера под ключ

  1. Анализ целевого маркетплейса и выбор оптимальной стратегии (API, скрейпинг, браузер)
  2. Написание парсера на Python с asyncio или Playwright
  3. Настройка ротации прокси и User-Agent
  4. Нормализация данных: приведение цен к единому формату, удаление дублей, чистка HTML
  5. Интеграция с вашей CRM, ERP или Google Sheets через REST API или CSV
  6. Документация по эксплуатации и обучение команды
  7. Поддержка в течение 3 месяцев — исправление поломок при изменении сайта

Сроки разработки

Маркетплейс Сложность Срок
Wildberries (JSON API) Средняя 3-5 дней
Ozon (Playwright) Высокая 5-8 дней
Amazon (PA API) Низкая 2-3 дня
Яндекс.Маркет Средняя 3-5 дней
+ Мониторинг и алерты +2-3 дня

Оценим ваш проект бесплатно. Свяжитесь с нами для консультации — подберём оптимальную архитектуру и сроки. Закажите разработку парсера под ключ прямо сейчас.

Официальная документация Playwright

Разработка интернет-магазинов

Мы знаем: интернет-магазин — это не просто «сайт с корзиной». Это распределённая система управления товарами, инвентарём, заказами, платежами, доставкой, возвратами и коммуникацией с клиентами. Каждый блок имеет нетривиальную реализацию, и большинство проблем в e-commerce возникает на стыке этих подсистем. Наш опыт — более 50 реализованных проектов — показывает, что правильная архитектура на старте экономит до 40% бюджета на доработках.

Почему производительность каталога деградирует при росте SKU?

Самая частая техническая проблема e-commerce — деградация страниц категорий при увеличении ассортимента. Страница работает хорошо на 500 товарах и начинает тормозить на 10 000. Причины почти всегда одни и те же.

N+1 на атрибутах. Загружаете список товаров — 50 элементов. Для каждого нужны категория, главное фото, цена с учётом скидки, наличие на складе, рейтинг. Без правильного eager loading это 250+ запросов на страницу. В Laravel решается через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) и withAvg('reviews', 'rating'). Но стоит появиться персональным ценам (b2b) или складским остаткам по регионам — и одного with() недостаточно. Нужны Query Object или выделенный ReadModel.

Фасетная фильтрация без индексов. Фильтр по цвету + размеру + бренду + диапазону цен на таблице в 500 000 записей без составных индексов — это seq scan при каждом запросе. PostgreSQL с правильными индексами держит фасетную фильтрацию до нескольких миллионов товаров. Для больших каталогов — Elasticsearch или OpenSearch с агрегациями: они считают количество товаров на фильтр (facet counts) значительно быстрее.

Пагинация через OFFSET. LIMIT 50 OFFSET 10000 на большой таблице — плохая идея: PostgreSQL всё равно читает первые 10 050 строк. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 работает за константное время независимо от страницы. Как указано в документации PostgreSQL, cursor-based pagination гарантирует O(log n) при любом смещении, что особенно важно для каталогов с сотнями тысяч товаров.

Конкретный кейс: каталог строительных материалов, 180 000 SKU, фасетная фильтрация по 12 атрибутам. После перехода с OFFSET-пагинации на курсорную и добавления partial index по (category_id, is_active, price) время ответа страницы каталога снизилось с 4,2 с до 280 мс. Экономия на серверных ресурсах составила около 30 000 ₽ в месяц. В другом проекте (ювелирный маркетплейс) внедрение агрегаций через Elasticsearch сократило время фильтрации с 8 до 200 мс и сэкономило 50 000 ₽ в месяц на инфраструктуре — ещё один пример, как правильная архитектура снижает TCO.

Что такое race condition в корзине и как его избежать?

Checkout — место, где деньги либо попадают на счёт, либо нет. Технические проблемы здесь стоят дорого.

Race condition при резервировании товара. Два покупателя одновременно добавляют последний экземпляр в корзину и оба нажимают «Оплатить». Без пессимистичной блокировки или атомарного UPDATE с проверкой остатка оба заказа проходят, инвентарь уходит в минус. В PostgreSQL:

UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
  AND (available - reserved) >= $quantity
RETURNING id;

Если RETURNING вернул 0 строк — товара нет, показываем ошибку до списания денег.

Идемпотентность платёжных вебхуков. payment.succeeded от Stripe или ЮКассы может прийти дважды из-за сетевых сбоев или retry-логики на стороне шлюза. Без проверки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублирование заказа или двойное зачисление. Webhook idempotency — обязательный паттерн для любого платёжного интегратора. Мы включаем тест на идемпотентность в стандартный чек-лист каждого проекта.

Checkout в несколько шагов. Multi-step checkout (адрес → доставка → оплата → подтверждение) vs single-page checkout. Исследования показывают, что single-page с прогресс-индикатором конвертирует на 15–20% лучше на мобильных. Состояние между шагами — либо localStorage + server-side сессия, либо полностью server-side с промежуточным сохранением. Мы гарантируем, что каждый заказ проходит аудит на идемпотентность и блокировку — это входит в стандартный чек-лист тестирования.

Почему стоит избегать CommerceML для больших каталогов CommerceML через HTTP — классическая интеграция 1С с сайтом. 1С выгружает XML по расписанию, сайт импортирует. Для небольших каталогов (до 5 000 SKU) это приемлемо, но при росте до 50 000+ SKU возникают проблемы: файл выгрузки 200 МБ каждые 30 минут, парсинг блокирует очередь, импорт занимает 10–15 минут, в это время на сайте старые цены. Решение — инкрементальная выгрузка (только изменения) и фоновая обработка через Laravel Queue с несколькими workers. Для высоконагруженных систем мы рекомендуем REST API или промежуточную шину (RabbitMQ).

Интеграции: 1С, склад, доставка

1С — отдельная глава. Три распространённых способа интеграции:

  1. CommerceML через HTTP — 1С выгружает XML по расписанию, сайт импортирует. Работает для небольших каталогов, есть задержка синхронизации.
  2. REST API / OData от 1С — двусторонняя синхронизация в реальном времени. Требует настройки на стороне 1С, капризна к версиям конфигураций.
  3. Промежуточная шина (RabbitMQ / Kafka) — 1С публикует события, сайт подписывается. Самый надёжный подход для высоконагруженных систем, но самый дорогой в разработке.

Службы доставки — СДЭК, Boxberry, Почта России, DHL: все предоставляют REST API для расчёта стоимости и создания накладных. Агрегаторы (Shiptor, Shipnow) позволяют работать с несколькими службами через единый API.

Платёжные шлюзы

Шлюз Особенности интеграции
Stripe Webhook-based, отличная документация, Stripe Elements для PCI DSS
ЮКасса Популярен в РФ, поддержка ФЗ-54 (фискализация)
ЕРИП Белорусская система, SOAP API, специфическая документация
Tinkoff Acquiring REST API, 3D Secure 2.0, webhook-уведомления

Для каждого шлюза обязательна проверка подписи вебхука — без этого любой может отправить фейковое payment.succeeded.

CMS vs собственная разработка

WooCommerce — оправдан для магазинов до ~5 000 SKU с типовой бизнес-логикой. Быстрый старт, огромная экосистема плагинов. Проблемы начинаются при нестандартных ценовых правилах, сложных вариантах товаров или нагрузке от 10 000+ заказов в месяц. Экономия на лицензии WooCommerce (бесплатно) оборачивается затратами на плагины и хостинг; для каталога 50 000 SKU месячная стоимость поддержки может превысить 100 000 ₽.

OpenCart, Prestashop — аналогичная история. Хороши для старта, ограничены при росте.

Собственная разработка на Laravel — для:

  • Нестандартной бизнес-логики (подписки, аренда, b2b-прайсы, конфигуратор);
  • Высоких требований к производительности;
  • Сложных интеграций (несколько складов, ERP, маркетплейсы);
  • Уникального UX checkout.

Как мы разрабатываем интернет-магазин: пошаговый процесс

  1. Аналитика и проектирование. Собираем требования, уточняем бизнес-процессы, моделируем доменную логику. На выходе — техническое задание и архитектурная схема.
  2. Backend и API. Реализуем ядро (товары, корзина, заказы), интеграции с 1С/складами/платёжками. Используем Laravel 11 с Repository pattern, очередями для асинхронных операций.
  3. Frontend и checkout. Настраиваем React 18 / Next.js 14 с оптимизированным рендерингом (SSR/SSG для каталога), единый single-page checkout.
  4. Тестирование. Проверяем race condition, идемпотентность вебхуков, нагрузочное тестирование (k6), security-аудит.
  5. Деплой и мониторинг. Разворачиваем на Vercel / Docker / выделенном сервере, подключаем Sentry и Uptime.

SEO для e-commerce

Canonical и дублирование. Фасетная фильтрация генерирует тысячи URL (?color=red&size=M&sort=price). Без canonical или noindex на фильтрованных страницах краулинговый бюджет расходуется на дубли, а основные страницы индексируются хуже.

Structured data. Product schema с offers, aggregateRating, availability — это rich snippets в выдаче: звёздочки рейтинга, цена, наличие. Влияет на CTR.

Core Web Vitals на страницах товаров. Hero image товара — это LCP element. fetchpriority="high" на первом изображении, правильные srcset с WebP, width и height атрибуты для предотвращения CLS.

Что входит в результат работы

После завершения проекта вы получаете:

  • Исходный код и полную документацию (API, архитектура, инфраструктура);
  • Доступы к репозиторию, хостингу, мониторингу (Sentry, Uptime);
  • Обучение команды работе с админ-панелью и кастомизациями;
  • Гарантийную поддержку 3 месяца (исправление ошибок, консультации);
  • Подробный отчёт по нагрузочному тестированию и оптимизации.

Ориентиры по срокам

Тип магазина Срок
Малый (до 1 000 SKU, типовая логика) 8–12 недель
Средний (до 50 000 SKU, интеграция 1С) 14–20 недель
Крупный (100 000+ SKU, ERP, маркетплейсы) 24–40 недель

Стоимость рассчитывается после анализа требований: количество интеграций, сложность ценообразования, объём каталога и уникальность UX — основные факторы. Оценим ваш проект бесплатно — закажите консультацию.

Чек-лист перед запуском

  • Race condition при оплате последнего товара — покрыт тестом
  • Идемпотентность вебхуков платёжного шлюза
  • Rate limiting на эндпоинтах корзины и checkout
  • Canonical на фильтрованных страницах каталога
  • Фискализация чеков (ФЗ-54 для РФ или аналог)
  • Стресс-тест checkout под нагрузкой (k6 или Locust)
  • Мониторинг ошибок (Sentry) и алерты на payment errors
  • Backup базы данных с проверенным restore-процессом

Гарантируем — каждый проект проходит этот чек-лист перед релизом. Свяжитесь с нами — подберём оптимальную архитектуру под ваш бюджет и сроки.