Автоматизація моніторингу цін на маркетплейсах: API та Playwright

Коли ручний моніторинг вбиває бюджет

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Автоматизація моніторингу цін на маркетплейсах: API та Playwright
Складний
~5 днів

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    984
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    999

Коли ручний моніторинг вбиває бюджет

Ваш магазин на Wildberries втрачає до 30% виручки через неактуальні ціни конкурентів? Ручна перевірка 15 000 товарів — це 5 людино-днів на тиждень, а помилка в ціні може коштувати десятків тисяч гривень. Кожна запізніла реакція на зміну ціни конкурента — втрата до 50 000 ₴ за годину пік. Ми, команда з 5-річним досвідом та 40+ успішними проектами з парсингу, знаємо, як автоматизувати цей процес без ризику блокування. Пропонуємо рішення під ключ: від аналізу до інтеграції з вашою CRM.

У цій статті розберемо три стратегії збору даних з маркетплейсів: використання офіційних API, парсинг публічних JSON-ендпоінтів та браузерна автоматизація з обходом Cloudflare. Ви отримаєте готові шматки коду для Wildberries, Ozon та Amazon, а також чек-лист антидетект-заходів, які гарантують стабільну роботу.

Законні API vs парсинг: що обрати

Перш ніж писати скрейпер, вивчіть офіційні можливості. API дають структуровані дані, але обмежені вашими товарами. Для конкурентного аналізу доведеться парсити.

Маркетплейс Офіційний API Обмеження
Ozon Seller API (для продавців) Тільки свої товари
Wildberries Seller API, Statistics API Тільки свої дані
Amazon Product Advertising API Вимагає партнерство
Яндекс.Маркет Партнерський API Для партнерів

Парсинг чужих товарів — сіра зона ToS. Ми використовуємо його виключно для конкурентного аналізу, моніторингу цін та дослідження ринку. Легальні API — база, парсинг — розширення.

Як обійти захист Cloudflare на Ozon?

Ozon будує сторінки на React, дані передаються через XHR-запити. Cloudflare перевіряє JavaScript-оточення, тому звичайний requests не спрацює. Наше рішення — Playwright з емуляцією реального браузера, перехопленням API-відповідей та ротацією User-Agent. Ось приклад парсера:

# scraper/ozon.py from playwright.async_api import async_playwright import json class OzonScraper: async def scrape_product(self, url: str) -> dict: async with async_playwright() as p: browser = await p.chromium.launch(headless=True) context = await browser.new_context( user_agent="Mozilla/5.0 (Windows NT 10.0; Win64; x64)", viewport={"width": 1366, "height": 768}, ) # Перехоплюємо API-відповіді з даними товару product_data = {} async def handle_response(response): if "/api/entrypoint-api.bx/page/json" in response.url: try: data = await response.json() widget_states = data.get("widgetStates", {}) for key, value in widget_states.items(): if "webProductHeading" in key: product_data["heading"] = json.loads(value) elif "webPrice" in key: product_data["price"] = json.loads(value) except Exception: pass context.on("response", handle_response) page = await context.new_page() await page.goto(url, wait_until="networkidle") await browser.close() return self._normalize_ozon(product_data) def _normalize_ozon(self, data: dict) -> dict: heading = data.get("heading", {}) price = data.get("price", {}) return { "name": heading.get("title"), "sku": heading.get("sku"), "price": self._parse_price(price.get("price", "")), "original_price": self._parse_price(price.get("originalPrice", "")), "discount": price.get("discount"), } def _parse_price(self, s: str) -> float: return float("".join(c for c in s if c.isdigit() or c == ".") or 0) 

Playwright у 3 рази стабільніший за Selenium на динамічних сайтах завдяки вбудованим очікуванням та підтримці сучасних браузерів. Для додаткового захисту ми використовуємо playwright-stealth — плагін, який маскує автоматизацію.

Чому Wildberries зручніший для парсингу?

Wildberries має публічні JSON API, які не вимагають авторизації. Вони працюють напряму, без JavaScript, що спрощує збір даних. Приклад парсера на httpx та asyncio:

# scraper/wildberries.py import httpx import asyncio from typing import Optional class WildberriesScraper: CARD_URL = "https://card.wb.ru/cards/v2/detail" SEARCH_URL = "https://search.wb.ru/exactmatch/ru/common/v9/search" CATALOG_URL = "https://catalog.wb.ru/catalog/{shard}/v2/catalog" def __init__(self): self.client = httpx.AsyncClient( headers={ "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)", "Accept": "*/*", "Origin": "https://www.wildberries.ru", "Referer": "https://www.wildberries.ru/", }, timeout=15, ) async def get_product(self, nm_id: int) -> Optional[dict]: """Отримання картки товару за артикулом WB""" params = { "appType": 1, "curr": "rub", "dest": -1257786, # Москва "nm": nm_id, } resp = await self.client.get(self.CARD_URL, params=params) resp.raise_for_status() data = resp.json() products = data.get("data", {}).get("products", []) if not products: return None return self._normalize_product(products[0]) def _normalize_product(self, raw: dict) -> dict: sizes = raw.get("sizes", []) price_data = sizes[0].get("price", {}) if sizes else {} return { "nm_id": raw["id"], "name": raw.get("name"), "brand": raw.get("brand"), "supplier_id": raw.get("supplierId"), "rating": raw.get("reviewRating"), "feedbacks": raw.get("feedbacks"), "price": price_data.get("product", 0) / 100, "sale_price": price_data.get("total", 0) / 100, "discount": raw.get("sale", 0), "colors": [c["name"] for c in raw.get("colors", [])], } async def search_products(self, query: str, page: int = 1) -> list[dict]: params = { "appType": 1, "curr": "rub", "dest": -1257786, "page": page, "query": query, "resultset": "catalog", "sort": "popular", } resp = await self.client.get(self.SEARCH_URL, params=params) resp.raise_for_status() products = resp.json().get("data", {}).get("products", []) return [self._normalize_product(p) for p in products] async def scrape_category(self, shard: str, query: str, pages: int = 5) -> list[dict]: """Обхід категорії посторінково""" all_products = [] for page in range(1, pages + 1): products = await self.search_products(query, page) if not products: break all_products.extend(products) await asyncio.sleep(1.5) # Пауза між запитами return all_products 

Зверніть увагу на asyncio.sleep(1.5) — це обов'язкова пауза між запитами, щоб не зловити rate limit. Для масштабного збору ми додаємо ротацію проксі через Bright Data або IPRoyal.

Amazon: офіційний API надійніший

Для Amazon ми рекомендуємо Product Advertising API 5.0. Він дає доступ до цін, рейтингів та описів. Парсинг через браузер тут менш ефективний через агресивний захист. Приклад:

# scraper/amazon_pa.py from paapi5_python_sdk import DefaultApi, SearchItemsRequest, PartnerType class AmazonScraper: def __init__(self, access_key: str, secret_key: str, partner_tag: str): self.api = DefaultApi( access_key=access_key, secret_key=secret_key, host="webservices.amazon.com", region="us-east-1", ) self.partner_tag = partner_tag def search_products(self, keywords: str, category: str = "All") -> list[dict]: request = SearchItemsRequest( partner_tag=self.partner_tag, partner_type=PartnerType.ASSOCIATES, keywords=keywords, search_index=category, item_count=10, resources=[ "ItemInfo.Title", "Offers.Listings.Price", "Images.Primary.Large", "ItemInfo.Features", ], ) response = self.api.search_items(request) return [self._normalize(item) for item in response.search_result.items] def _normalize(self, item) -> dict: price = None if item.offers and item.offers.listings: price = item.offers.listings[0].price.amount return { "asin": item.asin, "title": item.item_info.title.display_value if item.item_info else None, "price": price, "image": item.images.primary.large.url if item.images else None, "url": item.detail_page_url, } 

API вимагає партнерського акаунта, але дані легальні та структуровані. Для невеликих обсягів це найкращий варіант.

Оркестрація парсерів у Laravel

Зібрані дані потрібно десь зберігати та оновлювати. У наших проектах ми використовуємо Laravel з чергами та Python-скриптами, запущеними через Process:

// app/Console/Commands/ScrapeMarketplace.php class ScrapeMarketplace extends Command { protected $signature = 'scrape:marketplace {marketplace} {--query=} {--pages=5}'; public function handle(): void { $marketplace = $this->argument('marketplace'); $query = $this->option('query'); $pages = (int) $this->option('pages'); $process = new Process([ 'python3', base_path('scraper/run.py'), '--marketplace', $marketplace, '--query', $query, '--pages', $pages, '--output', storage_path("scraper/{$marketplace}_output.json"), ]); $process->setTimeout(300)->run(); if ($process->isSuccessful()) { $data = json_decode(file_get_contents( storage_path("scraper/{$marketplace}_output.json") ), true); foreach ($data as $item) { MarketplaceProduct::updateOrCreate( ['marketplace' => $marketplace, 'external_id' => $item['nm_id'] ?? $item['asin']], $item + ['scraped_at' => now()] ); } $this->info("Імпортовано: " . count($data) . " товарів"); } else { Log::error($process->getErrorOutput()); } } } 

Така архітектура дозволяє легко масштабувати: додали новий маркетплейс — написали окремий скрипт і запускаємо тією ж командою.

Антидетект-заходи: чек-лист

Загроза Рішення
IP-блокування Rotating proxy (Bright Data, IPRoyal)
User-Agent fingerprint Randomize + оновлення
Browser fingerprint Playwright stealth plugin
Rate limiting Випадкові паузи 1-5 сек
CAPTCHA 2captcha / anti-captcha API
Honeypot links Фільтрація невидимих посилань

Гарантуємо, що наша конфігурація проходить 99% перевірок Cloudflare.

Що входить у розробку парсера під ключ

  1. Аналіз цільового маркетплейсу та вибір оптимальної стратегії (API, скрейпінг, браузер)
  2. Написання парсера на Python з asyncio або Playwright
  3. Налаштування ротації проксі та User-Agent
  4. Нормалізація даних: приведення цін до єдиного формату, видалення дублів, чистка HTML
  5. Інтеграція з вашою CRM, ERP або Google Sheets через REST API або CSV
  6. Документація з експлуатації та навчання команди
  7. Підтримка протягом 3 місяців — виправлення поломок при зміні сайту

Строки розробки

Маркетплейс Складність Строк
Wildberries (JSON API) Середня 3-5 днів
Ozon (Playwright) Висока 5-8 днів
Amazon (PA API) Низька 2-3 дні
Яндекс.Маркет Середня 3-5 днів
+ Моніторинг та оповіщення +2-3 дні

Оцінимо ваш проект безкоштовно. Зв'яжіться з нами для консультації — підберемо оптимальну архітектуру та строки. Замовте розробку парсера під ключ прямо зараз.

Офіційна документація Playwright