Збір та імпорт відгуків з маркетплейсів: розробка парсера
Ми розробляємо високопродуктивні парсери для автоматичного збору відгуків з маркетплейсів. Клієнт втратив 30% конверсії через застарілі відгуки — ручний збір займав години, дані не оновлювалися тижнями. Наша команда (5+ років досвіду, сертифіковані розробники, гарантія якості) створила рішення, яке збирає відгуки з Wildberries, Ozon, Яндекс.Маркету та інших майданчиків, нормалізує їх та імпортує в базу магазину. Економія часу — до 70%, або до $2000 на місяць на зарплаті менеджера. Окупність проєкту — 2–3 місяці. Замовте розробку парсера для вашого інтернет-магазину.
Типова ситуація: менеджер вручну копіює відгуки з 5 маркетплейсів по 200 товарів — це 8 годин на день. Автоматизація краще ручного збору в 60 разів за швидкістю: наш парсер виконує ту ж роботу за 8 хвилин. Дані оновлюються кожні 2 години, сторінки товарів — у реальному часі. Результат: зростання конверсії на 15% за перший місяць.
Технічно, кожен маркетплейс — свій головний біль. Wildberries дає JSON API з асинхронними httpx-запитами, але з обмеженням 1000 відгуків за сесію. Ozon — SPA на Nuxt, де дані підвантажуються через GraphQL, доводиться емулювати браузер через Playwright з ротацією User-Agent. Яндекс.Маркет змінює структуру раз на пів року, тому ми використовуємо адаптивний парсинг з fallback-стратегією та пулом резидентних проксі. Наш стек — Python для high-load майданчиків, PHP (Laravel) для інтеграції з вашим сайтом через черги (Queues) та Docker-контейнеризацію.
Підтримувані маркетплейси та методи
| Площадка | Метод | Особливості |
|---|---|---|
| Wildberries | JSON API | Відкритий API, пагінація, до 1000 відгуків за сесію |
| Ozon | Playwright | SPA, потрібна авторизація, повільніше JSON в 50 разів |
| Яндекс.Маркет | Unofficial API | Rate limiting, потрібна ротація проксі |
| Google Reviews | Places API | Платний, офіційний, до 5 відгуків за запит (потрібна бізнес-підписка) |
| Otzovik.com | HTML парсинг | Капча на масових запитах, використовуємо Anti-Captcha |
| iHerb | HTML / JSON API | Структурований HTML, найпростіше |
Порівняння методів: JSON-API (Wildberries) обробляє 1000 відгуків за 10 секунд, а Selenium на Ozon — ті ж 1000 за 5 хвилин. Різниця в 30 разів. Для продуктивності обираємо JSON, де можливо.
Як працює парсер Wildberries?
Приклад коду з асинхронними запитами (Python httpx)
# scraper/reviews/wildberries.py import httpx import asyncio from dataclasses import dataclass from typing import Optional @dataclass class Review: external_id: str product_nm_id: int author: str rating: int text: str pros: Optional[str] cons: Optional[str] date: str photos: list[str] helpful_count: int class WildberriesReviewScraper: REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}" def __init__(self): self.client = httpx.AsyncClient( headers={ "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)", "Origin": "https://www.wildberries.ru", "Referer": "https://www.wildberries.ru/", } ) async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]: all_reviews = [] skip = 0 while True: url = self.REVIEWS_URL.format(nm_id=nm_id) params = { "immt": nm_id, "skip": skip, "take": take, "order": "dateDesc", } resp = await self.client.get(url, params=params) resp.raise_for_status() data = resp.json() feedbacks = data.get("feedbacks", []) if not feedbacks: break for fb in feedbacks: all_reviews.append(self._normalize(nm_id, fb)) skip += take await asyncio.sleep(1.0) # Ограничение: не более 1000 отзывов за сессию if skip >= 1000: break return all_reviews def _normalize(self, nm_id: int, raw: dict) -> Review: photos = [] for photo in raw.get("photos", []): if full_url := photo.get("fullSize"): photos.append(full_url) return Review( external_id=raw.get("id", ""), product_nm_id=nm_id, author=raw.get("wbUserDetails", {}).get("name", "Покупатель"), rating=raw.get("productValuation", 0), text=raw.get("text", ""), pros=raw.get("pros"), cons=raw.get("cons"), date=raw.get("createdDate", ""), photos=photos, helpful_count=raw.get("feedbackValuation", 0), ) Парсинг HTML-відгуків
Для сайтів без API використовуємо парсинг HTML через PHP і Symfony Crawler. Приклад для iHerb:
// app/Services/ReviewScraper/HtmlReviewScraper.php class HtmlReviewScraper { public function scrapeIherb(string $productUrl, int $pages = 5): array { $reviews = []; for ($page = 1; $page <= $pages; $page++) { $html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6"); $crawler = new Crawler($html); $items = $crawler->filter('[itemprop="review"]'); if (!$items->count()) break; $items->each(function (Crawler $node) use (&$reviews) { $reviews[] = [ 'external_id' => $node->attr('data-review-id'), 'author' => trim($node->filter('[itemprop="author"]')->text('')), 'rating' => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'), 'date' => $node->filter('[itemprop="datePublished"]')->attr('content'), 'title' => trim($node->filter('[itemprop="name"]')->text('')), 'text' => trim($node->filter('[itemprop="reviewBody"]')->text('')), 'helpful' => (int) $node->filter('.helpful-yes')->text('0'), 'verified' => $node->filter('.verified-buyer')->count() > 0, ]; }); sleep(rand(2, 4)); } return $reviews; } } Дедуплікація та імпорт в Laravel
Після збору відгуки проходять через Job з дедуплікацією за external_id і source. Приклад:
// app/Jobs/ImportProductReviews.php class ImportProductReviews implements ShouldQueue { public int $tries = 3; public int $backoff = 120; public function handle(ReviewImportService $service): void { $mapping = ProductReviewMapping::where('product_id', $this->productId) ->where('source', $this->source) ->firstOrFail(); $reviews = $this->scrape($mapping->external_id); $imported = 0; $skipped = 0; foreach ($reviews as $reviewData) { $exists = ProductReview::where([ 'source' => $this->source, 'external_id' => $reviewData['external_id'], ])->exists(); if ($exists) { $skipped++; continue; } $service->import($this->productId, $this->source, $reviewData); $imported++; } Log::info("Reviews imported", [ 'product_id' => $this->productId, 'source' => $this->source, 'imported' => $imported, 'skipped' => $skipped, ]); } } Фільтрація та модерація
Стоп-слова (спам, реклама, ненормативна лексика), занадто короткі відгуки (<20 символів) та анонімізація авторів — все налаштовується. Нижче приклад сервісу:
// app/Services/ReviewImportService.php class ReviewImportService { private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me']; public function import(int $productId, string $source, array $data): ?ProductReview { if (mb_strlen($data['text']) < 20) return null; foreach ($this->stopWords as $word) { if (mb_stripos($data['text'], $word) !== false) return null; } return ProductReview::create([ 'product_id' => $productId, 'source' => $source, 'external_id' => $data['external_id'], 'author' => $this->anonymizeAuthor($data['author']), 'rating' => max(1, min(5, (int) $data['rating'])), 'text' => $this->sanitize($data['text']), 'pros' => $this->sanitize($data['pros'] ?? ''), 'cons' => $this->sanitize($data['cons'] ?? ''), 'date' => $data['date'], 'is_verified' => $data['verified'] ?? false, 'helpful' => $data['helpful'] ?? 0, 'status' => 'pending', ]); } private function anonymizeAuthor(string $name): string { $parts = explode(' ', trim($name)); if (count($parts) >= 2) { return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.'; } return $name ?: 'Покупатель'; } private function sanitize(string $text): string { return strip_tags(trim($text)); } } Structured data для SEO
Після імпорту відгуки публікуються в JSON-LD на сторінці товару. Це підвищує шанс потрапити в rich snippets і збільшує CTR на 20-30%. Детальніше про structured data на Wikipedia.
// app/Http/Controllers/ProductController.php public function show(string $slug): Response { $product = Product::withReviews()->findBySlug($slug); $reviewSchema = $product->reviews->map(fn($r) => [ '@type' => 'Review', 'author' => ['@type' => 'Person', 'name' => $r->author], 'datePublished' => $r->date, 'reviewBody' => $r->text, 'reviewRating' => [ '@type' => 'Rating', 'ratingValue' => $r->rating, 'bestRating' => 5, ], ]); $aggregateRating = [ '@type' => 'AggregateRating', 'ratingValue' => round($product->reviews->avg('rating'), 1), 'reviewCount' => $product->reviews->count(), ]; } Як уникнути блокувань при парсингу?
Для обходу блокувань використовуємо пул з 50+ резидентних проксі, випадкові затримки від 1 до 4 секунд, ротацію User-Agent (Chrome, Firefox, Safari). Капчу розв'язуємо через Anti-Captcha. Кожна сесія обмежена 1000 відгуків.
Чому автоматизація відгуків підвищує SEO?
- Structured data (JSON-LD) допомагає пошуковикам показувати рейтинг у снипеті.
- UGC-тексти містять довгі хвости ключових слів.
- Регулярне оновлення сигналізує про живий магазин.
Порівняння: ручний збір 100 відгуків займає 2 години, наш парсер — 2 хвилини, в 60 разів швидше. Економія бюджету на копірайтерів і модераторів — до 70% (до $2000 на місяць).
Процес роботи
- Аналіз: визначаємо майданчики, API, складність.
- Розробка: пишемо парсер, модерацію, дедуплікацію.
- Тестування: прогін на 1000+ відгуків, перевірка багів.
- Деплой: налаштування cron, моніторинг помилок.
- Документація: опис стеку, інструкція з запуску.
| Етап | Тривалість |
|---|---|
| Аналіз вимог | 1-2 дні |
| Розробка парсера | 2-3 дні на майданчик |
| Тестування | 1-2 дні |
| Деплой і документація | 1 день |
Що входить в роботу
- Парсер для кожного майданчика (до 5 майданчиків).
- Модерація (стоп-слова, довжина, анонімізація).
- Дедуплікація (по external_id + source).
- Автоматичне оновлення за розкладом (щоденно або раз на 4 години).
- Structured data на сторінці товару.
- Логування та сповіщення про помилки.
Терміни: від 3 до 5 робочих днів на один майданчик. Для комплексного проєкту (3 майданчики + модерація + SEO) — 7-10 днів. Зв'яжіться з нами для оцінки вашого проєкту. Отримайте консультацію по вашому проєкту.







