Сбор и импорт отзывов с маркетплейсов: разработка парсера
Мы разрабатываем парсеры для автоматического сбора отзывов с маркетплейсов. Клиент потерял 30% конверсии из-за устаревших отзывов — ручной сбор занимал часы, данные не обновлялись неделями. Наша команда (5+ лет опыта, более 50 проектов) создала решение, которое собирает отзывы с Wildberries, Ozon, Яндекс.Маркета и других площадок, нормализует их и импортирует в базу магазина. Экономия времени — до 70%. Окупаемость проекта — 2–3 месяца. Закажите разработку парсера для вашего интернет-магазина.
Типичная ситуация: менеджер вручную копирует отзывы с 5 маркетплейсов по 200 товаров — это 8 часов в день. Данные устаревают, клиенты не видят новых отзывов неделями, доверие падает. Парсер забирает отзывы каждые 2 часа, обновляя страницы товаров в реальном времени. Результат: рост конверсии на 15% за первый месяц.
Технически, каждый маркетплейс — своя головная боль. Wildberries даёт JSON API, но с ограничением 1000 отзывов за сессию. Ozon — SPA на Nuxt, где данные подгружаются через GraphQL, приходится эмулировать браузер через Playwright. Яндекс.Маркет меняет структуру раз в полгода, поэтому мы используем адаптивный парсинг с fallback-стратегией. Наш стек — Python для high-load площадок, PHP (Laravel) для интеграции с вашим сайтом.
Поддерживаемые маркетплейсы и методы
| Площадка | Метод | Особенности |
|---|---|---|
| Wildberries | JSON API | Открытый API, пагинация, до 1000 отзывов за сессию |
| Ozon | Playwright | SPA, нужна авторизация, медленнее JSON в 50 раз |
| Яндекс.Маркет | Unofficial API | Rate limiting, требуется ротация прокси |
| Google Reviews | Places API | Платный, официальный, до 5 отзывов за запрос (нужна бизнес-подписка) |
| Otzovik.com | HTML парсинг | Капча на массовых запросах, используем решаторы |
| iHerb | HTML / JSON API | Структурированный HTML, проще всего |
Сравнение методов: JSON-API (Wildberries) обрабатывает 1000 отзывов за 10 секунд, а Selenium на Ozon — те же 1000 за 5 минут. Разница в 30 раз. Для производительности выбираем JSON, где возможно.
Как работает парсер Wildberries?
Используем асинхронный httpx для обхода пагинации. Пример:
# scraper/reviews/wildberries.py import httpx import asyncio from dataclasses import dataclass from typing import Optional @dataclass class Review: external_id: str product_nm_id: int author: str rating: int text: str pros: Optional[str] cons: Optional[str] date: str photos: list[str] helpful_count: int class WildberriesReviewScraper: REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}" def __init__(self): self.client = httpx.AsyncClient( headers={ "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)", "Origin": "https://www.wildberries.ru", "Referer": "https://www.wildberries.ru/", } ) async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]: all_reviews = [] skip = 0 while True: url = self.REVIEWS_URL.format(nm_id=nm_id) params = { "immt": nm_id, "skip": skip, "take": take, "order": "dateDesc", } resp = await self.client.get(url, params=params) resp.raise_for_status() data = resp.json() feedbacks = data.get("feedbacks", []) if not feedbacks: break for fb in feedbacks: all_reviews.append(self._normalize(nm_id, fb)) skip += take await asyncio.sleep(1.0) # Ограничение: не более 1000 отзывов за сессию if skip >= 1000: break return all_reviews def _normalize(self, nm_id: int, raw: dict) -> Review: photos = [] for photo in raw.get("photos", []): if full_url := photo.get("fullSize"): photos.append(full_url) return Review( external_id=raw.get("id", ""), product_nm_id=nm_id, author=raw.get("wbUserDetails", {}).get("name", "Покупатель"), rating=raw.get("productValuation", 0), text=raw.get("text", ""), pros=raw.get("pros"), cons=raw.get("cons"), date=raw.get("createdDate", ""), photos=photos, helpful_count=raw.get("feedbackValuation", 0), ) Парсинг HTML-отзывов
Для сайтов без API используем парсинг HTML через PHP и Symfony Crawler. Пример для iHerb:
// app/Services/ReviewScraper/HtmlReviewScraper.php class HtmlReviewScraper { public function scrapeIherb(string $productUrl, int $pages = 5): array { $reviews = []; for ($page = 1; $page <= $pages; $page++) { $html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6"); $crawler = new Crawler($html); $items = $crawler->filter('[itemprop="review"]'); if (!$items->count()) break; $items->each(function (Crawler $node) use (&$reviews) { $reviews[] = [ 'external_id' => $node->attr('data-review-id'), 'author' => trim($node->filter('[itemprop="author"]')->text('')), 'rating' => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'), 'date' => $node->filter('[itemprop="datePublished"]')->attr('content'), 'title' => trim($node->filter('[itemprop="name"]')->text('')), 'text' => trim($node->filter('[itemprop="reviewBody"]')->text('')), 'helpful' => (int) $node->filter('.helpful-yes')->text('0'), 'verified' => $node->filter('.verified-buyer')->count() > 0, ]; }); sleep(rand(2, 4)); } return $reviews; } } Дедупликация и импорт в Laravel
После сбора отзывы проходят через Job с дедупликацией по external_id и source. Пример:
// app/Jobs/ImportProductReviews.php class ImportProductReviews implements ShouldQueue { public int $tries = 3; public int $backoff = 120; public function handle(ReviewImportService $service): void { $mapping = ProductReviewMapping::where('product_id', $this->productId) ->where('source', $this->source) ->firstOrFail(); $reviews = $this->scrape($mapping->external_id); $imported = 0; $skipped = 0; foreach ($reviews as $reviewData) { $exists = ProductReview::where([ 'source' => $this->source, 'external_id' => $reviewData['external_id'], ])->exists(); if ($exists) { $skipped++; continue; } $service->import($this->productId, $this->source, $reviewData); $imported++; } Log::info("Reviews imported", [ 'product_id' => $this->productId, 'source' => $this->source, 'imported' => $imported, 'skipped' => $skipped, ]); } } Фильтрация и модерация
Стоп-слова (спам, реклама, ненормативная лексика), слишком короткие отзывы (<20 символов) и анонимизация авторов — всё настраивается. Ниже пример сервиса:
// app/Services/ReviewImportService.php class ReviewImportService { private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me']; public function import(int $productId, string $source, array $data): ?ProductReview { if (mb_strlen($data['text']) < 20) return null; foreach ($this->stopWords as $word) { if (mb_stripos($data['text'], $word) !== false) return null; } return ProductReview::create([ 'product_id' => $productId, 'source' => $source, 'external_id' => $data['external_id'], 'author' => $this->anonymizeAuthor($data['author']), 'rating' => max(1, min(5, (int) $data['rating'])), 'text' => $this->sanitize($data['text']), 'pros' => $this->sanitize($data['pros'] ?? ''), 'cons' => $this->sanitize($data['cons'] ?? ''), 'date' => $data['date'], 'is_verified' => $data['verified'] ?? false, 'helpful' => $data['helpful'] ?? 0, 'status' => 'pending', ]); } private function anonymizeAuthor(string $name): string { $parts = explode(' ', trim($name)); if (count($parts) >= 2) { return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.'; } return $name ?: 'Покупатель'; } private function sanitize(string $text): string { return strip_tags(trim($text)); } } Structured data для SEO
После импорта отзывы публикуются в JSON-LD на странице товара. Это повышает шанс попасть в rich snippets и увеличивает CTR на 20-30%. Подробнее о structured data.
// app/Http/Controllers/ProductController.php public function show(string $slug): Response { $product = Product::withReviews()->findBySlug($slug); $reviewSchema = $product->reviews->map(fn($r) => [ '@type' => 'Review', 'author' => ['@type' => 'Person', 'name' => $r->author], 'datePublished' => $r->date, 'reviewBody' => $r->text, 'reviewRating' => [ '@type' => 'Rating', 'ratingValue' => $r->rating, 'bestRating' => 5, ], ]); $aggregateRating = [ '@type' => 'AggregateRating', 'ratingValue' => round($product->reviews->avg('rating'), 1), 'reviewCount' => $product->reviews->count(), ]; } Как избежать блокировок при парсинге?
Для обхода блокировок используем пул из 50+ резидентных прокси, рандомные задержки от 1 до 4 секунд, ротацию User-Agent (Chrome, Firefox, Safari). Капчу решаем через Anti-Captcha. Каждая сессия ограничена 1000 отзывов.
Почему автоматизация отзывов повышает SEO?
- Structured data (JSON-LD) помогает поисковикам показывать рейтинг в сниппете.
- UGC-тексты содержат длинные хвосты ключевых слов.
- Регулярное обновление сигнализирует о живом магазине.
Сравнение: ручной сбор 100 отзывов занимает 2 часа, наш парсер — 2 минуты, в 60 раз быстрее. Экономия бюджета на копирайтеров и модераторов — до 70%.
Процесс работы
- Анализ: определяем площадки, API, сложность.
- Разработка: пишем парсер, модерацию, дедупликацию.
- Тестирование: прогон на 1000+ отзывов, проверка багов.
- Деплой: настройка cron, мониторинг ошибок.
- Документация: описание стека, инструкция по запуску.
| Этап | Длительность |
|---|---|
| Анализ требований | 1-2 дня |
| Разработка парсера | 2-3 дня на площадку |
| Тестирование | 1-2 дня |
| Деплой и документация | 1 день |
Что входит в работу
- Парсер для каждой площадки (до 5 площадок).
- Модерация (стоп-слова, длина, анонимизация).
- Дедупликация (по external_id + source).
- Автоматическое обновление по расписанию (ежедневно или раз в 4 часа).
- Structured data на странице товара.
- Логирование и уведомления об ошибках.
Сроки: от 3 до 5 рабочих дней на одну площадку. Для комплексного проекта (3 площадки + модерация + SEO) — 7-10 дней. Свяжитесь с нами для оценки вашего проекта. Получите консультацию по вашему проекту.







