Сбор и импорт отзывов с маркетплейсов: разработка парсера
Мы разрабатываем парсеры для автоматического сбора отзывов с маркетплейсов. Клиент потерял 30% конверсии из-за устаревших отзывов — ручной сбор занимал часы, данные не обновлялись неделями. Наша команда (5+ лет опыта, более 50 проектов) создала решение, которое собирает отзывы с Wildberries, Ozon, Яндекс.Маркета и других площадок, нормализует их и импортирует в базу магазина. Экономия времени — до 70%. Окупаемость проекта — 2–3 месяца. Закажите разработку парсера для вашего интернет-магазина.
Типичная ситуация: менеджер вручную копирует отзывы с 5 маркетплейсов по 200 товаров — это 8 часов в день. Данные устаревают, клиенты не видят новых отзывов неделями, доверие падает. Парсер забирает отзывы каждые 2 часа, обновляя страницы товаров в реальном времени. Результат: рост конверсии на 15% за первый месяц.
Технически, каждый маркетплейс — своя головная боль. Wildberries даёт JSON API, но с ограничением 1000 отзывов за сессию. Ozon — SPA на Nuxt, где данные подгружаются через GraphQL, приходится эмулировать браузер через Playwright. Яндекс.Маркет меняет структуру раз в полгода, поэтому мы используем адаптивный парсинг с fallback-стратегией. Наш стек — Python для high-load площадок, PHP (Laravel) для интеграции с вашим сайтом.
Поддерживаемые маркетплейсы и методы
| Площадка | Метод | Особенности |
|---|---|---|
| Wildberries | JSON API | Открытый API, пагинация, до 1000 отзывов за сессию |
| Ozon | Playwright | SPA, нужна авторизация, медленнее JSON в 50 раз |
| Яндекс.Маркет | Unofficial API | Rate limiting, требуется ротация прокси |
| Google Reviews | Places API | Платный, официальный, до 5 отзывов за запрос (нужна бизнес-подписка) |
| Otzovik.com | HTML парсинг | Капча на массовых запросах, используем решаторы |
| iHerb | HTML / JSON API | Структурированный HTML, проще всего |
Сравнение методов: JSON-API (Wildberries) обрабатывает 1000 отзывов за 10 секунд, а Selenium на Ozon — те же 1000 за 5 минут. Разница в 30 раз. Для производительности выбираем JSON, где возможно.
Как работает парсер Wildberries?
Используем асинхронный httpx для обхода пагинации. Пример:
# scraper/reviews/wildberries.py
import httpx
import asyncio
from dataclasses import dataclass
from typing import Optional
@dataclass
class Review:
external_id: str
product_nm_id: int
author: str
rating: int
text: str
pros: Optional[str]
cons: Optional[str]
date: str
photos: list[str]
helpful_count: int
class WildberriesReviewScraper:
REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}"
def __init__(self):
self.client = httpx.AsyncClient(
headers={
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
"Origin": "https://www.wildberries.ru",
"Referer": "https://www.wildberries.ru/",
}
)
async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]:
all_reviews = []
skip = 0
while True:
url = self.REVIEWS_URL.format(nm_id=nm_id)
params = {
"immt": nm_id,
"skip": skip,
"take": take,
"order": "dateDesc",
}
resp = await self.client.get(url, params=params)
resp.raise_for_status()
data = resp.json()
feedbacks = data.get("feedbacks", [])
if not feedbacks:
break
for fb in feedbacks:
all_reviews.append(self._normalize(nm_id, fb))
skip += take
await asyncio.sleep(1.0)
# Ограничение: не более 1000 отзывов за сессию
if skip >= 1000:
break
return all_reviews
def _normalize(self, nm_id: int, raw: dict) -> Review:
photos = []
for photo in raw.get("photos", []):
if full_url := photo.get("fullSize"):
photos.append(full_url)
return Review(
external_id=raw.get("id", ""),
product_nm_id=nm_id,
author=raw.get("wbUserDetails", {}).get("name", "Покупатель"),
rating=raw.get("productValuation", 0),
text=raw.get("text", ""),
pros=raw.get("pros"),
cons=raw.get("cons"),
date=raw.get("createdDate", ""),
photos=photos,
helpful_count=raw.get("feedbackValuation", 0),
)
Парсинг HTML-отзывов
Для сайтов без API используем парсинг HTML через PHP и Symfony Crawler. Пример для iHerb:
// app/Services/ReviewScraper/HtmlReviewScraper.php
class HtmlReviewScraper
{
public function scrapeIherb(string $productUrl, int $pages = 5): array
{
$reviews = [];
for ($page = 1; $page <= $pages; $page++) {
$html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6");
$crawler = new Crawler($html);
$items = $crawler->filter('[itemprop="review"]');
if (!$items->count()) break;
$items->each(function (Crawler $node) use (&$reviews) {
$reviews[] = [
'external_id' => $node->attr('data-review-id'),
'author' => trim($node->filter('[itemprop="author"]')->text('')),
'rating' => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'),
'date' => $node->filter('[itemprop="datePublished"]')->attr('content'),
'title' => trim($node->filter('[itemprop="name"]')->text('')),
'text' => trim($node->filter('[itemprop="reviewBody"]')->text('')),
'helpful' => (int) $node->filter('.helpful-yes')->text('0'),
'verified' => $node->filter('.verified-buyer')->count() > 0,
];
});
sleep(rand(2, 4));
}
return $reviews;
}
}
Дедупликация и импорт в Laravel
После сбора отзывы проходят через Job с дедупликацией по external_id и source. Пример:
// app/Jobs/ImportProductReviews.php
class ImportProductReviews implements ShouldQueue
{
public int $tries = 3;
public int $backoff = 120;
public function handle(ReviewImportService $service): void
{
$mapping = ProductReviewMapping::where('product_id', $this->productId)
->where('source', $this->source)
->firstOrFail();
$reviews = $this->scrape($mapping->external_id);
$imported = 0;
$skipped = 0;
foreach ($reviews as $reviewData) {
$exists = ProductReview::where([
'source' => $this->source,
'external_id' => $reviewData['external_id'],
])->exists();
if ($exists) {
$skipped++;
continue;
}
$service->import($this->productId, $this->source, $reviewData);
$imported++;
}
Log::info("Reviews imported", [
'product_id' => $this->productId,
'source' => $this->source,
'imported' => $imported,
'skipped' => $skipped,
]);
}
}
Фильтрация и модерация
Стоп-слова (спам, реклама, ненормативная лексика), слишком короткие отзывы (<20 символов) и анонимизация авторов — всё настраивается. Ниже пример сервиса:
// app/Services/ReviewImportService.php
class ReviewImportService
{
private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me'];
public function import(int $productId, string $source, array $data): ?ProductReview
{
if (mb_strlen($data['text']) < 20) return null;
foreach ($this->stopWords as $word) {
if (mb_stripos($data['text'], $word) !== false) return null;
}
return ProductReview::create([
'product_id' => $productId,
'source' => $source,
'external_id' => $data['external_id'],
'author' => $this->anonymizeAuthor($data['author']),
'rating' => max(1, min(5, (int) $data['rating'])),
'text' => $this->sanitize($data['text']),
'pros' => $this->sanitize($data['pros'] ?? ''),
'cons' => $this->sanitize($data['cons'] ?? ''),
'date' => $data['date'],
'is_verified' => $data['verified'] ?? false,
'helpful' => $data['helpful'] ?? 0,
'status' => 'pending',
]);
}
private function anonymizeAuthor(string $name): string
{
$parts = explode(' ', trim($name));
if (count($parts) >= 2) {
return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.';
}
return $name ?: 'Покупатель';
}
private function sanitize(string $text): string
{
return strip_tags(trim($text));
}
}
Structured data для SEO
После импорта отзывы публикуются в JSON-LD на странице товара. Это повышает шанс попасть в rich snippets и увеличивает CTR на 20-30%. Подробнее о structured data.
// app/Http/Controllers/ProductController.php
public function show(string $slug): Response
{
$product = Product::withReviews()->findBySlug($slug);
$reviewSchema = $product->reviews->map(fn($r) => [
'@type' => 'Review',
'author' => ['@type' => 'Person', 'name' => $r->author],
'datePublished' => $r->date,
'reviewBody' => $r->text,
'reviewRating' => [
'@type' => 'Rating',
'ratingValue' => $r->rating,
'bestRating' => 5,
],
]);
$aggregateRating = [
'@type' => 'AggregateRating',
'ratingValue' => round($product->reviews->avg('rating'), 1),
'reviewCount' => $product->reviews->count(),
];
}
Как избежать блокировок при парсинге?
Для обхода блокировок используем пул из 50+ резидентных прокси, рандомные задержки от 1 до 4 секунд, ротацию User-Agent (Chrome, Firefox, Safari). Капчу решаем через Anti-Captcha. Каждая сессия ограничена 1000 отзывов.
Почему автоматизация отзывов повышает SEO?
- Structured data (JSON-LD) помогает поисковикам показывать рейтинг в сниппете.
- UGC-тексты содержат длинные хвосты ключевых слов.
- Регулярное обновление сигнализирует о живом магазине.
Сравнение: ручной сбор 100 отзывов занимает 2 часа, наш парсер — 2 минуты, в 60 раз быстрее. Экономия бюджета на копирайтеров и модераторов — до 70%.
Процесс работы
- Анализ: определяем площадки, API, сложность.
- Разработка: пишем парсер, модерацию, дедупликацию.
- Тестирование: прогон на 1000+ отзывов, проверка багов.
- Деплой: настройка cron, мониторинг ошибок.
- Документация: описание стека, инструкция по запуску.
| Этап | Длительность |
|---|---|
| Анализ требований | 1-2 дня |
| Разработка парсера | 2-3 дня на площадку |
| Тестирование | 1-2 дня |
| Деплой и документация | 1 день |
Что входит в работу
- Парсер для каждой площадки (до 5 площадок).
- Модерация (стоп-слова, длина, анонимизация).
- Дедупликация (по external_id + source).
- Автоматическое обновление по расписанию (ежедневно или раз в 4 часа).
- Structured data на странице товара.
- Логирование и уведомления об ошибках.
Сроки: от 3 до 5 рабочих дней на одну площадку. Для комплексного проекта (3 площадки + модерация + SEO) — 7-10 дней. Свяжитесь с нами для оценки вашего проекта. Получите консультацию по вашему проекту.







