Збір та імпорт відгуків з маркетплейсів: розробка парсера
Ми розробляємо високопродуктивні парсери для автоматичного збору відгуків з маркетплейсів. Клієнт втратив 30% конверсії через застарілі відгуки — ручний збір займав години, дані не оновлювалися тижнями. Наша команда (5+ років досвіду, сертифіковані розробники, гарантія якості) створила рішення, яке збирає відгуки з Wildberries, Ozon, Яндекс.Маркету та інших майданчиків, нормалізує їх та імпортує в базу магазину. Економія часу — до 70%, або до $2000 на місяць на зарплаті менеджера. Окупність проєкту — 2–3 місяці. Замовте розробку парсера для вашого інтернет-магазину.
Типова ситуація: менеджер вручну копіює відгуки з 5 маркетплейсів по 200 товарів — це 8 годин на день. Автоматизація краще ручного збору в 60 разів за швидкістю: наш парсер виконує ту ж роботу за 8 хвилин. Дані оновлюються кожні 2 години, сторінки товарів — у реальному часі. Результат: зростання конверсії на 15% за перший місяць.
Технічно, кожен маркетплейс — свій головний біль. Wildberries дає JSON API з асинхронними httpx-запитами, але з обмеженням 1000 відгуків за сесію. Ozon — SPA на Nuxt, де дані підвантажуються через GraphQL, доводиться емулювати браузер через Playwright з ротацією User-Agent. Яндекс.Маркет змінює структуру раз на пів року, тому ми використовуємо адаптивний парсинг з fallback-стратегією та пулом резидентних проксі. Наш стек — Python для high-load майданчиків, PHP (Laravel) для інтеграції з вашим сайтом через черги (Queues) та Docker-контейнеризацію.
Підтримувані маркетплейси та методи
| Площадка | Метод | Особливості |
|---|---|---|
| Wildberries | JSON API | Відкритий API, пагінація, до 1000 відгуків за сесію |
| Ozon | Playwright | SPA, потрібна авторизація, повільніше JSON в 50 разів |
| Яндекс.Маркет | Unofficial API | Rate limiting, потрібна ротація проксі |
| Google Reviews | Places API | Платний, офіційний, до 5 відгуків за запит (потрібна бізнес-підписка) |
| Otzovik.com | HTML парсинг | Капча на масових запитах, використовуємо Anti-Captcha |
| iHerb | HTML / JSON API | Структурований HTML, найпростіше |
Порівняння методів: JSON-API (Wildberries) обробляє 1000 відгуків за 10 секунд, а Selenium на Ozon — ті ж 1000 за 5 хвилин. Різниця в 30 разів. Для продуктивності обираємо JSON, де можливо.
Як працює парсер Wildberries?
Приклад коду з асинхронними запитами (Python httpx)
# scraper/reviews/wildberries.py
import httpx
import asyncio
from dataclasses import dataclass
from typing import Optional
@dataclass
class Review:
external_id: str
product_nm_id: int
author: str
rating: int
text: str
pros: Optional[str]
cons: Optional[str]
date: str
photos: list[str]
helpful_count: int
class WildberriesReviewScraper:
REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}"
def __init__(self):
self.client = httpx.AsyncClient(
headers={
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
"Origin": "https://www.wildberries.ru",
"Referer": "https://www.wildberries.ru/",
}
)
async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]:
all_reviews = []
skip = 0
while True:
url = self.REVIEWS_URL.format(nm_id=nm_id)
params = {
"immt": nm_id,
"skip": skip,
"take": take,
"order": "dateDesc",
}
resp = await self.client.get(url, params=params)
resp.raise_for_status()
data = resp.json()
feedbacks = data.get("feedbacks", [])
if not feedbacks:
break
for fb in feedbacks:
all_reviews.append(self._normalize(nm_id, fb))
skip += take
await asyncio.sleep(1.0)
# Ограничение: не более 1000 отзывов за сессию
if skip >= 1000:
break
return all_reviews
def _normalize(self, nm_id: int, raw: dict) -> Review:
photos = []
for photo in raw.get("photos", []):
if full_url := photo.get("fullSize"):
photos.append(full_url)
return Review(
external_id=raw.get("id", ""),
product_nm_id=nm_id,
author=raw.get("wbUserDetails", {}).get("name", "Покупатель"),
rating=raw.get("productValuation", 0),
text=raw.get("text", ""),
pros=raw.get("pros"),
cons=raw.get("cons"),
date=raw.get("createdDate", ""),
photos=photos,
helpful_count=raw.get("feedbackValuation", 0),
)
Парсинг HTML-відгуків
Для сайтів без API використовуємо парсинг HTML через PHP і Symfony Crawler. Приклад для iHerb:
// app/Services/ReviewScraper/HtmlReviewScraper.php
class HtmlReviewScraper
{
public function scrapeIherb(string $productUrl, int $pages = 5): array
{
$reviews = [];
for ($page = 1; $page <= $pages; $page++) {
$html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6");
$crawler = new Crawler($html);
$items = $crawler->filter('[itemprop="review"]');
if (!$items->count()) break;
$items->each(function (Crawler $node) use (&$reviews) {
$reviews[] = [
'external_id' => $node->attr('data-review-id'),
'author' => trim($node->filter('[itemprop="author"]')->text('')),
'rating' => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'),
'date' => $node->filter('[itemprop="datePublished"]')->attr('content'),
'title' => trim($node->filter('[itemprop="name"]')->text('')),
'text' => trim($node->filter('[itemprop="reviewBody"]')->text('')),
'helpful' => (int) $node->filter('.helpful-yes')->text('0'),
'verified' => $node->filter('.verified-buyer')->count() > 0,
];
});
sleep(rand(2, 4));
}
return $reviews;
}
}
Дедуплікація та імпорт в Laravel
Після збору відгуки проходять через Job з дедуплікацією за external_id і source. Приклад:
// app/Jobs/ImportProductReviews.php
class ImportProductReviews implements ShouldQueue
{
public int $tries = 3;
public int $backoff = 120;
public function handle(ReviewImportService $service): void
{
$mapping = ProductReviewMapping::where('product_id', $this->productId)
->where('source', $this->source)
->firstOrFail();
$reviews = $this->scrape($mapping->external_id);
$imported = 0;
$skipped = 0;
foreach ($reviews as $reviewData) {
$exists = ProductReview::where([
'source' => $this->source,
'external_id' => $reviewData['external_id'],
])->exists();
if ($exists) {
$skipped++;
continue;
}
$service->import($this->productId, $this->source, $reviewData);
$imported++;
}
Log::info("Reviews imported", [
'product_id' => $this->productId,
'source' => $this->source,
'imported' => $imported,
'skipped' => $skipped,
]);
}
}
Фільтрація та модерація
Стоп-слова (спам, реклама, ненормативна лексика), занадто короткі відгуки (<20 символів) та анонімізація авторів — все налаштовується. Нижче приклад сервісу:
// app/Services/ReviewImportService.php
class ReviewImportService
{
private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me'];
public function import(int $productId, string $source, array $data): ?ProductReview
{
if (mb_strlen($data['text']) < 20) return null;
foreach ($this->stopWords as $word) {
if (mb_stripos($data['text'], $word) !== false) return null;
}
return ProductReview::create([
'product_id' => $productId,
'source' => $source,
'external_id' => $data['external_id'],
'author' => $this->anonymizeAuthor($data['author']),
'rating' => max(1, min(5, (int) $data['rating'])),
'text' => $this->sanitize($data['text']),
'pros' => $this->sanitize($data['pros'] ?? ''),
'cons' => $this->sanitize($data['cons'] ?? ''),
'date' => $data['date'],
'is_verified' => $data['verified'] ?? false,
'helpful' => $data['helpful'] ?? 0,
'status' => 'pending',
]);
}
private function anonymizeAuthor(string $name): string
{
$parts = explode(' ', trim($name));
if (count($parts) >= 2) {
return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.';
}
return $name ?: 'Покупатель';
}
private function sanitize(string $text): string
{
return strip_tags(trim($text));
}
}
Structured data для SEO
Після імпорту відгуки публікуються в JSON-LD на сторінці товару. Це підвищує шанс потрапити в rich snippets і збільшує CTR на 20-30%. Детальніше про structured data на Wikipedia.
// app/Http/Controllers/ProductController.php
public function show(string $slug): Response
{
$product = Product::withReviews()->findBySlug($slug);
$reviewSchema = $product->reviews->map(fn($r) => [
'@type' => 'Review',
'author' => ['@type' => 'Person', 'name' => $r->author],
'datePublished' => $r->date,
'reviewBody' => $r->text,
'reviewRating' => [
'@type' => 'Rating',
'ratingValue' => $r->rating,
'bestRating' => 5,
],
]);
$aggregateRating = [
'@type' => 'AggregateRating',
'ratingValue' => round($product->reviews->avg('rating'), 1),
'reviewCount' => $product->reviews->count(),
];
}
Як уникнути блокувань при парсингу?
Для обходу блокувань використовуємо пул з 50+ резидентних проксі, випадкові затримки від 1 до 4 секунд, ротацію User-Agent (Chrome, Firefox, Safari). Капчу розв'язуємо через Anti-Captcha. Кожна сесія обмежена 1000 відгуків.
Чому автоматизація відгуків підвищує SEO?
- Structured data (JSON-LD) допомагає пошуковикам показувати рейтинг у снипеті.
- UGC-тексти містять довгі хвости ключових слів.
- Регулярне оновлення сигналізує про живий магазин.
Порівняння: ручний збір 100 відгуків займає 2 години, наш парсер — 2 хвилини, в 60 разів швидше. Економія бюджету на копірайтерів і модераторів — до 70% (до $2000 на місяць).
Процес роботи
- Аналіз: визначаємо майданчики, API, складність.
- Розробка: пишемо парсер, модерацію, дедуплікацію.
- Тестування: прогін на 1000+ відгуків, перевірка багів.
- Деплой: налаштування cron, моніторинг помилок.
- Документація: опис стеку, інструкція з запуску.
| Етап | Тривалість |
|---|---|
| Аналіз вимог | 1-2 дні |
| Розробка парсера | 2-3 дні на майданчик |
| Тестування | 1-2 дні |
| Деплой і документація | 1 день |
Що входить в роботу
- Парсер для кожного майданчика (до 5 майданчиків).
- Модерація (стоп-слова, довжина, анонімізація).
- Дедуплікація (по external_id + source).
- Автоматичне оновлення за розкладом (щоденно або раз на 4 години).
- Structured data на сторінці товару.
- Логування та сповіщення про помилки.
Терміни: від 3 до 5 робочих днів на один майданчик. Для комплексного проєкту (3 майданчики + модерація + SEO) — 7-10 днів. Зв'яжіться з нами для оцінки вашого проєкту. Отримайте консультацію по вашому проєкту.







