Парсер отзывов: автоматизация сбора и импорта с маркетплейсов

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Парсер отзывов: автоматизация сбора и импорта с маркетплейсов
Средний
~3-5 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    958
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    949

Сбор и импорт отзывов с маркетплейсов: разработка парсера

Мы разрабатываем парсеры для автоматического сбора отзывов с маркетплейсов. Клиент потерял 30% конверсии из-за устаревших отзывов — ручной сбор занимал часы, данные не обновлялись неделями. Наша команда (5+ лет опыта, более 50 проектов) создала решение, которое собирает отзывы с Wildberries, Ozon, Яндекс.Маркета и других площадок, нормализует их и импортирует в базу магазина. Экономия времени — до 70%. Окупаемость проекта — 2–3 месяца. Закажите разработку парсера для вашего интернет-магазина.

Типичная ситуация: менеджер вручную копирует отзывы с 5 маркетплейсов по 200 товаров — это 8 часов в день. Данные устаревают, клиенты не видят новых отзывов неделями, доверие падает. Парсер забирает отзывы каждые 2 часа, обновляя страницы товаров в реальном времени. Результат: рост конверсии на 15% за первый месяц.

Технически, каждый маркетплейс — своя головная боль. Wildberries даёт JSON API, но с ограничением 1000 отзывов за сессию. Ozon — SPA на Nuxt, где данные подгружаются через GraphQL, приходится эмулировать браузер через Playwright. Яндекс.Маркет меняет структуру раз в полгода, поэтому мы используем адаптивный парсинг с fallback-стратегией. Наш стек — Python для high-load площадок, PHP (Laravel) для интеграции с вашим сайтом.

Поддерживаемые маркетплейсы и методы

Площадка Метод Особенности
Wildberries JSON API Открытый API, пагинация, до 1000 отзывов за сессию
Ozon Playwright SPA, нужна авторизация, медленнее JSON в 50 раз
Яндекс.Маркет Unofficial API Rate limiting, требуется ротация прокси
Google Reviews Places API Платный, официальный, до 5 отзывов за запрос (нужна бизнес-подписка)
Otzovik.com HTML парсинг Капча на массовых запросах, используем решаторы
iHerb HTML / JSON API Структурированный HTML, проще всего

Сравнение методов: JSON-API (Wildberries) обрабатывает 1000 отзывов за 10 секунд, а Selenium на Ozon — те же 1000 за 5 минут. Разница в 30 раз. Для производительности выбираем JSON, где возможно.

Как работает парсер Wildberries?

Используем асинхронный httpx для обхода пагинации. Пример:

# scraper/reviews/wildberries.py
import httpx
import asyncio
from dataclasses import dataclass
from typing import Optional

@dataclass
class Review:
    external_id: str
    product_nm_id: int
    author: str
    rating: int
    text: str
    pros: Optional[str]
    cons: Optional[str]
    date: str
    photos: list[str]
    helpful_count: int

class WildberriesReviewScraper:
    REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}"

    def __init__(self):
        self.client = httpx.AsyncClient(
            headers={
                "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
                "Origin": "https://www.wildberries.ru",
                "Referer": "https://www.wildberries.ru/",
            }
        )

    async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]:
        all_reviews = []
        skip = 0

        while True:
            url = self.REVIEWS_URL.format(nm_id=nm_id)
            params = {
                "immt": nm_id,
                "skip": skip,
                "take": take,
                "order": "dateDesc",
            }

            resp = await self.client.get(url, params=params)
            resp.raise_for_status()

            data = resp.json()
            feedbacks = data.get("feedbacks", [])

            if not feedbacks:
                break

            for fb in feedbacks:
                all_reviews.append(self._normalize(nm_id, fb))

            skip += take
            await asyncio.sleep(1.0)

            # Ограничение: не более 1000 отзывов за сессию
            if skip >= 1000:
                break

        return all_reviews

    def _normalize(self, nm_id: int, raw: dict) -> Review:
        photos = []
        for photo in raw.get("photos", []):
            if full_url := photo.get("fullSize"):
                photos.append(full_url)

        return Review(
            external_id=raw.get("id", ""),
            product_nm_id=nm_id,
            author=raw.get("wbUserDetails", {}).get("name", "Покупатель"),
            rating=raw.get("productValuation", 0),
            text=raw.get("text", ""),
            pros=raw.get("pros"),
            cons=raw.get("cons"),
            date=raw.get("createdDate", ""),
            photos=photos,
            helpful_count=raw.get("feedbackValuation", 0),
        )

Парсинг HTML-отзывов

Для сайтов без API используем парсинг HTML через PHP и Symfony Crawler. Пример для iHerb:

// app/Services/ReviewScraper/HtmlReviewScraper.php
class HtmlReviewScraper
{
    public function scrapeIherb(string $productUrl, int $pages = 5): array
    {
        $reviews = [];

        for ($page = 1; $page <= $pages; $page++) {
            $html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6");
            $crawler = new Crawler($html);

            $items = $crawler->filter('[itemprop="review"]');
            if (!$items->count()) break;

            $items->each(function (Crawler $node) use (&$reviews) {
                $reviews[] = [
                    'external_id' => $node->attr('data-review-id'),
                    'author'      => trim($node->filter('[itemprop="author"]')->text('')),
                    'rating'      => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'),
                    'date'        => $node->filter('[itemprop="datePublished"]')->attr('content'),
                    'title'       => trim($node->filter('[itemprop="name"]')->text('')),
                    'text'        => trim($node->filter('[itemprop="reviewBody"]')->text('')),
                    'helpful'     => (int) $node->filter('.helpful-yes')->text('0'),
                    'verified'    => $node->filter('.verified-buyer')->count() > 0,
                ];
            });

            sleep(rand(2, 4));
        }

        return $reviews;
    }
}

Дедупликация и импорт в Laravel

После сбора отзывы проходят через Job с дедупликацией по external_id и source. Пример:

// app/Jobs/ImportProductReviews.php
class ImportProductReviews implements ShouldQueue
{
    public int $tries = 3;
    public int $backoff = 120;

    public function handle(ReviewImportService $service): void
    {
        $mapping = ProductReviewMapping::where('product_id', $this->productId)
            ->where('source', $this->source)
            ->firstOrFail();

        $reviews = $this->scrape($mapping->external_id);

        $imported = 0;
        $skipped = 0;

        foreach ($reviews as $reviewData) {
            $exists = ProductReview::where([
                'source'      => $this->source,
                'external_id' => $reviewData['external_id'],
            ])->exists();

            if ($exists) {
                $skipped++;
                continue;
            }

            $service->import($this->productId, $this->source, $reviewData);
            $imported++;
        }

        Log::info("Reviews imported", [
            'product_id' => $this->productId,
            'source'     => $this->source,
            'imported'   => $imported,
            'skipped'    => $skipped,
        ]);
    }
}

Фильтрация и модерация

Стоп-слова (спам, реклама, ненормативная лексика), слишком короткие отзывы (<20 символов) и анонимизация авторов — всё настраивается. Ниже пример сервиса:

// app/Services/ReviewImportService.php
class ReviewImportService
{
    private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me'];

    public function import(int $productId, string $source, array $data): ?ProductReview
    {
        if (mb_strlen($data['text']) < 20) return null;

        foreach ($this->stopWords as $word) {
            if (mb_stripos($data['text'], $word) !== false) return null;
        }

        return ProductReview::create([
            'product_id'  => $productId,
            'source'      => $source,
            'external_id' => $data['external_id'],
            'author'      => $this->anonymizeAuthor($data['author']),
            'rating'      => max(1, min(5, (int) $data['rating'])),
            'text'        => $this->sanitize($data['text']),
            'pros'        => $this->sanitize($data['pros'] ?? ''),
            'cons'        => $this->sanitize($data['cons'] ?? ''),
            'date'        => $data['date'],
            'is_verified' => $data['verified'] ?? false,
            'helpful'     => $data['helpful'] ?? 0,
            'status'      => 'pending',
        ]);
    }

    private function anonymizeAuthor(string $name): string
    {
        $parts = explode(' ', trim($name));
        if (count($parts) >= 2) {
            return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.';
        }
        return $name ?: 'Покупатель';
    }

    private function sanitize(string $text): string
    {
        return strip_tags(trim($text));
    }
}

Structured data для SEO

После импорта отзывы публикуются в JSON-LD на странице товара. Это повышает шанс попасть в rich snippets и увеличивает CTR на 20-30%. Подробнее о structured data.

// app/Http/Controllers/ProductController.php
public function show(string $slug): Response
{
    $product = Product::withReviews()->findBySlug($slug);

    $reviewSchema = $product->reviews->map(fn($r) => [
        '@type'         => 'Review',
        'author'        => ['@type' => 'Person', 'name' => $r->author],
        'datePublished' => $r->date,
        'reviewBody'    => $r->text,
        'reviewRating'  => [
            '@type'       => 'Rating',
            'ratingValue' => $r->rating,
            'bestRating'  => 5,
        ],
    ]);

    $aggregateRating = [
        '@type'       => 'AggregateRating',
        'ratingValue' => round($product->reviews->avg('rating'), 1),
        'reviewCount' => $product->reviews->count(),
    ];
}

Как избежать блокировок при парсинге?

Для обхода блокировок используем пул из 50+ резидентных прокси, рандомные задержки от 1 до 4 секунд, ротацию User-Agent (Chrome, Firefox, Safari). Капчу решаем через Anti-Captcha. Каждая сессия ограничена 1000 отзывов.

Почему автоматизация отзывов повышает SEO?

  • Structured data (JSON-LD) помогает поисковикам показывать рейтинг в сниппете.
  • UGC-тексты содержат длинные хвосты ключевых слов.
  • Регулярное обновление сигнализирует о живом магазине.

Сравнение: ручной сбор 100 отзывов занимает 2 часа, наш парсер — 2 минуты, в 60 раз быстрее. Экономия бюджета на копирайтеров и модераторов — до 70%.

Процесс работы

  1. Анализ: определяем площадки, API, сложность.
  2. Разработка: пишем парсер, модерацию, дедупликацию.
  3. Тестирование: прогон на 1000+ отзывов, проверка багов.
  4. Деплой: настройка cron, мониторинг ошибок.
  5. Документация: описание стека, инструкция по запуску.
Этап Длительность
Анализ требований 1-2 дня
Разработка парсера 2-3 дня на площадку
Тестирование 1-2 дня
Деплой и документация 1 день

Что входит в работу

  • Парсер для каждой площадки (до 5 площадок).
  • Модерация (стоп-слова, длина, анонимизация).
  • Дедупликация (по external_id + source).
  • Автоматическое обновление по расписанию (ежедневно или раз в 4 часа).
  • Structured data на странице товара.
  • Логирование и уведомления об ошибках.

Сроки: от 3 до 5 рабочих дней на одну площадку. Для комплексного проекта (3 площадки + модерация + SEO) — 7-10 дней. Свяжитесь с нами для оценки вашего проекта. Получите консультацию по вашему проекту.

Разработка интернет-магазинов

Мы знаем: интернет-магазин — это не просто «сайт с корзиной». Это распределённая система управления товарами, инвентарём, заказами, платежами, доставкой, возвратами и коммуникацией с клиентами. Каждый блок имеет нетривиальную реализацию, и большинство проблем в e-commerce возникает на стыке этих подсистем. Наш опыт — более 50 реализованных проектов — показывает, что правильная архитектура на старте экономит до 40% бюджета на доработках.

Почему производительность каталога деградирует при росте SKU?

Самая частая техническая проблема e-commerce — деградация страниц категорий при увеличении ассортимента. Страница работает хорошо на 500 товарах и начинает тормозить на 10 000. Причины почти всегда одни и те же.

N+1 на атрибутах. Загружаете список товаров — 50 элементов. Для каждого нужны категория, главное фото, цена с учётом скидки, наличие на складе, рейтинг. Без правильного eager loading это 250+ запросов на страницу. В Laravel решается через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) и withAvg('reviews', 'rating'). Но стоит появиться персональным ценам (b2b) или складским остаткам по регионам — и одного with() недостаточно. Нужны Query Object или выделенный ReadModel.

Фасетная фильтрация без индексов. Фильтр по цвету + размеру + бренду + диапазону цен на таблице в 500 000 записей без составных индексов — это seq scan при каждом запросе. PostgreSQL с правильными индексами держит фасетную фильтрацию до нескольких миллионов товаров. Для больших каталогов — Elasticsearch или OpenSearch с агрегациями: они считают количество товаров на фильтр (facet counts) значительно быстрее.

Пагинация через OFFSET. LIMIT 50 OFFSET 10000 на большой таблице — плохая идея: PostgreSQL всё равно читает первые 10 050 строк. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 работает за константное время независимо от страницы. Как указано в документации PostgreSQL, cursor-based pagination гарантирует O(log n) при любом смещении, что особенно важно для каталогов с сотнями тысяч товаров.

Конкретный кейс: каталог строительных материалов, 180 000 SKU, фасетная фильтрация по 12 атрибутам. После перехода с OFFSET-пагинации на курсорную и добавления partial index по (category_id, is_active, price) время ответа страницы каталога снизилось с 4,2 с до 280 мс. Экономия на серверных ресурсах составила около 30 000 ₽ в месяц. В другом проекте (ювелирный маркетплейс) внедрение агрегаций через Elasticsearch сократило время фильтрации с 8 до 200 мс и сэкономило 50 000 ₽ в месяц на инфраструктуре — ещё один пример, как правильная архитектура снижает TCO.

Что такое race condition в корзине и как его избежать?

Checkout — место, где деньги либо попадают на счёт, либо нет. Технические проблемы здесь стоят дорого.

Race condition при резервировании товара. Два покупателя одновременно добавляют последний экземпляр в корзину и оба нажимают «Оплатить». Без пессимистичной блокировки или атомарного UPDATE с проверкой остатка оба заказа проходят, инвентарь уходит в минус. В PostgreSQL:

UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
  AND (available - reserved) >= $quantity
RETURNING id;

Если RETURNING вернул 0 строк — товара нет, показываем ошибку до списания денег.

Идемпотентность платёжных вебхуков. payment.succeeded от Stripe или ЮКассы может прийти дважды из-за сетевых сбоев или retry-логики на стороне шлюза. Без проверки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублирование заказа или двойное зачисление. Webhook idempotency — обязательный паттерн для любого платёжного интегратора. Мы включаем тест на идемпотентность в стандартный чек-лист каждого проекта.

Checkout в несколько шагов. Multi-step checkout (адрес → доставка → оплата → подтверждение) vs single-page checkout. Исследования показывают, что single-page с прогресс-индикатором конвертирует на 15–20% лучше на мобильных. Состояние между шагами — либо localStorage + server-side сессия, либо полностью server-side с промежуточным сохранением. Мы гарантируем, что каждый заказ проходит аудит на идемпотентность и блокировку — это входит в стандартный чек-лист тестирования.

Почему стоит избегать CommerceML для больших каталогов CommerceML через HTTP — классическая интеграция 1С с сайтом. 1С выгружает XML по расписанию, сайт импортирует. Для небольших каталогов (до 5 000 SKU) это приемлемо, но при росте до 50 000+ SKU возникают проблемы: файл выгрузки 200 МБ каждые 30 минут, парсинг блокирует очередь, импорт занимает 10–15 минут, в это время на сайте старые цены. Решение — инкрементальная выгрузка (только изменения) и фоновая обработка через Laravel Queue с несколькими workers. Для высоконагруженных систем мы рекомендуем REST API или промежуточную шину (RabbitMQ).

Интеграции: 1С, склад, доставка

1С — отдельная глава. Три распространённых способа интеграции:

  1. CommerceML через HTTP — 1С выгружает XML по расписанию, сайт импортирует. Работает для небольших каталогов, есть задержка синхронизации.
  2. REST API / OData от 1С — двусторонняя синхронизация в реальном времени. Требует настройки на стороне 1С, капризна к версиям конфигураций.
  3. Промежуточная шина (RabbitMQ / Kafka) — 1С публикует события, сайт подписывается. Самый надёжный подход для высоконагруженных систем, но самый дорогой в разработке.

Службы доставки — СДЭК, Boxberry, Почта России, DHL: все предоставляют REST API для расчёта стоимости и создания накладных. Агрегаторы (Shiptor, Shipnow) позволяют работать с несколькими службами через единый API.

Платёжные шлюзы

Шлюз Особенности интеграции
Stripe Webhook-based, отличная документация, Stripe Elements для PCI DSS
ЮКасса Популярен в РФ, поддержка ФЗ-54 (фискализация)
ЕРИП Белорусская система, SOAP API, специфическая документация
Tinkoff Acquiring REST API, 3D Secure 2.0, webhook-уведомления

Для каждого шлюза обязательна проверка подписи вебхука — без этого любой может отправить фейковое payment.succeeded.

CMS vs собственная разработка

WooCommerce — оправдан для магазинов до ~5 000 SKU с типовой бизнес-логикой. Быстрый старт, огромная экосистема плагинов. Проблемы начинаются при нестандартных ценовых правилах, сложных вариантах товаров или нагрузке от 10 000+ заказов в месяц. Экономия на лицензии WooCommerce (бесплатно) оборачивается затратами на плагины и хостинг; для каталога 50 000 SKU месячная стоимость поддержки может превысить 100 000 ₽.

OpenCart, Prestashop — аналогичная история. Хороши для старта, ограничены при росте.

Собственная разработка на Laravel — для:

  • Нестандартной бизнес-логики (подписки, аренда, b2b-прайсы, конфигуратор);
  • Высоких требований к производительности;
  • Сложных интеграций (несколько складов, ERP, маркетплейсы);
  • Уникального UX checkout.

Как мы разрабатываем интернет-магазин: пошаговый процесс

  1. Аналитика и проектирование. Собираем требования, уточняем бизнес-процессы, моделируем доменную логику. На выходе — техническое задание и архитектурная схема.
  2. Backend и API. Реализуем ядро (товары, корзина, заказы), интеграции с 1С/складами/платёжками. Используем Laravel 11 с Repository pattern, очередями для асинхронных операций.
  3. Frontend и checkout. Настраиваем React 18 / Next.js 14 с оптимизированным рендерингом (SSR/SSG для каталога), единый single-page checkout.
  4. Тестирование. Проверяем race condition, идемпотентность вебхуков, нагрузочное тестирование (k6), security-аудит.
  5. Деплой и мониторинг. Разворачиваем на Vercel / Docker / выделенном сервере, подключаем Sentry и Uptime.

SEO для e-commerce

Canonical и дублирование. Фасетная фильтрация генерирует тысячи URL (?color=red&size=M&sort=price). Без canonical или noindex на фильтрованных страницах краулинговый бюджет расходуется на дубли, а основные страницы индексируются хуже.

Structured data. Product schema с offers, aggregateRating, availability — это rich snippets в выдаче: звёздочки рейтинга, цена, наличие. Влияет на CTR.

Core Web Vitals на страницах товаров. Hero image товара — это LCP element. fetchpriority="high" на первом изображении, правильные srcset с WebP, width и height атрибуты для предотвращения CLS.

Что входит в результат работы

После завершения проекта вы получаете:

  • Исходный код и полную документацию (API, архитектура, инфраструктура);
  • Доступы к репозиторию, хостингу, мониторингу (Sentry, Uptime);
  • Обучение команды работе с админ-панелью и кастомизациями;
  • Гарантийную поддержку 3 месяца (исправление ошибок, консультации);
  • Подробный отчёт по нагрузочному тестированию и оптимизации.

Ориентиры по срокам

Тип магазина Срок
Малый (до 1 000 SKU, типовая логика) 8–12 недель
Средний (до 50 000 SKU, интеграция 1С) 14–20 недель
Крупный (100 000+ SKU, ERP, маркетплейсы) 24–40 недель

Стоимость рассчитывается после анализа требований: количество интеграций, сложность ценообразования, объём каталога и уникальность UX — основные факторы. Оценим ваш проект бесплатно — закажите консультацию.

Чек-лист перед запуском

  • Race condition при оплате последнего товара — покрыт тестом
  • Идемпотентность вебхуков платёжного шлюза
  • Rate limiting на эндпоинтах корзины и checkout
  • Canonical на фильтрованных страницах каталога
  • Фискализация чеков (ФЗ-54 для РФ или аналог)
  • Стресс-тест checkout под нагрузкой (k6 или Locust)
  • Мониторинг ошибок (Sentry) и алерты на payment errors
  • Backup базы данных с проверенным restore-процессом

Гарантируем — каждый проект проходит этот чек-лист перед релизом. Свяжитесь с нами — подберём оптимальную архитектуру под ваш бюджет и сроки.