Парсер відгуків: автоматизація збору та імпорту з маркетплейсів

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Парсер відгуків: автоматизація збору та імпорту з маркетплейсів
Середній
~3-5 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    958
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    949

Збір та імпорт відгуків з маркетплейсів: розробка парсера

Ми розробляємо високопродуктивні парсери для автоматичного збору відгуків з маркетплейсів. Клієнт втратив 30% конверсії через застарілі відгуки — ручний збір займав години, дані не оновлювалися тижнями. Наша команда (5+ років досвіду, сертифіковані розробники, гарантія якості) створила рішення, яке збирає відгуки з Wildberries, Ozon, Яндекс.Маркету та інших майданчиків, нормалізує їх та імпортує в базу магазину. Економія часу — до 70%, або до $2000 на місяць на зарплаті менеджера. Окупність проєкту — 2–3 місяці. Замовте розробку парсера для вашого інтернет-магазину.

Типова ситуація: менеджер вручну копіює відгуки з 5 маркетплейсів по 200 товарів — це 8 годин на день. Автоматизація краще ручного збору в 60 разів за швидкістю: наш парсер виконує ту ж роботу за 8 хвилин. Дані оновлюються кожні 2 години, сторінки товарів — у реальному часі. Результат: зростання конверсії на 15% за перший місяць.

Технічно, кожен маркетплейс — свій головний біль. Wildberries дає JSON API з асинхронними httpx-запитами, але з обмеженням 1000 відгуків за сесію. Ozon — SPA на Nuxt, де дані підвантажуються через GraphQL, доводиться емулювати браузер через Playwright з ротацією User-Agent. Яндекс.Маркет змінює структуру раз на пів року, тому ми використовуємо адаптивний парсинг з fallback-стратегією та пулом резидентних проксі. Наш стек — Python для high-load майданчиків, PHP (Laravel) для інтеграції з вашим сайтом через черги (Queues) та Docker-контейнеризацію.

Підтримувані маркетплейси та методи

Площадка Метод Особливості
Wildberries JSON API Відкритий API, пагінація, до 1000 відгуків за сесію
Ozon Playwright SPA, потрібна авторизація, повільніше JSON в 50 разів
Яндекс.Маркет Unofficial API Rate limiting, потрібна ротація проксі
Google Reviews Places API Платний, офіційний, до 5 відгуків за запит (потрібна бізнес-підписка)
Otzovik.com HTML парсинг Капча на масових запитах, використовуємо Anti-Captcha
iHerb HTML / JSON API Структурований HTML, найпростіше

Порівняння методів: JSON-API (Wildberries) обробляє 1000 відгуків за 10 секунд, а Selenium на Ozon — ті ж 1000 за 5 хвилин. Різниця в 30 разів. Для продуктивності обираємо JSON, де можливо.

Як працює парсер Wildberries?

Приклад коду з асинхронними запитами (Python httpx)
# scraper/reviews/wildberries.py
import httpx
import asyncio
from dataclasses import dataclass
from typing import Optional

@dataclass
class Review:
    external_id: str
    product_nm_id: int
    author: str
    rating: int
    text: str
    pros: Optional[str]
    cons: Optional[str]
    date: str
    photos: list[str]
    helpful_count: int

class WildberriesReviewScraper:
    REVIEWS_URL = "https://feedbacks2.wb.ru/feedbacks/v2/{nm_id}"

    def __init__(self):
        self.client = httpx.AsyncClient(
            headers={
                "User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64)",
                "Origin": "https://www.wildberries.ru",
                "Referer": "https://www.wildberries.ru/",
            }
        )

    async def get_reviews(self, nm_id: int, take: int = 100) -> list[Review]:
        all_reviews = []
        skip = 0

        while True:
            url = self.REVIEWS_URL.format(nm_id=nm_id)
            params = {
                "immt": nm_id,
                "skip": skip,
                "take": take,
                "order": "dateDesc",
            }

            resp = await self.client.get(url, params=params)
            resp.raise_for_status()

            data = resp.json()
            feedbacks = data.get("feedbacks", [])

            if not feedbacks:
                break

            for fb in feedbacks:
                all_reviews.append(self._normalize(nm_id, fb))

            skip += take
            await asyncio.sleep(1.0)

            # Ограничение: не более 1000 отзывов за сессию
            if skip >= 1000:
                break

        return all_reviews

    def _normalize(self, nm_id: int, raw: dict) -> Review:
        photos = []
        for photo in raw.get("photos", []):
            if full_url := photo.get("fullSize"):
                photos.append(full_url)

        return Review(
            external_id=raw.get("id", ""),
            product_nm_id=nm_id,
            author=raw.get("wbUserDetails", {}).get("name", "Покупатель"),
            rating=raw.get("productValuation", 0),
            text=raw.get("text", ""),
            pros=raw.get("pros"),
            cons=raw.get("cons"),
            date=raw.get("createdDate", ""),
            photos=photos,
            helpful_count=raw.get("feedbackValuation", 0),
        )

Парсинг HTML-відгуків

Для сайтів без API використовуємо парсинг HTML через PHP і Symfony Crawler. Приклад для iHerb:

// app/Services/ReviewScraper/HtmlReviewScraper.php
class HtmlReviewScraper
{
    public function scrapeIherb(string $productUrl, int $pages = 5): array
    {
        $reviews = [];

        for ($page = 1; $page <= $pages; $page++) {
            $html = $this->fetch("{$productUrl}?p={$page}&is=1&s=6");
            $crawler = new Crawler($html);

            $items = $crawler->filter('[itemprop="review"]');
            if (!$items->count()) break;

            $items->each(function (Crawler $node) use (&$reviews) {
                $reviews[] = [
                    'external_id' => $node->attr('data-review-id'),
                    'author'      => trim($node->filter('[itemprop="author"]')->text('')),
                    'rating'      => (int) $node->filter('[itemprop="ratingValue"]')->attr('content'),
                    'date'        => $node->filter('[itemprop="datePublished"]')->attr('content'),
                    'title'       => trim($node->filter('[itemprop="name"]')->text('')),
                    'text'        => trim($node->filter('[itemprop="reviewBody"]')->text('')),
                    'helpful'     => (int) $node->filter('.helpful-yes')->text('0'),
                    'verified'    => $node->filter('.verified-buyer')->count() > 0,
                ];
            });

            sleep(rand(2, 4));
        }

        return $reviews;
    }
}

Дедуплікація та імпорт в Laravel

Після збору відгуки проходять через Job з дедуплікацією за external_id і source. Приклад:

// app/Jobs/ImportProductReviews.php
class ImportProductReviews implements ShouldQueue
{
    public int $tries = 3;
    public int $backoff = 120;

    public function handle(ReviewImportService $service): void
    {
        $mapping = ProductReviewMapping::where('product_id', $this->productId)
            ->where('source', $this->source)
            ->firstOrFail();

        $reviews = $this->scrape($mapping->external_id);

        $imported = 0;
        $skipped = 0;

        foreach ($reviews as $reviewData) {
            $exists = ProductReview::where([
                'source'      => $this->source,
                'external_id' => $reviewData['external_id'],
            ])->exists();

            if ($exists) {
                $skipped++;
                continue;
            }

            $service->import($this->productId, $this->source, $reviewData);
            $imported++;
        }

        Log::info("Reviews imported", [
            'product_id' => $this->productId,
            'source'     => $this->source,
            'imported'   => $imported,
            'skipped'    => $skipped,
        ]);
    }
}

Фільтрація та модерація

Стоп-слова (спам, реклама, ненормативна лексика), занадто короткі відгуки (<20 символів) та анонімізація авторів — все налаштовується. Нижче приклад сервісу:

// app/Services/ReviewImportService.php
class ReviewImportService
{
    private array $stopWords = ['купите', 'скидка', 'промокод', 'vk.com', 't.me'];

    public function import(int $productId, string $source, array $data): ?ProductReview
    {
        if (mb_strlen($data['text']) < 20) return null;

        foreach ($this->stopWords as $word) {
            if (mb_stripos($data['text'], $word) !== false) return null;
        }

        return ProductReview::create([
            'product_id'  => $productId,
            'source'      => $source,
            'external_id' => $data['external_id'],
            'author'      => $this->anonymizeAuthor($data['author']),
            'rating'      => max(1, min(5, (int) $data['rating'])),
            'text'        => $this->sanitize($data['text']),
            'pros'        => $this->sanitize($data['pros'] ?? ''),
            'cons'        => $this->sanitize($data['cons'] ?? ''),
            'date'        => $data['date'],
            'is_verified' => $data['verified'] ?? false,
            'helpful'     => $data['helpful'] ?? 0,
            'status'      => 'pending',
        ]);
    }

    private function anonymizeAuthor(string $name): string
    {
        $parts = explode(' ', trim($name));
        if (count($parts) >= 2) {
            return $parts[0] . ' ' . mb_substr($parts[1], 0, 1) . '.';
        }
        return $name ?: 'Покупатель';
    }

    private function sanitize(string $text): string
    {
        return strip_tags(trim($text));
    }
}

Structured data для SEO

Після імпорту відгуки публікуються в JSON-LD на сторінці товару. Це підвищує шанс потрапити в rich snippets і збільшує CTR на 20-30%. Детальніше про structured data на Wikipedia.

// app/Http/Controllers/ProductController.php
public function show(string $slug): Response
{
    $product = Product::withReviews()->findBySlug($slug);

    $reviewSchema = $product->reviews->map(fn($r) => [
        '@type'         => 'Review',
        'author'        => ['@type' => 'Person', 'name' => $r->author],
        'datePublished' => $r->date,
        'reviewBody'    => $r->text,
        'reviewRating'  => [
            '@type'       => 'Rating',
            'ratingValue' => $r->rating,
            'bestRating'  => 5,
        ],
    ]);

    $aggregateRating = [
        '@type'       => 'AggregateRating',
        'ratingValue' => round($product->reviews->avg('rating'), 1),
        'reviewCount' => $product->reviews->count(),
    ];
}

Як уникнути блокувань при парсингу?

Для обходу блокувань використовуємо пул з 50+ резидентних проксі, випадкові затримки від 1 до 4 секунд, ротацію User-Agent (Chrome, Firefox, Safari). Капчу розв'язуємо через Anti-Captcha. Кожна сесія обмежена 1000 відгуків.

Чому автоматизація відгуків підвищує SEO?

  • Structured data (JSON-LD) допомагає пошуковикам показувати рейтинг у снипеті.
  • UGC-тексти містять довгі хвости ключових слів.
  • Регулярне оновлення сигналізує про живий магазин.

Порівняння: ручний збір 100 відгуків займає 2 години, наш парсер — 2 хвилини, в 60 разів швидше. Економія бюджету на копірайтерів і модераторів — до 70% (до $2000 на місяць).

Процес роботи

  1. Аналіз: визначаємо майданчики, API, складність.
  2. Розробка: пишемо парсер, модерацію, дедуплікацію.
  3. Тестування: прогін на 1000+ відгуків, перевірка багів.
  4. Деплой: налаштування cron, моніторинг помилок.
  5. Документація: опис стеку, інструкція з запуску.
Етап Тривалість
Аналіз вимог 1-2 дні
Розробка парсера 2-3 дні на майданчик
Тестування 1-2 дні
Деплой і документація 1 день

Що входить в роботу

  • Парсер для кожного майданчика (до 5 майданчиків).
  • Модерація (стоп-слова, довжина, анонімізація).
  • Дедуплікація (по external_id + source).
  • Автоматичне оновлення за розкладом (щоденно або раз на 4 години).
  • Structured data на сторінці товару.
  • Логування та сповіщення про помилки.

Терміни: від 3 до 5 робочих днів на один майданчик. Для комплексного проєкту (3 майданчики + модерація + SEO) — 7-10 днів. Зв'яжіться з нами для оцінки вашого проєкту. Отримайте консультацію по вашому проєкту.

Розробка інтернет-магазинів

Ми знаємо: інтернет-магазин — це не просто «сайт з кошиком». Це розподілена система управління товарами, інвентарем, замовленнями, платежами, доставкою, поверненнями та комунікацією з клієнтами. Кожен блок має нетривіальну реалізацію, і більшість проблем в e-commerce виникає на стику цих підсистем. Наш досвід — понад 50 реалізованих проектів — показує, що правильна архітектура на старті економить до 40% бюджету на доробках.

Чому продуктивність каталогу деградує при зростанні SKU?

Найчастіша технічна проблема e-commerce — деградація сторінок категорій при збільшенні асортименту. Сторінка працює добре на 500 товарах і починає гальмувати на 10 000. Причини майже завжди одні й ті ж.

N+1 на атрибутах. Завантажуєте список товарів — 50 елементів. Для кожного потрібні категорія, головне фото, ціна з урахуванням знижки, наявність на складі, рейтинг. Без правильного eager loading це 250+ запитів на сторінку. В Laravel вирішується через with(['category', 'mainImage', 'currentPrice', 'stockStatus']) та withAvg('reviews', 'rating'). Але варто з'явитися персональним цінам (b2b) або складським залишкам по регіонах — і одного with() недостатньо. Потрібні Query Object або виділений ReadModel.

Фасетна фільтрація без індексів. Фільтр за кольором + розміром + брендом + діапазоном цін на таблиці в 500 000 записів без складених індексів — це seq scan при кожному запиті. PostgreSQL з правильними індексами тримає фасетну фільтрацію до кількох мільйонів товарів. Для великих каталогів — Elasticsearch або OpenSearch з агрегаціями: вони рахують кількість товарів на фільтр (facet counts) значно швидше.

Пагінація через OFFSET. LIMIT 50 OFFSET 10000 на великій таблиці — погана ідея: PostgreSQL все одно читає перші 10 050 рядків. Keyset pagination (cursor-based) через WHERE id > $last_id ORDER BY id LIMIT 50 працює за постійний час незалежно від сторінки. Як зазначено в документації PostgreSQL, cursor-based pagination гарантує O(log n) при будь-якому зміщенні, що особливо важливо для каталогів із сотнями тисяч товарів.

Конкретний кейс: каталог будівельних матеріалів, 180 000 SKU, фасетна фільтрація по 12 атрибутах. Після переходу з OFFSET-пагінації на курсорну та додавання partial index по (category_id, is_active, price) час відповіді сторінки каталогу знизився з 4,2 с до 280 мс. Економія на серверних ресурсах склала близько 30 000 ₽ на місяць. В іншому проекті (ювелірний маркетплейс) впровадження агрегацій через Elasticsearch скоротило час фільтрації з 8 до 200 мс та заощадило 50 000 ₽ на місяць на інфраструктурі — ще один приклад, як правильна архітектура знижує TCO.

Що таке race condition у кошику та як його уникнути?

Checkout — місце, де гроші або потрапляють на рахунок, або ні. Технічні проблеми тут коштують дорого.

Race condition при резервуванні товару. Два покупці одночасно додають останній екземпляр у кошик і обоє натискають «Оплатити». Без песимістичного блокування або атомарного UPDATE з перевіркою залишку обидва замовлення проходять, інвентар іде в мінус. В PostgreSQL:

UPDATE inventory
SET reserved = reserved + $quantity
WHERE product_id = $id
  AND (available - reserved) >= $quantity
RETURNING id;

Якщо RETURNING повернув 0 рядків — товару немає, показуємо помилку до списання грошей.

Ідемпотентність платіжних вебхуків. payment.succeeded від Stripe або ЮКассы може прийти двічі через мережеві збої або retry-логіку на стороні шлюзу. Без перевірки WHERE NOT EXISTS (SELECT 1 FROM processed_events WHERE event_id = $id) — дублювання замовлення або подвійне зарахування. Webhook idempotency — обов'язковий патерн для будь-якого платіжного інтегратора. Ми включаємо тест на ідемпотентність у стандартний чек-лист кожного проекту.

Checkout у кілька кроків. Multi-step checkout (адреса → доставка → оплата → підтвердження) vs single-page checkout. Дослідження показують, що single-page з прогрес-індикатором конвертує на 15–20% краще на мобільних. Стан між кроками — або localStorage + server-side сесія, або повністю server-side з проміжним збереженням. Ми гарантуємо, що кожне замовлення проходить аудит на ідемпотентність та блокування — це входить у стандартний чек-лист тестування.

Чому варто уникати CommerceML для великих каталогів CommerceML через HTTP — класична інтеграція 1С з сайтом. 1С вивантажує XML за розкладом, сайт імпортує. Для невеликих каталогів (до 5 000 SKU) це прийнятно, але при зростанні до 50 000+ SKU виникають проблеми: файл вивантаження 200 МБ кожні 30 хвилин, парсинг блокує чергу, імпорт займає 10–15 хвилин, в цей час на сайті старі ціни. Рішення — інкрементальне вивантаження (тільки зміни) та фонова обробка через Laravel Queue з кількома workers. Для високонавантажених систем ми рекомендуємо REST API або проміжну шину (RabbitMQ).

Як інтегрувати 1С з інтернет-магазином?

1С — окрема глава. Три поширених способи інтеграції:

  1. CommerceML через HTTP — 1С вивантажує XML за розкладом, сайт імпортує. Працює для невеликих каталогів, є затримка синхронізації.
  2. REST API / OData від 1С — двостороння синхронізація в реальному часі. Вимагає налаштування на стороні 1С, примхлива до версій конфігурацій.
  3. Проміжна шина (RabbitMQ / Kafka) — 1С публікує події, сайт підписується. Найнадійніший підхід для високонавантажених систем, але найдорожчий у розробці.

Служби доставки — СДЕК, Boxberry, Пошта Росії, DHL: всі надають REST API для розрахунку вартості та створення накладних. Агрегатори (Shiptor, Shipnow) дозволяють працювати з кількома службами через єдиний API.

Платіжні шлюзи

Шлюз Особливості інтеграції
Stripe Webhook-based, відмінна документація, Stripe Elements для PCI DSS
ЮКасса Популярний в РФ, підтримка ФЗ-54 (фіскалізація)
ЄРИП Білоруська система, SOAP API, специфічна документація
Tinkoff Acquiring REST API, 3D Secure 2.0, webhook-повідомлення

Для кожного шлюзу обов'язкова перевірка підпису вебхука — без цього будь-хто може відправити фейковий payment.succeeded.

CMS vs власна розробка

WooCommerce — виправданий для магазинів до ~5 000 SKU з типовою бізнес-логікою. Швидкий старт, величезна екосистема плагінів. Проблеми починаються при нестандартних цінових правилах, складних варіантах товарів або навантаженні від 10 000+ замовлень на місяць. Економія на ліцензії WooCommerce (безкоштовно) обертається витратами на плагіни та хостинг; для каталогу 50 000 SKU місячна вартість підтримки може перевищити 100 000 ₽.

OpenCart, Prestashop — аналогічна історія. Хороші для старту, обмежені при зростанні.

Власна розробка на Laravel — для:

  • Нестандартної бізнес-логіки (підписки, оренда, b2b-прайси, конфігуратор);
  • Високих вимог до продуктивності;
  • Складних інтеграцій (кілька складів, ERP, маркетплейси);
  • Унікального UX checkout.

Як ми розробляємо інтернет-магазин: покроковий процес

  1. Аналітика та проектування. Збираємо вимоги, уточнюємо бізнес-процеси, моделюємо доменну логіку. На виході — технічне завдання та архітектурна схема.
  2. Backend та API. Реалізуємо ядро (товари, кошик, замовлення), інтеграції з 1С/складами/платіжками. Використовуємо Laravel 11 з Repository pattern, чергами для асинхронних операцій.
  3. Frontend та checkout. Налаштовуємо React 18 / Next.js 14 з оптимізованим рендерингом (SSR/SSG для каталогу), єдиний single-page checkout.
  4. Тестування. Перевіряємо race condition, ідемпотентність вебхуків, навантажувальне тестування (k6), security-аудит.
  5. Деплой та моніторинг. Розгортаємо на Vercel / Docker / виділеному сервері, підключаємо Sentry та Uptime.

SEO для e-commerce

Canonical та дублювання. Фасетна фільтрація генерує тисячі URL (?color=red&size=M&sort=price). Без canonical або noindex на фільтрованих сторінках краулінговий бюджет витрачається на дублі, а основні сторінки індексуються гірше.

Structured data. Product schema з offers, aggregateRating, availability — це rich snippets у видачі: зірочки рейтингу, ціна, наявність. Впливає на CTR.

Core Web Vitals на сторінках товарів. Hero image товару — це LCP element. fetchpriority="high" на першому зображенні, правильні srcset з WebP, width та height атрибути для запобігання CLS.

Що входить у результат роботи

Після завершення проекту ви отримуєте:

  • Вихідний код та повну документацію (API, архітектура, інфраструктура);
  • Доступи до репозиторію, хостингу, моніторингу (Sentry, Uptime);
  • Навчання команди роботі з адмін-панеллю та кастомізаціями;
  • Гарантійну підтримку 3 місяці (виправлення помилок, консультації);
  • Детальний звіт по навантажувальному тестуванню та оптимізації.

Орієнтири за термінами

Тип магазину Термін
Малий (до 1 000 SKU, типова логіка) 8–12 тижнів
Середній (до 50 000 SKU, інтеграція 1С) 14–20 тижнів
Великий (100 000+ SKU, ERP, маркетплейси) 24–40 тижнів

Вартість розраховується після аналізу вимог: кількість інтеграцій, складність ціноутворення, обсяг каталогу та унікальність UX — основні фактори. Оцінимо ваш проект безкоштовно — замовте консультацію.

Чек-лист перед запуском

  • Race condition при оплаті останнього товару — покритий тестом
  • Ідемпотентність вебхуків платіжного шлюзу
  • Rate limiting на ендпоїнтах кошика та checkout
  • Canonical на фільтрованих сторінках каталогу
  • Фіскалізація чеків (ФЗ-54 для РФ або аналог)
  • Стрес-тест checkout під навантаженням (k6 або Locust)
  • Моніторинг помилок (Sentry) та алерти на payment errors
  • Backup бази даних з перевіреним restore-процесом

Гарантуємо — кожен проект проходить цей чек-лист перед релізом. Зв'яжіться з нами — підберемо оптимальну архітектуру під ваш бюджет та терміни.