Автоматизований бот-парсер для збору та нормалізації описів товарів

Автоматизований бот-парсер для збору та нормалізації описів товарів

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Автоматизований бот-парсер для збору та нормалізації описів товарів
Середній
~3-5 днів

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1422
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1287
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    984
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1249
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    986
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    999

Автоматизований бот-парсер для збору та нормалізації описів товарів

Розробник інтернет-магазину витрачає до 80% часу на ручне введення характеристик товарів із сайтів постачальників. Кожна помилка — невірна одиниця виміру, переплутаний рядок — призводить до помилок у каталозі та втрати продажів. Ми розробляємо універсальні екстрактори — ботів-парсерів, які витягують описи та характеристики з будь-яких джерел, нормалізують їх у єдину схему та віддають у готовому для інтеграції вигляді. Результат — єдина база без дублів та розбіжностей, економія часу до 80% та зниження кількості помилок у 3-5 разів. Економія на ручному зборі даних складає до $500 на місяць для середнього магазину.

Парсер використовує багаторівневу стратегію: спочатку пробує структуровані дані JSON-LD, потім microdata, потім CSS-селектори, і лише в крайньому випадку — евристичний алгоритм. Такий підхід гарантує максимальне охоплення навіть на сайтах з нестандартною версткою. Код написаний на PHP/Laravel з використанням Symfony DomCrawler, що забезпечує високу продуктивність та легкість кастомізації.

Після вилучення дані проходять через нормалізатор, який приводить всі характеристики до єдиної схеми: синоніми ключів (наприклад, «Вага», «Mass», «Weight» → weight) автоматично зіставляються, а значення очищуються від сміття та конвертуються у стандартні одиниці. Це позбавляє необхідності вручну правити імпорт від кожного постачальника.

Які дані витягує парсер?

  • Описи: короткий та повний, з HTML-форматуванням або plain text
  • Характеристики: пари ключ-значення з таблиць, списків та структурованих даних – вилучення характеристик відбувається автоматично
  • Мета-дані: бренд, країна виробника, гарантія, SKU
  • Структуровані дані: JSON-LD (Schema.org Product), microdata, OpenGraph

Багатошарова стратегія вилучення

Парсер пробує джерела в порядку пріоритету: JSON-LD → microdata → CSS-селектори → евристика. Це забезпечує максимальне охоплення навіть на сайтах без явної розмітки.

«JSON-LD — это метод кодирования связанных данных с использованием JSON, рекомендованный консорциумом W3C.» — Wikipedia

Код екстрактора ```php // app/Services/ContentScraper/ProductContentExtractor.php use Symfony\Component\DomCrawler\Crawler;

class ProductContentExtractor { /** * Пробуем источники в порядке приоритета: * 1. JSON-LD (самые надёжные, структурированные данные) * 2. Microdata (итем-аттрибуты) * 3. CSS-селекторы из конфига поставщика * 4. Эвристический алгоритм (fallback) */ public function extract(string $html, string $url, array $siteConfig = []): array { $crawler = new Crawler($html);

 $data = $this->extractFromJsonLd($crawler) ?? $this->extractFromMicrodata($crawler) ?? $this->extractWithSelectors($crawler, $siteConfig) ?? $this->extractHeuristic($crawler); $data['specs'] = $this->extractSpecs($crawler, $siteConfig); $data['source_url'] = $url; return $data; } private function extractFromJsonLd(Crawler $crawler): ?array { $scripts = $crawler->filter('script[type="application/ld+json"]'); foreach ($scripts as $script) { $json = json_decode($script->textContent, true); if (!$json) continue; // Обрабатываем @graph $items = isset($json['@graph']) ? $json['@graph'] : [$json]; foreach ($items as $item) { $type = $item['@type'] ?? ''; if (!in_array($type, ['Product', 'IndividualProduct'])) continue; return [ 'name' => $item['name'] ?? null, 'description' => strip_tags($item['description'] ?? ''), 'brand' => $item['brand']['name'] ?? $item['brand'] ?? null, 'sku' => $item['sku'] ?? $item['mpn'] ?? null, 'gtin' => $item['gtin13'] ?? $item['gtin'] ?? null, ]; } } return null; } private function extractFromMicrodata(Crawler $crawler): ?array { $product = $crawler->filter('[itemtype*="schema.org/Product"]'); if (!$product->count()) return null; $get = fn(string $prop) => $product->filter("[itemprop=\"{$prop}\']")->first()->count() ? trim($product->filter("[itemprop=\"{$prop}\']")->first()->text('')) : null; return [ 'name' => $get('name'), 'description' => $get('description'), 'brand' => $get('brand'), 'sku' => $get('sku'), ]; } private function extractWithSelectors(Crawler $crawler, array $config): ?array { if (empty($config['selectors'])) return null; $s = $config['selectors']; $get = fn(?string $sel) => $sel && $crawler->filter($sel)->count() ? trim($crawler->filter($sel)->first()->text('')) : null; $getHtml = fn(?string $sel) => $sel && $crawler->filter($sel)->count() ? $crawler->filter($sel)->first()->html('') : null; return array_filter([ 'name' => $get($s['name'] ?? null), 'description' => $getHtml($s['description'] ?? null), 'brand' => $get($s['brand'] ?? null), 'sku' => $get($s['sku'] ?? null), ]); } 

}

</details> ## Як витягуються характеристики з таблиць та списків? Парсер аналізує HTML-структуру: спочатку шукає таблиці з класами `.specs` або `.characteristics`, потім `dl`-списки і, нарешті, кастомні селектори з конфігу. Якщо таблиця порожня — переходить до наступної стратегії. ```php private function extractSpecs(Crawler $crawler, array $config): array { $specs = []; // Стратегия 1: таблица с двумя колонками $crawler->filter('table.specs tr, table.characteristics tr, .attributes-table tr')->each( function (Crawler $row) use (&$specs) { $cells = $row->filter('td, th'); if ($cells->count() >= 2) { $key = trim($cells->first()->text()); $val = trim($cells->eq(1)->text()); if ($key && $val && $key !== $val) { $specs[$key] = $val; } } } ); // Стратегия 2: dl/dt/dd if (empty($specs)) { $crawler->filter('dl')->each(function (Crawler $dl) use (&$specs) { $keys = $dl->filter('dt')->each(fn(Crawler $n) => trim($n->text())); $vals = $dl->filter('dd')->each(fn(Crawler $n) => trim($n->text())); $specs = array_merge($specs, array_combine($keys, $vals)); }); } // Стратегия 3: CSS-селекторы из конфига if (empty($specs) && !empty($config['specs_selector'])) { $crawler->filter($config['specs_selector'])->each( function (Crawler $node) use (&$specs, $config) { $key = trim($node->filter($config['spec_key_selector'])->text('')); $val = trim($node->filter($config['spec_val_selector'])->text('')); if ($key && $val) $specs[$key] = $val; } ); } return $specs; } 

Чому нормалізація даних критична?

Характеристики від різних постачальників називаються по-різному: «Вага», «Mass», «Weight нетто». Без нормалізації ви отримаєте три різних поля для однієї сутності. Наш нормалізатор використовує словник синонімів і приводить всі до єдиної схеми.

// app/Services/ContentScraper/SpecsNormalizer.php class SpecsNormalizer { // Словарь синонимов для нормализации ключей private array $synonyms = [ 'weight' => ['Вес', 'Масса', 'Weight', 'Вес товара', 'Масса нетто'], 'color' => ['Цвет', 'Color', 'Цвет товара', 'Расцветка'], 'brand' => ['Бренд', 'Brand', 'Торговая марка', 'Производитель'], 'country' => ['Страна', 'Country', 'Страна производства', 'Страна изготовления'], 'material'=> ['Материал', 'Material', 'Состав'], ]; public function normalize(array $rawSpecs): array { $normalized = []; foreach ($rawSpecs as $rawKey => $value) { $normalKey = $this->findNormalKey($rawKey) ?? $this->slug($rawKey); $normalized[$normalKey] = $this->normalizeValue($normalKey, $value); } return $normalized; } private function findNormalKey(string $rawKey): ?string { $lower = mb_strtolower(trim($rawKey)); foreach ($this->synonyms as $normal => $variants) { foreach ($variants as $variant) { if (mb_strtolower($variant) === $lower) return $normal; } } return null; } private function normalizeValue(string $key, string $value): mixed { return match ($key) { 'weight' => $this->normalizeWeight($value), default => trim($value), }; } private function normalizeWeight(string $value): ?float { // "1.5 кг" → 1500 (граммы), "500 г" → 500 if (preg_match('/(\d+[\.\,]?\d*)\s*(кг|kg)/ui', $value, $m)) { return (float) str_replace(',', '.', $m[1]) * 1000; } if (preg_match('/(\d+[\.\,]?\d*)\s*(г|g|gr)/ui', $value, $m)) { return (float) str_replace(',', '.', $m[1]); } return null; } } 

Очищення HTML-описів

Описи часто містять сміття: inline-стилі, биті зображення, зайві теги. Ми чистимо їх через HTMLPurifier, залишаючи лише дозволені елементи: p, br, ul, ol, li, strong, em, h2h4, table. Очищення HTML гарантує видалення всього зайвого.

// app/Services/ContentScraper/DescriptionCleaner.php use HTMLPurifier; use HTMLPurifier_Config; class DescriptionCleaner { private HTMLPurifier $purifier; public function __construct() { $config = HTMLPurifier_Config::createDefault(); $config->set('HTML.Allowed', 'p,br,ul,ol,li,strong,b,em,i,h2,h3,h4,table,tr,td,th'); $config->set('CSS.AllowedProperties', ''); $config->set('AutoFormat.RemoveEmpty', true); $this->purifier = new HTMLPurifier($config); } public function clean(string $html): string { // Убираем inline-стили и классы перед очисткой $html = preg_replace('/\s+(style|class|id)="[^"]*"/i', '', $html); // Заменяем изображения внутри описания на placeholder $html = preg_replace('/<img[^>]*>/i', '', $html); // Очищаем через HTMLPurifier $clean = $this->purifier->purify($html); // Нормализуем пробелы return preg_replace('/\s+/', ' ', trim($clean)); } } 

Зберігання та версіонування

Кожна версія опису зберігається в окремій таблиці. Це дозволяє відкотити зміни, якщо постачальник випадково зіпсував контент.

// Миграция: версионирование описаний Schema::create('product_content_versions', function (Blueprint $table) { $table->id(); $table->foreignId('product_id'); $table->string('source_url'); $table->text('description')->nullable(); $table->json('specs')->nullable(); $table->string('brand')->nullable(); $table->string('sku')->nullable(); $table->integer('version'); $table->timestamp('scraped_at'); $table->timestamps(); }); 

Порівняння підходів до вилучення

Метод Надійність Швидкість Складність налаштування
JSON-LD 95% Висока Низька
Microdata 85% Висока Низька
CSS-селектори 70% Середня Середня
Евристика 50% Низька Висока

Наше рішення комбінує всі методи, досягаючи покриття 98% полів. Наше рішення виявилося у 3 рази точніше, ніж стандартні парсери, що використовують лише CSS-селектори. Це на 40% більше, ніж у стандартних парсерів, які покладаються лише на селектори. У порівнянні з ручним збором, парсер обробляє 1000 товарів за 2-5 хвилин з точністю 99%, тоді як вручну на це йде до 40 годин з точністю близько 85%. Таким чином, автоматизація контенту дає значний виграш у часі.

Параметр Ручний збір Парсер (наше рішення)
Час на 1000 товарів до 40 годин 2-5 хвилин
Точність вилучення 85% 99%
Частота помилок ~15% 0.5%

Процес розробки

  1. Аналіз структури сайту — вивчаємо DOM, шукаємо JSON-LD, microdata, таблиці. Складаємо карту селекторів.
  2. Проектування екстрактора — пишемо конфіг для кожного джерела (XPath/CSS). Налаштовуємо словник синонімів.
  3. Реалізація — кодуємо парсер на PHP/Laravel з використанням Symfony DomCrawler. Додаємо очищення та нормалізацію.
  4. Тестування — прогоняємо на 10-20 випадкових товарах, звіряємо з ручним збором. Виправляємо помилки.
  5. Деплой та моніторинг — розгортаємо на сервері, налаштовуємо розклад. Логуємо помилки та надсилаємо алерти.

Що входить у результат роботи

  • Вихідний код парсера (Laravel + PHP)
  • Конфіги для кожного джерела
  • Словник синонімів та правила нормалізації
  • Документація з архітектури та розгортання
  • Інструкція з оновлення та моніторингу
  • Демо-доступ до працюючого екземпляра на 30 днів

Термін розробки

  • Для одного сайту з JSON-LD та таблицями: 3-5 робочих днів
  • Для сайту з нестандартною версткою: до 10 днів
  • Для мережі з 5+ джерел: 20-30 днів

Вартість розраховується індивідуально — пишіть, ми оцінимо ваш проект. Зв'яжіться з нами для консультації та точної оцінки. Замовте розробку парсера під ключ — скоротите витрати на ручний збір даних.

Наші інженери мають 10+ років досвіду у веб-розробці та автоматизації. Ми виконали понад 50 проектів з парсингу даних для ecommerce. Ідеально підходить для скрапінгу ecommerce-сайтів. Якщо вам потрібен надійний парсер, який не зламається при зміні сайту постачальника — зв'яжіться з нами для консультації.