Торговий каталог на 100 000 позицій — порожні описи або копія з сайту постачальника. Ручне написання займе рік роботи команди копірайтерів, а регулярні оновлення роблять процес нескінченним. Дубльований контент — гарантований штраф від пошуковиків: Яндекс і Google знижують такі сторінки. SEO-спеціалісти бачать падіння трафіку, а менеджери витрачають години на ручне редагування кожної картки. Ми вирішуємо задачу автоматичним парсингом: видобуваємо, очищаємо, рерайтимо та записуємо в інфоблоки. У підсумку ви отримуєте унікальні описи без ручної праці — наповнення займає дні, а не роки.
Наші інженери підключають парсер до вашого проекту на 1С-Бітрікс. Використовуємо інфоблоки v2.0, HL-блоки та ORM. Пишемо на PHP 8.1+ з композером та строгою типізацією. Швидкість наповнення — до 20 разів швидше ручного введення. З AI-рерайтом через GPT економія бюджету сягає 70% — це втричі дешевше штатного копірайтера. Отримайте консультацію з автоматизації вашого каталогу: ми проаналізуємо ваші джерела та запропонуємо рішення.
Джерела описів
Вибір джерела визначає якість та правові ризики. Розглянемо основні варіанти:
- Сайт виробника — найрелевантніший контент, але часто важко парсити та містить copyright. Використовуйте як основу для рерайту, не як фінальний текст.
- Агрегатори (Яндекс.Маркет, OZON, Wildberries) — великий обсяг, стандартизований формат. Ті ж правові застереження.
- Офіційні дистриб'ютори — більш лояльні до використання контенту, часто зацікавлені в поширенні.
- Бази даних виробників (Icecat, Synccentric) — легальний варіант з API, платний, але дає чисті дані з ліцензією.
Парсинг з сайтів виробників часто порушує авторські права. Щоб уникнути претензій, ми орієнтуємося на легальні бази або використовуємо рерайт після видобування. У договорі фіксуємо відповідальність за контент.
Як автоматизувати рерайт за допомогою AI?
Після парсингу сирі описи потребують унікалізації. Використовуємо GPT API для генерації переписаного тексту. Процес:
- Парсимо вихідний контент з джерела.
- Очищаємо від сміття, залишаємо чистий текст.
- Відправляємо в GPT з промптом: «Перепиши опис товару, збережи характеристики та ключові слова, зміни структуру фраз».
- Записуємо результат в інфоблок: PREVIEW_TEXT (перший абзац) і DETAIL_TEXT (повний).
- Встановлюємо прапорець DESCRIPTION_SOURCE = 'parsed' для відстеження джерела.
Такий підхід дає унікальний контент, що не порушує авторських прав, і економить до 70% бюджету на копірайтинг — це десятки тисяч гривень щомісяця. З AI-рерайтом ви отримуєте опис, який пошуковики не вважають дублем — різниця з вихідником сягає 80% унікальності. Парсинг з AI-рерайтом окупається за 2–3 місяці.
Чому важливо захищати ручні правки?
Менеджери можуть вручну покращувати описи. Не перезаписувати наосліп — додаємо логіку:
- Якщо DETAIL_TEXT порожній — записуємо парсинговий текст з прапорцем DESCRIPTION_SOURCE.
- Якщо заповнений — пропускаємо елемент при оновленні. Прапорець відсутній? Значить, опис правили вручну — не чіпаємо.
Приклад коду: перевірка прапорця
if (empty($arFields['DETAIL_TEXT']) || $arFields['DESCRIPTION_SOURCE'] === 'parsed') { $el->Update($elementId, ['DETAIL_TEXT' => $newText, 'DESCRIPTION_SOURCE' => 'parsed']); } Усунення дублів контенту
Дублювання — головна проблема SEO. Рішення — рерайт після парсингу. Використовуйте GPT API для унікалізації: відправляйте текст з промптом «перепиши своїми словами, зберігши сенс та ключові слова». Або наймайте копірайтерів для вибіркової обробки топових позицій. Другий варіант — використовувати кілька джерел та змішувати описи через шаблонізатор.
Запис у поля Бітрікса
Бітрікс розділяє опис на два поля:
- PREVIEW_TEXT — короткий опис (для лістингу)
- DETAIL_TEXT — повний опис (для картки товару)
При парсингу довгого опису: перший абзац → PREVIEW_TEXT, повний текст → DETAIL_TEXT. Тип тексту задається полями PREVIEW_TEXT_TYPE та DETAIL_TEXT_TYPE (значення: text або html).
Оновлення елемента:
$el = new CIBlockElement(); $el->Update($elementId, [ 'PREVIEW_TEXT' => $shortDesc, 'PREVIEW_TEXT_TYPE' => 'html', 'DETAIL_TEXT' => $fullDesc, 'DETAIL_TEXT_TYPE' => 'html', ]); Документація CIBlockElement допоможе розібратися з іншими методами.
Порівняння джерел парсингу
| Джерело | Легальність | Унікальність | Вартість |
|---|---|---|---|
| Сайт виробника | Середня (залежить від політики) | Висока | Безкоштовно |
| Агрегатори | Низька (копія) | Низька | Безкоштовно |
| Дистриб'ютори | Висока | Середня | Безкоштовно / партнерство |
| Icecat / Synccentric | Повна ліцензія | Висока | Платний API |
Що входить у роботу
- Аналіз джерел та вибір структури видобування
- Розробка парсера з урахуванням захисту від блокувань
- Очищення та нормалізація тексту (HTMLPurifier, регулярні вирази)
- Інтеграція з інфоблоком: PREVIEW_TEXT та DETAIL_TEXT
- Захист ручних правок через прапорець DESCRIPTION_SOURCE
- Тестування на 100–200 позиціях
- Документація та навчання менеджерів
Таймлайн та вартість
| Етап | Термін |
|---|---|
| Аналіз джерел, вибір структури видобування | 2–4 години |
| Розробка парсера описів | 1–2 дні |
| Логіка очищення та нормалізації тексту | 4–8 годин |
| Інтеграція з інфоблоком, захист ручних правок | 4–6 годин |
| Тестування на 100–200 позиціях | 4 години |
Разом: 4–6 робочих днів. Якщо потрібен рерайт через AI після парсингу — додайте ще 1–2 дні на інтеграцію з GPT API. Вартість розраховується індивідуально під ваш проект.
Зв'яжіться з нами для оцінки вашого проекту — наповнимо каталог за 4–6 днів та зекономимо до 70% бюджету на написання текстів. Отримайте консультацію з автоматизації каталогу: ми проаналізуємо джерела, підберемо оптимальне рішення та запропонуємо реалізацію.







