Уявіть: потрібно зібрати каталог товарів з сайту конкурента, а Selenium завантажує сторінку 30 секунд і споживає 200 МБ пам'яті. Ми вирішуємо це завдання за частку секунди — статичний HTML-парсинг без браузера. Просто HTTP-запит і розбір отриманого HTML. Жодних зайвих ресурсів, жодних очікувань. Один HTTP-запит — і HTML-документ готовий до розбору.
Ми використовуємо Cheerio (Node.js) і BeautifulSoup (Python) — перевірені інструменти, на яких реалізували понад 50 проєктів. Гарантуємо працездатність парсера після здачі та надаємо супровід протягом місяця. Оцінимо проєкт безкоштовно за 1–2 дні.
Коли це працює
Статичний парсинг підходить для сайтів на WordPress, 1C-Bitrix, класичних PHP/Ruby-додатках, де контент присутній у HTML-відповіді сервера без JavaScript-рендерингу. Перевірити просто: відкрити DevTools → Network → знайти основний HTML-документ → подивитися в Preview, чи є там потрібні дані. Якщо так — статичний парсинг спрацює. Для динамічних сайтів з JS-рендерингом потрібен браузерний парсер — ми комбінуємо підходи.
Проблеми, які ми вирішуємо
Типові труднощі при парсингу:
- N+1 запити при вилученні даних з детальних сторінок. Ми використовуємо пагінацію та паралельні запити з обмеженням concurrency.
- Антибот-захист (Cloudflare, reCAPTCHA). Для таких випадків комбінуємо статичний парсинг з браузерним обходом за необхідності.
- Великі обсяги даних — парсинг десятків тисяч сторінок. Використовуємо черги (Bull, Celery) та розподілені воркери. Обробляємо до 1000 сторінок за 10 хвилин без блокування.
Як ми це робимо
Кейс: парсинг каталогу інтернет-магазину на 1C-Bitrix.
Потрібно було вилучити 15 000 товарів з SKU, цінами, залишками та зображеннями. Використовували Cheerio + axios з ротацією User-Agent і затримкою 500 мс між запитами. Кожен товар знаходився в div.product-item з атрибутом data-id. Дані записували в PostgreSQL через batch-insert по 100 записів за раз. Весь парсинг зайняв 2 дні, включаючи налаштування CI/CD для щоденного оновлення. За допомогою Cheerio API ми вилучаємо дані за селекторами.
Приклад коду парсера на Cheerio
const axios = require('axios');
const cheerio = require('cheerio');
async function parseCatalog(url) {
const { data } = await axios.get(url, {
headers: { 'User-Agent': 'Mozilla/5.0' }
});
const $ = cheerio.load(data);
const items = [];
$('.product-item').each((i, el) => {
items.push({
id: $(el).attr('data-id'),
name: $(el).find('.name').text(),
price: $(el).find('.price').text()
});
});
return items;
}
Як вибрати між Cheerio та BeautifulSoup?
| Критерій | Cheerio (Node.js) | BeautifulSoup (Python) |
|---|---|---|
| Мова | JavaScript/TypeScript | Python |
| Швидкість розбору | Висока (jQuery-подібний движок) | Середня (lxml швидше в 3–5 разів) |
| Синтаксис | jQuery-селектори | CSS-селектори, методи .find() |
| Екосистема | axios, puppeteer для гібрида | httpx, requests, Selenium |
| Коли використовувати | Проєкти на Node.js, мікросервіси | Аналітика, машинне навчання, Jupyter |
Для простого збору даних з одного сайту обирайте ту мову, яка ближча вашій команді. Для високонавантажених систем Cheerio кращий завдяки асинхронності.
Чому статичний парсинг швидший за браузерний?
Браузерний парсер (Puppeteer, Playwright) запускає повноцінний браузер, рендерить JavaScript, завантажує стилі та скрипти. Це збільшує час завантаження сторінки в 5–10 разів і споживання пам'яті на 200–500 МБ на один екземпляр. Статичний парсинг робить лише HTTP-запит і розбирає HTML — швидкість вимірюється мілісекундами. На 1000 сторінок різниця може становити години проти днів.
| Параметр | Статичний парсинг | Браузерний парсинг |
|---|---|---|
| Швидкість | 100-500 мс на сторінку | 2-10 секунд на сторінку |
| Пам'ять | ~50 МБ | 200-500 МБ |
| Робота з JS | Ні | Повна підтримка |
| Складність обходу блокувань | Нижча | Вища |
| Ідеально для | WordPress, Bitrix, каталоги | SPA, динамічні інтерфейси |
Процес роботи
- Аналітика — вивчаємо структуру сайту, визначаємо джерела даних, перевіряємо наявність антибот-захисту.
- Проєктування — обираємо інструмент (Cheerio/BeautifulSoup), проєктуємо схему даних, плануємо пагінацію.
- Реалізація — пишемо парсер з обробкою помилок, ретраями, логуванням.
- Тестування — запускаємо на тестовій вибірці, перевіряємо повноту та коректність даних.
- Деплой — розгортаємо на сервері (Docker, cron-завдання), налаштовуємо моніторинг.
Що входить в роботу
- Код парсера з коментарями та обробкою помилок.
- Документація щодо запуску та підтримуваних селекторів.
- Налаштування автоматичного оновлення даних (за розкладом).
- Підтримка протягом 1 місяця після здачі (виправлення багів, адаптація під зміни сайту).
Строки орієнтовно
- Простий парсер (один сайт, декілька полів) — від 1 робочого дня.
- Середній (пагінація, декілька сторінок, авторизація) — 2–4 дні.
- Складний (антибот, обхід, інтеграція з БД) — до 5 днів.
Вартість розраховується індивідуально після аналізу цільового сайту. Замовте парсер під ключ — отримайте консультацію протягом години. Напишіть нам у Telegram або через форму на сайті. Економія часу на парсингу може сягати 90% порівняно з ручним збором.
Понад 5 років досвіду у веб-парсингу, понад 50 реалізованих проєктів. Гарантуємо працездатність парсера після здачі.







