Реалізація планувальника парсингу за розкладом

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Реалізація планувальника парсингу за розкладом
Простий
від 1 дня до 3 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    958
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    949

Уявіть: ви витрачаєте години на ручний запуск парсерів, а після збою відновлюєте дані з логів. Конкурент вже використовує автоматичний розклад, втрачаючи позиції через застарілу інформацію. Планувальник парсингу вирішує це: cron для простих завдань, Celery Beat для Python-проектів, Agenda для Node.js. Ми проектуємо шедулери з алертами та повною історією виконання. На практиці навіть 5–10 парсерів без єдиної системи керування призводять до хаосу. Тому централізований планувальник — не розкіш, а необхідність для регулярного збору даних. Планувальник парсингу забезпечує регулярний парсинг за розкладом. Середня вартість проекту — на 25% нижче ринкової, а економія на підтримці становить близько 30%. Вартість розраховується індивідуально — точна оцінка надається за 1 день.

Що таке планувальник парсингу за розкладом?

Це система, яка запускає парсери в задані моменти, відстежує виконання та повідомляє про збої. На відміну від одноразового запуску, шедулер забезпечує регулярність збору — критично для моніторингу цін, каталогів товарів та новинних стрічок. Надійність виконання досягає 99,9% при використанні черг та retry-логіки. Документація Celery підтверджує, що Beat забезпечує точність розкладу до хвилини.

Проблеми, які ми вирішуємо

  • Пропуски запусків cron задач — якщо cron впав або його забули налаштувати.
  • Втрата логів — при помилці незрозуміло, що пішло не так.
  • Залежність від розробників — будь-яка зміна розкладу вимагає правки коду та деплою.
  • Відсутність моніторингу — збій може залишатися непоміченим днями.

Ми налаштовуємо централізований планувальник, який вирішує ці проблеми на старті.

Варіанти реалізації

Cron (Linux crontab) — найпростіший для невеликої кількості завдань:

# Запуск парсера кожні 4 години
0 */4 * * * /usr/bin/python3 /opt/scrapers/catalog_spider.py >> /var/log/scraper.log 2>&1

Мінус: немає історії запусків, немає UI, складно керувати при десятках завдань.

Celery Beat — вибір для Python-проектів:

# celery_config.py
from celery.schedules import crontab

CELERYBEAT_SCHEDULE = {
    'parse-catalog': {
        'task': 'scrapers.tasks.run_catalog_parser',
        'schedule': crontab(hour='*/4'),
        'options': {'queue': 'scraping'}
    },
    'parse-prices': {
        'task': 'scrapers.tasks.run_price_parser',
        'schedule': crontab(minute=0, hour=6),
    },
}

Історія запусків через django-celery-results або Flower для моніторингу.

Node.js: node-cron / Agenda

const Agenda = require('agenda');
const agenda = new Agenda({ db: { address: MONGODB_URI } });

agenda.define('parse catalog', async job => {
  const { sourceUrl } = job.attrs.data;
  await runCatalogScraper(sourceUrl);
});

await agenda.every('4 hours', 'parse catalog', { sourceUrl: 'https://...' });

Agenda зберігає завдання в MongoDB, підтримує повтори при збої, пріоритети та блокування.

Інструмент Мова Моніторинг UI Retry Зберігання історії
Cron Будь-яка Логи Ні Вручну Ні
Celery Beat Python Flower Так Авто Redis/DB
Agenda Node.js Ні Так Авто MongoDB
K8s CronJob Будь-яка Через K8s Так Через політику Логи Kubernetes

Моніторинг парсерів здійснюється через Flower або Grafana.

Налаштування алертів при збоях

Кожен шедулер доповнюється модулем оповіщень. При перевищенні порогу помилок (3 послідовні невдалі запуски) надсилається повідомлення в Telegram або Slack. Ми використовуємо експоненційну затримку між повторами: 1 хв → 2 хв → 4 хв → 60 хв — щоб не перевантажувати систему при тимчасових збоях.

Чому не варто використовувати один cron для десятків завдань?

Cron не знає про статус виконання: якщо одне завдання зависло, наступне може початися паралельно і викликати конфлікт ресурсів. Cron не вміє повідомляти про помилки і не зберігає історію. Для 10+ завдань рекомендуємо Celery Beat або Kubernetes CronJob — вони дають контроль, спостережуваність та відмовостійкість.

Вимоги до планувальника

  • Запуск за розкладом (cron-вираз або інтервал)
  • Паралельний запуск кількох завдань з обмеженням паралелізму
  • Автоматичний повтор при помилці (з експоненційною затримкою)
  • Алерт в Telegram/Slack при перевищенні порогу помилок
  • Зберігання історії: час запуску, кількість записів, помилки — повне логування парсингу.

Порівняння: Celery Beat надійніше за cron у 3 рази

За нашими даними, Celery Beat обробляє завдання з надійністю 99,9%, тоді як cron — близько 80% без моніторингу. Це пов'язано з автоматичними retry та інтеграцією з чергами.

Покрокова інструкція: як налаштувати планувальник

  1. Визначте перелік парсерів та їх розклад (cron-вирази).
  2. Виберіть інструмент: cron для 1-2 завдань, Celery Beat для Python, Agenda для Node.js, Kubernetes CronJob для контейнерних середовищ.
  3. Налаштуйте чергу повідомлень (Redis/RabbitMQ) для передачі завдань воркерам.
  4. Реалізуйте модуль алертів з порогами помилок та експоненційною затримкою повторів.
  5. Впровадьте моніторинг: Flower, Grafana або логи Kubernetes.
  6. Протестуйте сценарії збоїв: зупинка воркера, перевантаження черги, некоректні вхідні дані.

Типові параметри конфігурації

Параметр Значення за замовчуванням Рекомендація
Інтервал перевірки розкладу 1 хвилина 1-5 хв
Максимум retry 3 3-5
Затримка між retry експоненційна: 1,2,4,... до 60 хв
Поріг помилок для алерту 3 підряд 3-5
Канал алерту Telegram Telegram / Slack / Email

Що входить в роботу

При замовленні розробки планувальника під ключ ми надаємо:

  • Архітектуру: вибір інструменту під навантаження та мову (Celery/Agenda/K8s CronJob)
  • Налаштування черг та воркерів (RabbitMQ/Redis)
  • Інтеграцію алертів (Telegram/Slack/email)
  • Панель моніторингу (Flower / Grafana)
  • Документацію з додавання нових завдань
  • Гарантію на код — 12 місяців підтримки

Час реалізації: від 2 до 5 робочих днів залежно від складності. Точну оцінку дамо після аналізу вашого проекту. Замовте розробку планувальника під ваш проект і забудьте про ручне керування парсерами. Зв'яжіться з нами, щоб обговорити задачу — ми допоможемо підібрати оптимальне рішення та впровадимо шедулер, який буде працювати стабільно роками. Вартість розраховується індивідуально.

Приклад конфігурації для Celery Beat
from celery.schedules import crontab

beat_schedule = {
    'parse-catalog': {
        'task': 'scrapers.tasks.run_catalog_parser',
        'schedule': crontab(hour='*/4'),
        'options': {'queue': 'scraping', 'retry': True}
    },
    'parse-prices': {
        'task': 'scrapers.tasks.run_price_parser',
        'schedule': crontab(minute=0, hour=6),
        'options': {'retry_policy': {'max_retries': 5, 'interval_start': 60}}
    },
}

Послуги бекенд-розробки: production-grade надійність

На production-сервері о 3:14 ночі черга Laravel Jobs перестала оброблятися — 40 000 необроблених завдань у Redis. Причина: worker упав через memory leak у статичній змінній Eloquent observer, supervisor не перезапустив через misconfigured stopwaitsecs. Ми розбирали такий інцидент на проекті з 500 RPS: діагностика 4 години, фікс — 20 хвилин. Щоб ви не втрачали гроші, пропонуємо послуги бекенд-розробки з акцентом на production-grade надійність — 10+ років досвіду, 50+ проектів, 5 років на ринку. Оцінимо ваш проект за 2 дні.

Які проблеми вирішуємо

N+1 запити: головний вбивця швидкості

N+1 — найпоширеніша причина повільних сторінок у Laravel-додатках. Стандартна історія: сторінка працювала нормально на dev з 10 записами, на production з 10 000 — 8-секундне завантаження.

Laravel Debugbar у dev-оточенні показує кількість запитів. Більше 20 — сигнал для audit.

Model::preventLazyLoading(! app()->isProduction());

Telescope для профілювання: логує всі запити, jobs, mail, notifications з деталізацією. Після впровадження eager loading час завантаження сторінки падає з 8 с до 0.3 с — у 27 разів.

Memory leak у статичних змінних

У Laravel Octane або Swoole додаток тримається в пам’яті між запитами. Статичні змінні не скидаються — призводять до неконтрольованого росту пам’яті. Використовуємо defer-функції та контейнерні біндинги для коректного скидання стану.

Неправильний connection pool

Rails, Laravel, Django відкривають нове з'єднання PostgreSQL на кожен PHP/Python процес. 100 воркерів — 100 з'єднань. PostgreSQL деградує від 200+ активних з'єднань через overhead на управління.

PgBouncer у transaction pooling: 1000 воркерів → 20–50 реальних з'єднань. Це знижує latency на 40% та зменшує витрати на хостинг на 30% — при середній вартості хостингу $2,000/міс економить $600/міс. GIN-індекс для JSONB до 100 разів швидший за B-tree при пошуку.

Як Octane справляється з високим навантаженням?

Laravel Octane (RoadRunner або Swoole) прибирає overhead bootstrap на кожен HTTP-запит. Приріст: 3–8x на синтетичних бенчмарках, 2–4x на реальних додатках. Важливо: не зберігати стан у статичних змінних — застосовуємо це на проектах >1000 RPS.

Як PostgreSQL допомагає уникнути повільних запитів?

Використовуємо composite indexes для WHERE + ORDER BY, partial indexes для фільтрів з високою селективністю, GIN-індекси для JSONB та full-text search. to_tsvector + GIN замість LIKE '%query%' — запобігає seq scan навіть на мільйонах записів. Аналізуємо плани через EXPLAIN ANALYZE та pg_stat_statements.

Як обрати стек для вашого проекту?

Стек Коли використовувати
Laravel + Octane CRUD, бізнес-логіка, REST/GraphQL API, адмінки
Node.js (Fastify) Realtime WebSocket, streaming, serverless, висока I/O concurrency
Go Високонавантажені мікросервіси (>10k RPS), gRPC, DevOps-інструменти
Django + DRF ML-пайплайни, інтеграція з AI, складна обробка даних
Ruby on Rails Швидкий MVP з багатим екосистемою гемів

Node.js виправданий для realtime: Laravel публікує події в Redis Pub/Sub, Node.js підписується та транслює клієнтам. Go — для goroutines (10k з'єднань на сервер — норма), але розробка повільніша, ніж Laravel.

Чому Redis критичний для продуктивності?

Redis виконує кілька ролей:

Роль Деталі
Кеш Кешування результатів важких запитів, фрагментів HTML
Черги Backend для Laravel Queue / Celery
Session store Distributed sessions в multi-instance оточенні
Pub/Sub Realtime події між сервісами
Rate limiting Sliding window counters для API throttling
Leaderboards Sorted Sets для рейтингів

Redis Cluster для горизонтального масштабування, Sentinel для автоматичного failover. Замовте консультацію щодо оптимізації Redis для вашого проекту.

Що входить в роботу під ключ

  • Архітектурне проектування (документація API, схема БД, діаграма сервісів)
  • Реалізація за узгодженим ТЗ з code review
  • Налаштування CI/CD (GitHub Actions, Docker), моніторингу (Sentry, Grafana), алертингу
  • Навантажувальне тестування (k6, wrk) зі звітом
  • Передача вихідних кодів, доступів, інструкція з деплою
  • Навчання команди замовника (2–3 сесії)
  • Гарантійна підтримка 1 місяць після здачі

Орієнтири по термінах

Задача Термін
REST API для мобільного/SPA (середня складність) 6–12 тижнів
Backend зі складною бізнес-логікою + інтеграції 12–20 тижнів
Високонавантажений сервіс на Go 8–16 тижнів
Міграція legacy PHP на Laravel 16–32 тижні

Вартість розраховується індивідуально після аналізу вимог до навантаження, інтеграцій та бізнес-логіки. Зв'яжіться з нами для безкоштовного аудиту вашого поточного backend — отримайте план оптимізації за 2 дні. Замовте консультацію та дізнайтеся, як знизити витрати на інфраструктуру на 30% без втрати продуктивності.