Заказчик обратился с задачей: ежедневно собирать цены и остатки с 20 сайтов конкурентов. Через неделю после запуска первого скрипта на requests все IP заблокировала защита Cloudflare, а ещё через месяц изменилась вёрстка — данные перестали собираться вовсе. Так выглядит типичный провал без промышленного подхода. Мы разрабатываем системы, которые не ломаются: планировщик с приоритетами, ротация резидентных прокси, обход антибот-защит, нормализация и мониторинг. Наш опыт — 15+ проектов для e-commerce, агрегаторов и исследовательских задач. Экономия бюджета на сборе данных достигает 60%, окупаемость системы — 2-3 месяца. Если вам нужна надёжная система сбора данных, свяжитесь с нами для консультации.
Как обойти Cloudflare Bot Management?
Самый сложный кейс — Cloudflare с Bot Fight Mode. Решение: Playwright с реальным fingerprint браузера, обход через puppeteer-extra-plugin-stealth, имитация мышиных движений через CDP. Для особо стойких — ротация IP через резидентные прокси от BrightData или Oxylabs.
| Защита |
Метод обхода |
| Rate limiting |
Адаптивные задержки, распределение по IP |
| CAPTCHA (reCAPTCHA v2/v3) |
2captcha/Anti-Captcha API или обучение собственной модели |
| Cloudflare Bot Management |
Playwright с реальным fingerprint, TLS fingerprint (циклическая ротация) |
| JavaScript challenges |
Headless browser с полным выполнением JS |
| Honeypot-ссылки |
Фильтрация невидимых элементов перед обходом |
| IP reputation blocks |
Residential proxy (BrightData, Oxylabs, Smartproxy) |
Почему парсер ломается через месяц?
Веб-сайты меняют структуру каждые 3-4 недели. Без системы мониторинга вы узнаете о поломке только когда данные перестанут обновляться. Мы встраиваем автоматические проверки: сравнение DOM-схемы с эталоном, процент успешных извлечений, тесты на фикстурах. Типичный показатель стабильной работы — 95%+ успешных парсингов.
Архитектура масштабируемой системы парсинга
Планировщик и очередь задач
Celery с Redis или RabbitMQ — проверенный выбор. Каждый URL — задача с приоритетом, retry-политикой и TTL. Scrapy-cluster или собственный оркестратор координирует воркеры. Используем Python 3.12, Celery 5.3, Redis 7.
Загрузчик страниц
Два режима:
- Статические —
httpx с async, connection pooling, keep-alive
- JavaScript-рендеринг — Playwright 1.40 (предпочтительно) или Puppeteer, headless Chromium с управлением профилями
Ротация идентификаторов
Пул прокси (residential или datacenter), смена User-Agent из реальных fingerprint-датасетов, случайные задержки с нормальным распределением, управление куки-сессиями.
Извлечение данных
CSS-селекторы или XPath для стабильных структур. Для сложной логики — parsel (обёртка над lxml). Если структура нестабильна — LLM-экстракция через OpenAI или локальную Ollama с few-shot промптами.
Хранение и нормализация
Raw HTML в S3/MinIO для повторной обработки. Извлечённые данные — PostgreSQL 16 или ClickHouse (для аналитики по миллиардам записей). Дедупликация по URL-хешу + content-hash.
Сравнение подходов: Celery vs Argo Workflows
| Критерий |
Celery |
Argo Workflows |
| Простота настройки |
Низкая (Python-стек) |
Средняя (Kubernetes) |
| Масштабирование |
100+ воркеров |
1000+ воркеров |
| Время отклика на сбой |
Минуты |
Секунды |
| Сообщество |
Большое |
Растущее |
Для большинства проектов Celery — оптимальный выбор: быстрее внедряется, легче поддерживать. Argo — для Kubernetes-инфраструктур с жёсткими SLA.
Архитектура для высоконагруженного парсинга
[Scheduler] -> [Redis Queue] -> [Fetcher Workers x N]
|
[Parser Workers x M]
|
[Raw Store S3] + [DB Writer]
|
[Monitor / Dashboard]
Fetcher и Parser — разные воркеры. Fetcher I/O bound (100+ async задач на процесс), Parser CPU bound (1 процесс на ядро).
Как настроить парсер за 5 шагов
- Анализ источников: изучите структуру целевых сайтов, определите объём данных и частоту обновления.
- Выбор стека: определите, нужен ли JS-рендеринг, какой тип прокси, какую СУБД.
- Реализация извлечения: напишите селекторы или XPath для каждого поля, протестируйте на фикстурах.
- Настройка мониторинга: добавьте алерты на падение процента успешных парсингов и изменение DOM.
- Деплой и обкатка: разверните систему на сервере, прогоните тестовый период 2-3 дня.
Правовые и этические аспекты
Перед запуском: проверка robots.txt, анализ ToS сайта, оценка нагрузки. Для публичных данных это обычно приемлемо. Для закрытых разделов — требуется разрешение. Мы всегда консультируем по legal-рискам.
Процесс работы и сроки
Что входит в работу
- Архитектура системы под ваши источники
- Реализация кода с документацией
- Настройка мониторинга и алертов
- Обучение вашей команды
- Поддержка 1 месяц после запуска
- Гарантия стабильной работы (согласно SLA)
Сроки реализации
| Этап |
Срок |
| Базовый парсер одного сайта |
3-5 дней |
| Очередь + ротация прокси + retry |
5-7 дней |
| JS-рендеринг + антибот-обход |
7-14 дней |
| Мониторинг, нормализация, хранение |
5-10 дней |
| Полная система под 10+ источников |
4-8 недель |
Сценарии использования и обслуживание
Мониторинг конкурентов. Цены, ассортимент, наличие — сбор раз в час с историей. Экономия до 60% времени ваших аналитиков.
Агрегация объявлений. OLX, Avito-подобные площадки: десятки тысяч записей в сутки, дедупликация, геокодирование.
Исследовательские задачи. Сбор датасетов для ML, мониторинг тональности, анализ SEO-позиций.
Контентные проекты. Синдикация новостей, агрегация вакансий, каталоги из открытых источников.
Обслуживание системы
Хорошо спроектированная система — не разовая разработка, а инфраструктура с жизненным циклом. Закладывайте 20% времени от разработки в год на поддержку. Мы гарантируем быструю реакцию на поломки.
Оценим ваш проект за 1 день — напишите нам. Закажите разработку системы парсинга под ключ и получите консультацию по архитектуре.
Услуги бэкенд-разработки: Laravel, Node.js, Go, Django, PostgreSQL
На production-сервере в 3:14 ночи очередь Laravel Jobs перестала обрабатываться. 40 000 необработанных задач в Redis. Причина: worker упал из-за memory leak в одном из Jobs (утечка через статическую переменную в Eloquent observer), supervisor не перезапустил его из-за misconfigured stopwaitsecs. Это не гипотетический сценарий — это вторник. Мы разбирали такой инцидент на проекте с нагрузкой 500 RPS: диагностика заняла 4 часа, фикс — 20 минут. Чтобы вы не теряли деньги на простоях, предлагаем услуги бэкенд-разработки с акцентом на production-grade надёжность. Оценим ваш проект за 2 дня.
Backend — это то, что работает когда никто не смотрит. Или не работает. Гарантируем, что у вас будет первый вариант.
Что мы делаем с первого дня правильно
Service Layer поверх Fat Controllers. Controller получает HTTP-запрос, валидирует его через Form Request, передаёт данные в Service, возвращает ответ. Бизнес-логика в Service, не в Controller. Это звучит банально, но большинство legacy-проектов — это контроллеры по 500 строк с SQL-запросами внутри.
Repository Pattern используем осторожно. Если вы просто оборачиваете Model::where(...) в метод репозитория — это бойлерплейт без пользы. Repository оправдан когда: нужно абстрагироваться от источника данных (БД + кеш + внешний API) или когда логика запросов достаточно сложна для изоляции.
Jobs, Events, Listeners. Всё, что можно сделать асинхронно — делаем асинхронно. Отправка email, генерация PDF, синхронизация с внешним API, пересчёт агрегатов — в Queue. Laravel Horizon для мониторинга очередей в Redis: видно throughput, failed jobs, время обработки по очередям.
Как Octane справляется с высокой нагрузкой
Laravel Octane с RoadRunner или Swoole держит приложение в памяти между запросами — убирает overhead bootstrap (загрузка конфигов, автозагрузка классов) на каждый HTTP-запрос. Прирост: 3–8x на синтетических бенчмарках, 2–4x на реальных приложениях. Важно: нельзя хранить состояние между запросами в статических переменных — это приводит именно к таким инцидентам, как в начале. Применяем это в проектах с >1000 RPS.
Что делать с N+1 запросами
N+1 — самая распространённая причина медленных страниц в Laravel-приложениях. Стандартная история: страница работала нормально на dev с 10 записями, на production с 10 000 — 8-секундная загрузка.
Laravel Debugbar в dev-окружении показывает количество запросов на страницу. Более 20 запросов на одну страницу — сигнал для audit.
Model::preventLazyLoading(! app()->isProduction());
Telescope для профилирования в staging: логирует все запросы, jobs, mail, notifications с детализацией по времени. Цифры: после внедрения eager loading время загрузки страницы падает с 8 с до 0.3 с — в 27 раз.
PostgreSQL: индексы, которые реально нужны
PostgreSQL 14+ — основная БД на всех проектах. Используем связку PgBouncer + PostgreSQL. Опыт 10+ лет, более 50 backend-проектов, 5 лет на рынке.
Как PostgreSQL помогает избежать медленных запросов
Composite indexes для частых WHERE + ORDER BY. Если у вас WHERE user_id = ? AND status = ? ORDER BY created_at DESC — нужен (user_id, status, created_at DESC). Индекс по (user_id) отдельно плохо помогает с сортировкой.
Partial indexes. Если 95% запросов идут по WHERE status = 'active':
CREATE INDEX idx_orders_active ON orders (created_at DESC)
WHERE status = 'active';
Индекс маленький, быстрый, покрывает основную нагрузку.
GIN-индексы для JSONB и массивов. @> оператор без GIN-индекса — seq scan. С индексом — быстро даже на миллионах записей.
GIN для full-text search. to_tsvector + GIN вместо LIKE '%query%'. LIKE без индекса — всегда seq scan. С pg_trgm extension и gin_trgm_ops — поддержка LIKE с индексом, полезно для CRM-поиска по частичному совпадению.
Connection pooling: почему важнее чем кажется
Rails, Laravel, Django открывают новое соединение с PostgreSQL на каждый PHP/Python процесс. На 100 воркерах — 100 соединений. PostgreSQL начинает деградировать от 200–300 активных соединений — overhead на управление соединениями становится значительным.
PgBouncer — connection pooler перед PostgreSQL. Режим transaction pooling: соединение с PostgreSQL занято только на время транзакции, между запросами возвращается в пул. 1000 приложений-воркеров → 20–50 реальных соединений к PostgreSQL. Это снижает latency на 40% и уменьшает затраты на хостинг на 30%.
Node.js с Fastify: когда это лучше Laravel
Node.js оправдан для:
- Realtime: WebSocket-серверы, Server-Sent Events, чат, live-обновления
- Streaming: большие файлы, видео, данные потоком
- High I/O concurrency: много параллельных запросов к внешним API без тяжёлой бизнес-логики
- Serverless: Lambda/Cloud Functions — Node.js стартует быстрее PHP
Fastify вместо Express: в 2–3 раза быстрее на benchmarks, встроенная JSON Schema валидация, лучшая TypeScript поддержка, plugin-архитектура.
Типичная архитектура realtime: Laravel — основная бизнес-логика и REST API. Node.js + Socket.io или ws — WebSocket сервер. Laravel публикует события в Redis Pub/Sub, Node.js подписывается и транслирует клиентам. Это разделение позволяет масштабировать WebSocket-сервер независимо от основного приложения.
Go: микросервисы и высокая нагрузка
Go используем для:
- Высоконагруженных микросервисов (> 10 000 RPS)
- Фоновых воркеров с жёсткими требованиями к latency
- Инструментов DevOps и CLI
- gRPC-сервисов в микросервисной архитектуре
Goroutines — дешевле OS-потоков в тысячи раз. 10 000 конкурентных соединений на Go — норма на одном сервере.
Но Go — не волшебная таблетка. Разработка медленнее чем на Laravel: больше бойлерплейта, нет ORM уровня Eloquent, обработка ошибок через if err != nil везде. Оправдан только когда производительность — реальное требование, не предположение.
Django и Python backend
Django с DRF (Django REST Framework) — для задач где нужен Python: ML-пайплайны, обработка данных, интеграции с AI-инструментами.
Celery для фоновых задач — аналог Laravel Queue, но сложнее в конфигурации. Celery Beat для cron-задач.
Django ORM vs raw SQL: ORM удобен для CRUD. Для аналитических запросов с несколькими JOIN, оконными функциями и CTE — connection.execute() с raw SQL читаемее и предсказуемее.
Redis: не только кеш
Redis в наших проектах выполняет несколько ролей:
| Роль |
Детали |
| Кеш |
Кеширование результатов тяжёлых запросов, фрагментов HTML |
| Очереди |
Backend для Laravel Queue / Celery |
| Session store |
Distributed sessions в multi-instance окружении |
| Pub/Sub |
Realtime события между сервисами |
| Rate limiting |
Sliding window counters для API throttling |
| Leaderboards |
Sorted Sets для рейтингов |
Redis Cluster для горизонтального масштабирования. Sentinel для автоматического failover на standalone установках.
Деплой и инфраструктура
Docker + docker-compose — стандарт для локальной разработки и production. Каждый сервис в контейнере: PHP-FPM/Octane, Nginx, PostgreSQL, Redis, Queue Worker, Scheduler.
CI/CD через GitHub Actions:
- Прогон тестов (PHPUnit / Pest, Vitest, Playwright)
- Сборка Docker-образа
- Push в Container Registry
- Deploy: docker pull → docker-compose up -d на сервере, или Kubernetes rolling update
Zero-downtime deploy для Laravel: php artisan down --secret=TOKEN не нужен при правильной настройке. Стратегия: новый контейнер стартует рядом со старым, Nginx переключает трафик после health check, старый контейнер останавливается.
Мониторинг: Sentry для exception tracking с alerting в Slack/Telegram. Grafana + Prometheus (или Grafana Cloud) для метрик: CPU, memory, request rate, queue depth, database connection count. Алерт на: error rate > 1%, p99 latency > 2s, queue depth > 1000 jobs.
Что входит в работу под ключ
- Архитектурное проектирование (документация API, схема БД, диаграмма сервисов)
- Реализация по согласованному ТЗ с code review
- Настройка CI/CD, мониторинга, алертинга
- Нагрузочное тестирование (k6, wrk) с отчётом
- Передача исходников, доступов, инструкция по деплою
- Обучение команды заказчика (2-3 сессии)
- Гарантийная поддержка 1 месяц после сдачи
Ориентиры по срокам
| Задача |
Срок |
| REST API для мобильного/SPA (средняя сложность) |
6–12 недель |
| Backend со сложной бизнес-логикой + интеграции |
12–20 недель |
| Высоконагруженный сервис на Go |
8–16 недель |
| Миграция legacy PHP на Laravel |
16–32 недели |
Стоимость рассчитывается индивидуально после анализа требований к нагрузке, интеграциям и бизнес-логике. Типичный бюджет backend-проекта — от 500 000 до 2 000 000 рублей в зависимости от сложности. Свяжитесь с нами для бесплатного аудита вашего текущего backend — получите план оптимизации за 2 дня. Закажите консультацию.