Проксі-ротація для парсингу: пул, моніторинг, обхід блокувань

Наша компанія займається розробкою, підтримкою та обслуговуванням сайтів будь-якої складності. Від простих односторінкових сайтів до масштабних кластерних систем, побудованих на мікро сервісах. Досвід розробників підтверджено сертифікатами від вендорів.

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Проксі-ротація для парсингу: пул, моніторинг, обхід блокувань
Середній
від 1 дня до 3 днів
Часті запитання

Наші компетенції:

Етапи розробки

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1362
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1253
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    958
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1190
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    931
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    949

Реалізація проксі-ротації для парсингу

При промисловому парсингу одна IP-адреса швидко блокується: сайти фіксують високу частоту запитів і видають 403 або 429. Втрати даних при цьому сягають 40%. Ручна зміна проксі неефективна — потрібне автоматичне рішення. Ми будуємо систему, яка розподіляє запити по пулу адрес, виводить заблоковані на карантин і зважено обирає найнадійніші проксі. Досвід показує: грамотна ротація підвищує збір даних до 99,5%.

Як працює зважений вибір проксі?

Кожен проксі в пулі зберігає статистику успішних і невдалих запитів. Ротатор обчислює success_rate як відношення успішних запитів до загальної кількості. При виборі адреси використовується зважена випадковість: проксі з коефіцієнтом 0.92 обирається в 7 разів частіше, ніж з 0.5. Якщо проксі повертає помилку (403, 429, таймаут), він поміщається на карантин на 15 хвилин (налаштовується). Це запобігає повторним спробам через свідомо заблокований IP.

Request → Proxy Selector
              ↓
         [Proxy Pool]
         192.168.1.1:8080  ← статус: OK, 245 запитів, скор 0.92
         10.0.0.5:3128     ← статус: OK, 198 запитів, скор 0.88
         172.16.0.2:8080   ← статус: BLOCKED, на карантині
              ↓
         Target Site
              ↓
         Response Checker
         (статус 200 → success / 403/429 → fail)

Як інтегрувати ротатор із aiohttp?

Інтеграція будується на asyncio та aiohttp. Функція fetch отримує проксі з ротатора, виконує запит і звітує про успіх. При помилці проксі йде на карантин, і наступний запит отримає іншу адресу. Це дозволяє обробляти до 1000 запитів на хвилину без блокувань.

import asyncio
import aiohttp
from dataclasses import dataclass, field
from datetime import datetime, timedelta

@dataclass
class ProxyEntry:
    url: str
    success: int = 0
    fail: int = 0
    blocked_until: datetime = field(default_factory=lambda: datetime.min)

    @property
    def is_available(self):
        return datetime.now() > self.blocked_until

    @property
    def success_rate(self):
        total = self.success + self.fail
        return self.success / total if total > 0 else 0.5

class ProxyRotator:
    def __init__(self, proxies: list[str], quarantine_minutes=15):
        self.pool = [ProxyEntry(url=p) for p in proxies]
        self.quarantine = timedelta(minutes=quarantine_minutes)
        self._lock = asyncio.Lock()

    async def get(self) -> ProxyEntry:
        async with self._lock:
            available = [p for p in self.pool if p.is_available]
            if not available:
                raise RuntimeError("All proxies are blocked")
            weights = [p.success_rate for p in available]
            return random.choices(available, weights=weights)[0]

    async def report(self, proxy: ProxyEntry, success: bool):
        async with self._lock:
            if success:
                proxy.success += 1
            else:
                proxy.fail += 1
                proxy.blocked_until = datetime.now() + self.quarantine
async def fetch(session, url, rotator):
    proxy = await rotator.get()
    try:
        async with session.get(url, proxy=proxy.url, timeout=10) as resp:
            if resp.status in (403, 429, 503):
                await rotator.report(proxy, success=False)
                return None
            await rotator.report(proxy, success=True)
            return await resp.text()
    except Exception:
        await rotator.report(proxy, success=False)
        return None

Чому зважений вибір кращий за випадковий?

Випадковий вибір проксі перевантажує систему помилками: погані адреси отримують стільки ж запитів, скільки хороші. Зважений підхід, заснований на success_rate, аналогічний методу експоненційного згладжування — чим довше проксі працює стабільно, тим частіше він використовується. Це знижує кількість повторних запитів на 30% — зважений вибір у 1.5 раза швидший за випадковий. Додатково ми впроваджуємо моніторинг проксі: кожні 5 хвилин перевіряємо доступність пулу та автоматично виключаємо довго заблоковані адреси.

Порівняння пулів: резидентні vs ISP vs дата-центр

Тип проксі Швидкість Анонімність Вартість ($/IP/міс) Стійкість до блокувань
Резидентні Низька Висока ~2-5 Дуже висока
ISP Середня Середня ~1-3 Висока
Дата-центр Висока Низька ~0.5-1 Низька

Резидентні проксі (наприклад, від Bright Data) дають найкращий обхід блокувань, але дорожчі — економія бюджету досягається за рахунок меншої кількості повторних запитів (до 40% економії). ISP-проксі (Oxylabs) — золота середина для парсингу інтернет-магазинів. Дата-центр підходить лише для швидких прототипів, де допустимі тимчасові блокування.

Що робити, якщо всі проксі в карантині?

Алгоритм перевіряє blocked_until для кожної адреси. Якщо всі недоступні, викидається виняток — це сигнал для оператора. На практиці ми рекомендуємо резервний пул із 5–10 проксі зі збільшеним часом очікування між запитами. При пулі з 20 резидентних проксі з налаштуваннями за замовчуванням парсер працює без простоїв у 99% випадків. У складних сценаріях автоматично збільшуємо quarantine_minutes до 30, щоб знизити навантаження на пул.

Етапи впровадження системи ротації

  1. Аналіз цільових сайтів: визначення таргетингу, лімітів запитів, типів блокувань.
  2. Вибір проксі-провайдера: підбір оптимального пулу (резидентні/ISP/мікс) під бюджет і завдання.
  3. Розробка ротатора: реалізація зваженого вибору, карантину та моніторингу.
  4. Інтеграція з парсером: підключення aiohttp, обробка помилок, логування.
  5. Навантажувальне тестування: прогін 10 000 запитів, перевірка стабільності при пікових навантаженнях.

Вибір проксі-провайдера: порівняння за цільовими завданнями

Завдання Рекомендований провайдер Мінімальний пул
Парсинг інтернет-магазинів (RU) Oxylabs ISP 10 IP
Збір даних з соцмереж Bright Data Resident 20 IP
Швидке прототипування Smartproxy Datacenter 5 IP

Для більшості завдань достатньо 10–15 резидентних проксі від Smartproxy при адекватних затримках. Якщо потрібне глобальне покриття, обирайте Bright Data — їхній пул включає 72 млн IP.

Що входить у результат

  • Архітектура системи ротації з документацією
  • Вихідний код на Python із asyncio та інтеграцією з aiohttp
  • Інструкція з розгортання (Docker, налаштування моніторингу)
  • Двотижнева підтримка після впровадження

Ми займаємося розробкою систем парсингу більше 5 років (5+ років досвіду), реалізували 15+ проєктів із проксі-ротацією. Всі рішення проходять навантажувальне тестування та супроводжуються гарантією стабільності. Отримайте консультацію — надішлемо оцінку за 1 день. Замовте реалізацію — впровадимо систему за 2–3 дні.

Строки

Базова система — 2–3 робочі дні. Під ключ з адаптацією під ваш стек — до 5 днів.

Послуги бекенд-розробки: production-grade надійність

На production-сервері о 3:14 ночі черга Laravel Jobs перестала оброблятися — 40 000 необроблених завдань у Redis. Причина: worker упав через memory leak у статичній змінній Eloquent observer, supervisor не перезапустив через misconfigured stopwaitsecs. Ми розбирали такий інцидент на проекті з 500 RPS: діагностика 4 години, фікс — 20 хвилин. Щоб ви не втрачали гроші, пропонуємо послуги бекенд-розробки з акцентом на production-grade надійність — 10+ років досвіду, 50+ проектів, 5 років на ринку. Оцінимо ваш проект за 2 дні.

Які проблеми вирішуємо

N+1 запити: головний вбивця швидкості

N+1 — найпоширеніша причина повільних сторінок у Laravel-додатках. Стандартна історія: сторінка працювала нормально на dev з 10 записами, на production з 10 000 — 8-секундне завантаження.

Laravel Debugbar у dev-оточенні показує кількість запитів. Більше 20 — сигнал для audit.

Model::preventLazyLoading(! app()->isProduction());

Telescope для профілювання: логує всі запити, jobs, mail, notifications з деталізацією. Після впровадження eager loading час завантаження сторінки падає з 8 с до 0.3 с — у 27 разів.

Memory leak у статичних змінних

У Laravel Octane або Swoole додаток тримається в пам’яті між запитами. Статичні змінні не скидаються — призводять до неконтрольованого росту пам’яті. Використовуємо defer-функції та контейнерні біндинги для коректного скидання стану.

Неправильний connection pool

Rails, Laravel, Django відкривають нове з'єднання PostgreSQL на кожен PHP/Python процес. 100 воркерів — 100 з'єднань. PostgreSQL деградує від 200+ активних з'єднань через overhead на управління.

PgBouncer у transaction pooling: 1000 воркерів → 20–50 реальних з'єднань. Це знижує latency на 40% та зменшує витрати на хостинг на 30% — при середній вартості хостингу $2,000/міс економить $600/міс. GIN-індекс для JSONB до 100 разів швидший за B-tree при пошуку.

Як Octane справляється з високим навантаженням?

Laravel Octane (RoadRunner або Swoole) прибирає overhead bootstrap на кожен HTTP-запит. Приріст: 3–8x на синтетичних бенчмарках, 2–4x на реальних додатках. Важливо: не зберігати стан у статичних змінних — застосовуємо це на проектах >1000 RPS.

Як PostgreSQL допомагає уникнути повільних запитів?

Використовуємо composite indexes для WHERE + ORDER BY, partial indexes для фільтрів з високою селективністю, GIN-індекси для JSONB та full-text search. to_tsvector + GIN замість LIKE '%query%' — запобігає seq scan навіть на мільйонах записів. Аналізуємо плани через EXPLAIN ANALYZE та pg_stat_statements.

Як обрати стек для вашого проекту?

Стек Коли використовувати
Laravel + Octane CRUD, бізнес-логіка, REST/GraphQL API, адмінки
Node.js (Fastify) Realtime WebSocket, streaming, serverless, висока I/O concurrency
Go Високонавантажені мікросервіси (>10k RPS), gRPC, DevOps-інструменти
Django + DRF ML-пайплайни, інтеграція з AI, складна обробка даних
Ruby on Rails Швидкий MVP з багатим екосистемою гемів

Node.js виправданий для realtime: Laravel публікує події в Redis Pub/Sub, Node.js підписується та транслює клієнтам. Go — для goroutines (10k з'єднань на сервер — норма), але розробка повільніша, ніж Laravel.

Чому Redis критичний для продуктивності?

Redis виконує кілька ролей:

Роль Деталі
Кеш Кешування результатів важких запитів, фрагментів HTML
Черги Backend для Laravel Queue / Celery
Session store Distributed sessions в multi-instance оточенні
Pub/Sub Realtime події між сервісами
Rate limiting Sliding window counters для API throttling
Leaderboards Sorted Sets для рейтингів

Redis Cluster для горизонтального масштабування, Sentinel для автоматичного failover. Замовте консультацію щодо оптимізації Redis для вашого проекту.

Що входить в роботу під ключ

  • Архітектурне проектування (документація API, схема БД, діаграма сервісів)
  • Реалізація за узгодженим ТЗ з code review
  • Налаштування CI/CD (GitHub Actions, Docker), моніторингу (Sentry, Grafana), алертингу
  • Навантажувальне тестування (k6, wrk) зі звітом
  • Передача вихідних кодів, доступів, інструкція з деплою
  • Навчання команди замовника (2–3 сесії)
  • Гарантійна підтримка 1 місяць після здачі

Орієнтири по термінах

Задача Термін
REST API для мобільного/SPA (середня складність) 6–12 тижнів
Backend зі складною бізнес-логікою + інтеграції 12–20 тижнів
Високонавантажений сервіс на Go 8–16 тижнів
Міграція legacy PHP на Laravel 16–32 тижні

Вартість розраховується індивідуально після аналізу вимог до навантаження, інтеграцій та бізнес-логіки. Зв'яжіться з нами для безкоштовного аудиту вашого поточного backend — отримайте план оптимізації за 2 дні. Замовте консультацію та дізнайтеся, як знизити витрати на інфраструктуру на 30% без втрати продуктивності.