Инженерный подход к хранению спарсенных данных: PostgreSQL, версионирование, JSONB
Вы собрали 10 000 объявлений с Avito, а через неделю половина изменилась. CSV тут же превратится в кашу — изменения не отследить. MongoDB без строгой схемы — лишь отсрочка хаоса: со временем данные загрязняются. Нужна система, которая запомнит каждое изменение и позволит найти нужное за миллисекунды. Мы создаём такие решения — на базе PostgreSQL с версионированием, полнотекстовым поиском и REST API. Наша схема десятилетиями работает в продакшене. Документация PostgreSQL рекомендует GIN-индексы для JSONB, что даёт скорость и гибкость. Давайте разберём конкретную реализацию. Основная таблица scraped_items хранит актуальные данные, а scraped_items_history — архив изменений. Такой подход обеспечивает полный audit trail без потери производительности.
Схема хранения в PostgreSQL
-- Основная таблица с историей изменений
CREATE TABLE scraped_items (
id BIGSERIAL PRIMARY KEY,
source_id INTEGER REFERENCES sources(id),
external_id TEXT NOT NULL, -- ID на стороне источника
url TEXT NOT NULL,
data JSONB NOT NULL, -- гибкая схема для разных источников
data_hash CHAR(64) NOT NULL, -- SHA-256 от data для детекции изменений
first_seen TIMESTAMPTZ DEFAULT NOW(),
last_seen TIMESTAMPTZ DEFAULT NOW(),
changed_at TIMESTAMPTZ,
UNIQUE (source_id, external_id)
);
-- История изменений
CREATE TABLE scraped_items_history (
id BIGSERIAL PRIMARY KEY,
item_id BIGINT REFERENCES scraped_items(id),
data JSONB NOT NULL,
recorded_at TIMESTAMPTZ DEFAULT NOW()
);
-- Индексы
CREATE INDEX ON scraped_items USING GIN (data); -- поиск по JSONB
CREATE INDEX ON scraped_items (source_id, last_seen);
CREATE INDEX ON scraped_items USING GIN (
to_tsvector('russian', data->>'title' || ' ' || COALESCE(data->>'description', ''))
);
Ключевые решения: использование JSONB для переменной схемы, отдельная таблица истории, хеш данных для быстрого обнаружения изменений. Такая схема обеспечивает ACID-транзакции и целостность при параллельной загрузке.
Логика обновления
def upsert_item(source_id, external_id, url, data):
data_hash = hashlib.sha256(
json.dumps(data, sort_keys=True).encode()
).hexdigest()
existing = db.query(
'SELECT id, data_hash FROM scraped_items WHERE source_id=%s AND external_id=%s',
(source_id, external_id)
).fetchone()
if existing is None:
# новый элемент
db.execute(
'INSERT INTO scraped_items (source_id, external_id, url, data, data_hash) '
'VALUES (%s, %s, %s, %s, %s)',
(source_id, external_id, url, json.dumps(data), data_hash)
)
elif existing['data_hash'] != data_hash:
# данные изменились — сохраняем историю
db.execute(
'INSERT INTO scraped_items_history (item_id, data) '
'SELECT id, data FROM scraped_items WHERE id=%s',
(existing['id'],)
)
db.execute(
'UPDATE scraped_items SET data=%s, data_hash=%s, last_seen=NOW(), changed_at=NOW() '
'WHERE id=%s',
(json.dumps(data), data_hash, existing['id'])
)
else:
# данные не изменились — обновляем only last_seen
db.execute(
'UPDATE scraped_items SET last_seen=NOW() WHERE id=%s',
(existing['id'],)
)
Функция upsert_item обрабатывает три сценария: вставка нового объекта, обновление с сохранением истории (если хеш изменился), и только метка last_seen без изменений. Это минимизирует I/O и ускоряет обработку. Под нагрузкой 100 000 записей в день весь pipeline укладывается в 15 минут.
Почему JSONB, а не отдельные колонки?
Спарсенные данные часто имеют нестабильную структуру: сегодня у товара есть вес, завтра — цвет. JSONB снимает проблему миграций и позволяет индексировать любые поля через GIN-индекс. Мы используем гибридный подход: ключевые поля выносим в колонки для быстрых фильтров, а остальное — в JSONB. Это даёт скорость реляционной модели и гибкость документо-ориентированной. На практике JSONB в PostgreSQL работает в 3 раза быстрее MongoDB при выборках по структурированным полям.
Как мы детектим изменения без потери производительности?
Используем SHA-256 от сериализованного JSON. Хеш сравнивается с сохранённым при каждом upsert. Такая проверка выполняется за O(1) и не требует чтения всей строки. Для больших объёмов (миллионы записей) применяем партиционирование по source_id.
Сравнение подходов к хранению
| Критерий |
CSV |
MongoDB |
PostgreSQL + JSONB |
| Версионирование |
Вручную |
Разработка |
Встроенное |
| Полнотекстовый поиск |
Нет |
Да |
Да (GIN) |
| Целостность данных |
Нет |
Слабая |
ACID |
| Время на разработку |
1 день |
3-4 дня |
4-6 дней |
Pipeline обработки: этапы и инструменты
| Этап |
Задача |
Инструменты |
| Извлечение |
Парсинг источника |
Scrapy, Playwright |
| Преобразование |
Нормализация и обогащение |
Python, SQL |
| Загрузка |
Upsert в PostgreSQL |
COPY, INSERT ... ON CONFLICT |
| Агрегация |
Подсчёт статистики |
Materialized views |
| Экспорт |
REST API + выгрузка |
FastAPI, pandas |
Процесс реализации
- Анализ источников — определяем структуру данных и частоту обновления.
- Проектирование схемы — выбираем индексы, настраиваем партиционирование для больших объёмов.
- Разработка upsert-логики — пишем функцию с детекцией изменений по хешу.
- Pipeline обработки — нормализация, обогащение, агрегация.
- API и экспорт — REST endpoints с пагинацией, а также выгрузка в CSV/XLSX.
- Мониторинг и архивирование — TTL-политика, уведомления о сбоях.
Что входит в работу
- Спроектированная схема БД с миграциями
- GitHub-репозиторий с кодом (upsert, pipeline, API)
- Документация по API (OpenAPI/Swagger)
- Инструкция по развёртыванию (Docker Compose)
- Гарантия отсутствия ошибок на этапе приёмки
Архивация и TTL
Архитектура обработки ошибок
Каждый pipeline шаг обёрнут в try-except. При сбое данные помещаются в очередь недоставленных (dead-letter queue). Повторный запуск автоматизирован через Celery с экспоненциальной задержкой.
Старые данные (не виденные более 90 дней) переводятся в архив или удаляются — зависит от требований. История изменений хранится дольше основных данных по умолчанию 365 дней. Все настраивается под ваш бизнес-кейс.
Экспорт
- CSV/XLSX — через pandas.to_excel() или csv.DictWriter
- REST API — FastAPI/Laravel с фильтрацией, пагинацией, сортировкой
- Webhook — отправка новых/изменённых записей в стороннюю систему в реальном времени
Время реализации системы хранения с историей изменений и API — 4–6 дней. Мы гарантируем корректную работу под нагрузкой до 100 тыс. записей в день. Если вам нужно надёжное хранилище спарсенных данных — свяжитесь с нами для обсуждения схемы. Наш опыт — десятки внедрённых систем. Получите консультацию — мы поможем подобрать оптимальную схему.
Услуги бэкенд-разработки: Laravel, Node.js, Go, Django, PostgreSQL
На production-сервере в 3:14 ночи очередь Laravel Jobs перестала обрабатываться. 40 000 необработанных задач в Redis. Причина: worker упал из-за memory leak в одном из Jobs (утечка через статическую переменную в Eloquent observer), supervisor не перезапустил его из-за misconfigured stopwaitsecs. Это не гипотетический сценарий — это вторник. Мы разбирали такой инцидент на проекте с нагрузкой 500 RPS: диагностика заняла 4 часа, фикс — 20 минут. Чтобы вы не теряли деньги на простоях, предлагаем услуги бэкенд-разработки с акцентом на production-grade надёжность. Оценим ваш проект за 2 дня.
Backend — это то, что работает когда никто не смотрит. Или не работает. Гарантируем, что у вас будет первый вариант.
Что мы делаем с первого дня правильно
Service Layer поверх Fat Controllers. Controller получает HTTP-запрос, валидирует его через Form Request, передаёт данные в Service, возвращает ответ. Бизнес-логика в Service, не в Controller. Это звучит банально, но большинство legacy-проектов — это контроллеры по 500 строк с SQL-запросами внутри.
Repository Pattern используем осторожно. Если вы просто оборачиваете Model::where(...) в метод репозитория — это бойлерплейт без пользы. Repository оправдан когда: нужно абстрагироваться от источника данных (БД + кеш + внешний API) или когда логика запросов достаточно сложна для изоляции.
Jobs, Events, Listeners. Всё, что можно сделать асинхронно — делаем асинхронно. Отправка email, генерация PDF, синхронизация с внешним API, пересчёт агрегатов — в Queue. Laravel Horizon для мониторинга очередей в Redis: видно throughput, failed jobs, время обработки по очередям.
Как Octane справляется с высокой нагрузкой
Laravel Octane с RoadRunner или Swoole держит приложение в памяти между запросами — убирает overhead bootstrap (загрузка конфигов, автозагрузка классов) на каждый HTTP-запрос. Прирост: 3–8x на синтетических бенчмарках, 2–4x на реальных приложениях. Важно: нельзя хранить состояние между запросами в статических переменных — это приводит именно к таким инцидентам, как в начале. Применяем это в проектах с >1000 RPS.
Что делать с N+1 запросами
N+1 — самая распространённая причина медленных страниц в Laravel-приложениях. Стандартная история: страница работала нормально на dev с 10 записями, на production с 10 000 — 8-секундная загрузка.
Laravel Debugbar в dev-окружении показывает количество запросов на страницу. Более 20 запросов на одну страницу — сигнал для audit.
Model::preventLazyLoading(! app()->isProduction());
Telescope для профилирования в staging: логирует все запросы, jobs, mail, notifications с детализацией по времени. Цифры: после внедрения eager loading время загрузки страницы падает с 8 с до 0.3 с — в 27 раз.
PostgreSQL: индексы, которые реально нужны
PostgreSQL 14+ — основная БД на всех проектах. Используем связку PgBouncer + PostgreSQL. Опыт 10+ лет, более 50 backend-проектов, 5 лет на рынке.
Как PostgreSQL помогает избежать медленных запросов
Composite indexes для частых WHERE + ORDER BY. Если у вас WHERE user_id = ? AND status = ? ORDER BY created_at DESC — нужен (user_id, status, created_at DESC). Индекс по (user_id) отдельно плохо помогает с сортировкой.
Partial indexes. Если 95% запросов идут по WHERE status = 'active':
CREATE INDEX idx_orders_active ON orders (created_at DESC)
WHERE status = 'active';
Индекс маленький, быстрый, покрывает основную нагрузку.
GIN-индексы для JSONB и массивов. @> оператор без GIN-индекса — seq scan. С индексом — быстро даже на миллионах записей.
GIN для full-text search. to_tsvector + GIN вместо LIKE '%query%'. LIKE без индекса — всегда seq scan. С pg_trgm extension и gin_trgm_ops — поддержка LIKE с индексом, полезно для CRM-поиска по частичному совпадению.
Connection pooling: почему важнее чем кажется
Rails, Laravel, Django открывают новое соединение с PostgreSQL на каждый PHP/Python процесс. На 100 воркерах — 100 соединений. PostgreSQL начинает деградировать от 200–300 активных соединений — overhead на управление соединениями становится значительным.
PgBouncer — connection pooler перед PostgreSQL. Режим transaction pooling: соединение с PostgreSQL занято только на время транзакции, между запросами возвращается в пул. 1000 приложений-воркеров → 20–50 реальных соединений к PostgreSQL. Это снижает latency на 40% и уменьшает затраты на хостинг на 30%.
Node.js с Fastify: когда это лучше Laravel
Node.js оправдан для:
- Realtime: WebSocket-серверы, Server-Sent Events, чат, live-обновления
- Streaming: большие файлы, видео, данные потоком
- High I/O concurrency: много параллельных запросов к внешним API без тяжёлой бизнес-логики
- Serverless: Lambda/Cloud Functions — Node.js стартует быстрее PHP
Fastify вместо Express: в 2–3 раза быстрее на benchmarks, встроенная JSON Schema валидация, лучшая TypeScript поддержка, plugin-архитектура.
Типичная архитектура realtime: Laravel — основная бизнес-логика и REST API. Node.js + Socket.io или ws — WebSocket сервер. Laravel публикует события в Redis Pub/Sub, Node.js подписывается и транслирует клиентам. Это разделение позволяет масштабировать WebSocket-сервер независимо от основного приложения.
Go: микросервисы и высокая нагрузка
Go используем для:
- Высоконагруженных микросервисов (> 10 000 RPS)
- Фоновых воркеров с жёсткими требованиями к latency
- Инструментов DevOps и CLI
- gRPC-сервисов в микросервисной архитектуре
Goroutines — дешевле OS-потоков в тысячи раз. 10 000 конкурентных соединений на Go — норма на одном сервере.
Но Go — не волшебная таблетка. Разработка медленнее чем на Laravel: больше бойлерплейта, нет ORM уровня Eloquent, обработка ошибок через if err != nil везде. Оправдан только когда производительность — реальное требование, не предположение.
Django и Python backend
Django с DRF (Django REST Framework) — для задач где нужен Python: ML-пайплайны, обработка данных, интеграции с AI-инструментами.
Celery для фоновых задач — аналог Laravel Queue, но сложнее в конфигурации. Celery Beat для cron-задач.
Django ORM vs raw SQL: ORM удобен для CRUD. Для аналитических запросов с несколькими JOIN, оконными функциями и CTE — connection.execute() с raw SQL читаемее и предсказуемее.
Redis: не только кеш
Redis в наших проектах выполняет несколько ролей:
| Роль |
Детали |
| Кеш |
Кеширование результатов тяжёлых запросов, фрагментов HTML |
| Очереди |
Backend для Laravel Queue / Celery |
| Session store |
Distributed sessions в multi-instance окружении |
| Pub/Sub |
Realtime события между сервисами |
| Rate limiting |
Sliding window counters для API throttling |
| Leaderboards |
Sorted Sets для рейтингов |
Redis Cluster для горизонтального масштабирования. Sentinel для автоматического failover на standalone установках.
Деплой и инфраструктура
Docker + docker-compose — стандарт для локальной разработки и production. Каждый сервис в контейнере: PHP-FPM/Octane, Nginx, PostgreSQL, Redis, Queue Worker, Scheduler.
CI/CD через GitHub Actions:
- Прогон тестов (PHPUnit / Pest, Vitest, Playwright)
- Сборка Docker-образа
- Push в Container Registry
- Deploy: docker pull → docker-compose up -d на сервере, или Kubernetes rolling update
Zero-downtime deploy для Laravel: php artisan down --secret=TOKEN не нужен при правильной настройке. Стратегия: новый контейнер стартует рядом со старым, Nginx переключает трафик после health check, старый контейнер останавливается.
Мониторинг: Sentry для exception tracking с alerting в Slack/Telegram. Grafana + Prometheus (или Grafana Cloud) для метрик: CPU, memory, request rate, queue depth, database connection count. Алерт на: error rate > 1%, p99 latency > 2s, queue depth > 1000 jobs.
Что входит в работу под ключ
- Архитектурное проектирование (документация API, схема БД, диаграмма сервисов)
- Реализация по согласованному ТЗ с code review
- Настройка CI/CD, мониторинга, алертинга
- Нагрузочное тестирование (k6, wrk) с отчётом
- Передача исходников, доступов, инструкция по деплою
- Обучение команды заказчика (2-3 сессии)
- Гарантийная поддержка 1 месяц после сдачи
Ориентиры по срокам
| Задача |
Срок |
| REST API для мобильного/SPA (средняя сложность) |
6–12 недель |
| Backend со сложной бизнес-логикой + интеграции |
12–20 недель |
| Высоконагруженный сервис на Go |
8–16 недель |
| Миграция legacy PHP на Laravel |
16–32 недели |
Стоимость рассчитывается индивидуально после анализа требований к нагрузке, интеграциям и бизнес-логике. Типичный бюджет backend-проекта — от 500 000 до 2 000 000 рублей в зависимости от сложности. Свяжитесь с нами для бесплатного аудита вашего текущего backend — получите план оптимизации за 2 дня. Закажите консультацию.