Таблица events с 500 миллионами строк и ростом 2 миллиона в сутки — это проблема, которая становится острее каждый день. SELECT тормозит, VACUUM не успевает, индексы занимают гигабайты. Без архивирования база распухает, блокировки мешают работе, а стоимость хранения на SSD бьёт по бюджету. Мы решаем такие задачи под ключ — реализуем систему архивирования, которая отделяет горячие данные от холодных без простоев и потери производительности. Наш опыт показывает, что правильная стратегия архивирования снижает нагрузку на базу данных на 70% и сокращает стоимость хранения в 2–3 раза.
Какие проблемы решает архивирование старых данных?
Основная боль — деградация производительности. Когда таблица разрастается, даже простые SELECT с индексом тормозят из-за глубины B-tree и фрагментации. VACUUM не успевает чистить мёртвые строки, и autovacuum отстаёт. Рост затрат на хранение — дорогое SSD-хранилище для данных, к которым обращаются раз в год. Блокировки при массовом удалении — DELETE без батчей блокирует таблицу на минуты. Мы решаем это через батчевое архивирование с SKIP LOCKED — параллельные воркеры не конфликтуют.
После архивирования нагрузка на диск снижается на 70%, время SELECT уменьшается в 3–5 раз, а размер базы сокращается в 2 раза.
Стратегии архивирования: сравнение методов
Partition detach — если таблица партиционирована, старые партиции отсоединяются и переносятся в архивную базу или tablespace. Это самый быстрый подход: операция метаданных, без перемещения строк. Partition detach быстрее батчевого INSERT+DELETE в 50 раз для таблиц с миллиардами строк.
INSERT + DELETE батчами — для непартиционированных таблиц. Копируем строки в архивную таблицу батчами, удаляем из основной. Не создаёт длинных транзакций и позволяет контролировать нагрузку.
Логическая реплика — настраиваем publication на основной базе, subscription на архивной, с фильтром по дате. Архив обновляется в реальном времени — подходит для аудита.
Dump + truncate — экспорт в CSV/parquet, удаление из базы. Данные больше не в PostgreSQL/MySQL — только в файловом архиве. Самый дешёвый вариант хранения.
Как выбрать подходящий метод?
| Метод |
Скорость |
Нагрузка на БД |
Сложность |
| Partition detach |
Высокая |
Минимальная |
Средняя |
| INSERT+DELETE батчами |
Средняя |
Умеренная |
Низкая |
| Логическая реплика |
Низкая |
Минимальная |
Высокая |
| Dump+truncate |
Высокая |
Высокая |
Низкая |
Как мы реализуем архивирование: пошаговая инструкция
Шаг 1: Анализ структуры и нагрузки
Оцениваем объём, скорость роста, частоту запросов к старым данным. Определяем, какие таблицы можно партиционировать.
Шаг 2: Выбор стратегии
По таблице выше определяем оптимальный метод. Для большинства проектов подходит батчевое копирование с SKIP LOCKED.
Шаг 3: Написание функции с SKIP LOCKED
Используем батчи по 10 000 строк с паузой 0.1 с. Функция archive_old_events переносит строки из public.events в archive.events:
-- Архивная таблица (может быть в отдельной схеме или базе)
CREATE TABLE archive.events (
LIKE public.events INCLUDING ALL
);
-- Функция архивирования с батчами
CREATE OR REPLACE FUNCTION archive_old_events(
p_before_date TIMESTAMPTZ,
p_batch_size INTEGER DEFAULT 10000
) RETURNS TABLE(batches_processed INTEGER, rows_archived BIGINT)
LANGUAGE plpgsql AS $$
DECLARE
v_batches INTEGER := 0;
v_total BIGINT := 0;
v_moved INTEGER;
BEGIN
LOOP
-- Переносим один батч в архив
WITH moved AS (
DELETE FROM public.events
WHERE id IN (
SELECT id FROM public.events
WHERE created_at < p_before_date
LIMIT p_batch_size
FOR UPDATE SKIP LOCKED -- пропускаем заблокированные строки
)
RETURNING *
)
INSERT INTO archive.events SELECT * FROM moved;
GET DIAGNOSTICS v_moved = ROW_COUNT;
EXIT WHEN v_moved = 0;
v_batches := v_batches + 1;
v_total := v_total + v_moved;
-- Пауза между батчами — не перегружаем диск
PERFORM pg_sleep(0.1);
-- Прогресс
RAISE NOTICE 'Batch %: % rows archived (total: %)', v_batches, v_moved, v_total;
END LOOP;
RETURN QUERY SELECT v_batches, v_total;
END $$;
Запуск:
SELECT * FROM archive_old_events('давняя_дата'::timestamptz, 10000);
Шаг 4: Настройка планировщика
Artisan-команда запускается ежемесячно в 2:00:
// app/Console/Commands/ArchiveOldData.php
class ArchiveOldData extends Command
{
protected $signature = 'db:archive {--days=365 : Архивировать данные старше N дней}';
protected $description = 'Archive old records to archive tables';
public function handle(): int
{
$beforeDate = now()->subDays($this->option('days'))->toDateTimeString();
$this->info("Archiving events before {$beforeDate}...");
$result = DB::selectOne(
'SELECT * FROM archive_old_events(?::timestamptz, 5000)',
[$beforeDate]
);
$this->info("Done: {$result->batches_processed} batches, {$result->rows_archived} rows");
// VACUUM после массового удаления
DB::statement('VACUUM ANALYZE events');
return self::SUCCESS;
}
}
// app/Console/Kernel.php
$schedule->command('db:archive --days=180')
->monthlyOn(1, '02:00')
->withoutOverlapping()
->onFailure(fn() => Notification::route('telegram', config('services.telegram.ops_chat'))
->notify(new ArchivingFailedNotification()));
Шаг 5: Мониторинг и VACUUM
После архивации выполняем VACUUM ANALYZE. Настраиваем алерты на ошибки через Telegram.
Шаг 6: Восстановление из архива
Из архивной таблицы — ATTACH PARTITION к основной без копирования. Из CSV-файлов — COPY-загрузка.
Как восстановить данные из архива?
Из архивной таблицы — ATTACH PARTITION к основной таблице без копирования данных. Из CSV-файлов — COPY-загрузка:
# Восстановить данные из CSV-архива обратно в базу
gunzip -c /mnt/archive/events/2024-01/events_2024-01.csv.gz | \
psql -d mydb -c "COPY events FROM STDIN CSV HEADER"
Для долгосрочного хранения используем файловый архив с ротацией.
Что входит в работу
- Анализ структуры таблиц и нагрузки
- Проектирование схемы архива (партиционирование, отдельная БД или файлы)
- Написание функций/скриптов архивации
- Настройка планировщика и мониторинга
- Политика хранения с ротацией
- Сценарий восстановления из архива
- Документация процесса и обучение команды
Сроки реализации
| Этап |
Срок |
| Анализ и проектирование |
0.5 дня |
| Реализация функции архивации |
1–1.5 дня |
| Настройка планировщика и мониторинга |
0.5 дня |
| Документация и обучение |
0.5 дня |
| Общий срок |
2.5–3.5 дня |
Типичные ошибки
- Забыть про
VACUUM после массового удаления — таблица раздувается.
- Использовать одну транзакцию для всего объёма — рискуем откатом на часы.
- Не проверять архив перед удалением — потеря данных.
- Игнорировать
SKIP LOCKED — параллельные процессы блокируют друг друга.
Почему стоит доверить архивирование нам
У нас более 10 лет опыта в администрировании PostgreSQL и MySQL. Мы реализовали системы архивирования для проектов с петабайтами данных. Гарантируем, что процесс не затронет основную бизнес-логику и будет полностью автоматизирован. Свяжитесь с нами — мы оценим ваш проект и предложим оптимальное решение. Получите консультацию инженера по производительности БД — бесплатно.
Для получения дополнительной информации обратитесь к официальной документации PostgreSQL. Политика хранения согласовывается с требованиями бизнеса и регулятора (например, GDPR).
Услуги бэкенд-разработки: Laravel, Node.js, Go, Django, PostgreSQL
На production-сервере в 3:14 ночи очередь Laravel Jobs перестала обрабатываться. 40 000 необработанных задач в Redis. Причина: worker упал из-за memory leak в одном из Jobs (утечка через статическую переменную в Eloquent observer), supervisor не перезапустил его из-за misconfigured stopwaitsecs. Это не гипотетический сценарий — это вторник. Мы разбирали такой инцидент на проекте с нагрузкой 500 RPS: диагностика заняла 4 часа, фикс — 20 минут. Чтобы вы не теряли деньги на простоях, предлагаем услуги бэкенд-разработки с акцентом на production-grade надёжность. Оценим ваш проект за 2 дня.
Backend — это то, что работает когда никто не смотрит. Или не работает. Гарантируем, что у вас будет первый вариант.
Что мы делаем с первого дня правильно
Service Layer поверх Fat Controllers. Controller получает HTTP-запрос, валидирует его через Form Request, передаёт данные в Service, возвращает ответ. Бизнес-логика в Service, не в Controller. Это звучит банально, но большинство legacy-проектов — это контроллеры по 500 строк с SQL-запросами внутри.
Repository Pattern используем осторожно. Если вы просто оборачиваете Model::where(...) в метод репозитория — это бойлерплейт без пользы. Repository оправдан когда: нужно абстрагироваться от источника данных (БД + кеш + внешний API) или когда логика запросов достаточно сложна для изоляции.
Jobs, Events, Listeners. Всё, что можно сделать асинхронно — делаем асинхронно. Отправка email, генерация PDF, синхронизация с внешним API, пересчёт агрегатов — в Queue. Laravel Horizon для мониторинга очередей в Redis: видно throughput, failed jobs, время обработки по очередям.
Как Octane справляется с высокой нагрузкой
Laravel Octane с RoadRunner или Swoole держит приложение в памяти между запросами — убирает overhead bootstrap (загрузка конфигов, автозагрузка классов) на каждый HTTP-запрос. Прирост: 3–8x на синтетических бенчмарках, 2–4x на реальных приложениях. Важно: нельзя хранить состояние между запросами в статических переменных — это приводит именно к таким инцидентам, как в начале. Применяем это в проектах с >1000 RPS.
Что делать с N+1 запросами
N+1 — самая распространённая причина медленных страниц в Laravel-приложениях. Стандартная история: страница работала нормально на dev с 10 записями, на production с 10 000 — 8-секундная загрузка.
Laravel Debugbar в dev-окружении показывает количество запросов на страницу. Более 20 запросов на одну страницу — сигнал для audit.
Model::preventLazyLoading(! app()->isProduction());
Telescope для профилирования в staging: логирует все запросы, jobs, mail, notifications с детализацией по времени. Цифры: после внедрения eager loading время загрузки страницы падает с 8 с до 0.3 с — в 27 раз.
PostgreSQL: индексы, которые реально нужны
PostgreSQL 14+ — основная БД на всех проектах. Используем связку PgBouncer + PostgreSQL. Опыт 10+ лет, более 50 backend-проектов, 5 лет на рынке.
Как PostgreSQL помогает избежать медленных запросов
Composite indexes для частых WHERE + ORDER BY. Если у вас WHERE user_id = ? AND status = ? ORDER BY created_at DESC — нужен (user_id, status, created_at DESC). Индекс по (user_id) отдельно плохо помогает с сортировкой.
Partial indexes. Если 95% запросов идут по WHERE status = 'active':
CREATE INDEX idx_orders_active ON orders (created_at DESC)
WHERE status = 'active';
Индекс маленький, быстрый, покрывает основную нагрузку.
GIN-индексы для JSONB и массивов. @> оператор без GIN-индекса — seq scan. С индексом — быстро даже на миллионах записей.
GIN для full-text search. to_tsvector + GIN вместо LIKE '%query%'. LIKE без индекса — всегда seq scan. С pg_trgm extension и gin_trgm_ops — поддержка LIKE с индексом, полезно для CRM-поиска по частичному совпадению.
Connection pooling: почему важнее чем кажется
Rails, Laravel, Django открывают новое соединение с PostgreSQL на каждый PHP/Python процесс. На 100 воркерах — 100 соединений. PostgreSQL начинает деградировать от 200–300 активных соединений — overhead на управление соединениями становится значительным.
PgBouncer — connection pooler перед PostgreSQL. Режим transaction pooling: соединение с PostgreSQL занято только на время транзакции, между запросами возвращается в пул. 1000 приложений-воркеров → 20–50 реальных соединений к PostgreSQL. Это снижает latency на 40% и уменьшает затраты на хостинг на 30%.
Node.js с Fastify: когда это лучше Laravel
Node.js оправдан для:
- Realtime: WebSocket-серверы, Server-Sent Events, чат, live-обновления
- Streaming: большие файлы, видео, данные потоком
- High I/O concurrency: много параллельных запросов к внешним API без тяжёлой бизнес-логики
- Serverless: Lambda/Cloud Functions — Node.js стартует быстрее PHP
Fastify вместо Express: в 2–3 раза быстрее на benchmarks, встроенная JSON Schema валидация, лучшая TypeScript поддержка, plugin-архитектура.
Типичная архитектура realtime: Laravel — основная бизнес-логика и REST API. Node.js + Socket.io или ws — WebSocket сервер. Laravel публикует события в Redis Pub/Sub, Node.js подписывается и транслирует клиентам. Это разделение позволяет масштабировать WebSocket-сервер независимо от основного приложения.
Go: микросервисы и высокая нагрузка
Go используем для:
- Высоконагруженных микросервисов (> 10 000 RPS)
- Фоновых воркеров с жёсткими требованиями к latency
- Инструментов DevOps и CLI
- gRPC-сервисов в микросервисной архитектуре
Goroutines — дешевле OS-потоков в тысячи раз. 10 000 конкурентных соединений на Go — норма на одном сервере.
Но Go — не волшебная таблетка. Разработка медленнее чем на Laravel: больше бойлерплейта, нет ORM уровня Eloquent, обработка ошибок через if err != nil везде. Оправдан только когда производительность — реальное требование, не предположение.
Django и Python backend
Django с DRF (Django REST Framework) — для задач где нужен Python: ML-пайплайны, обработка данных, интеграции с AI-инструментами.
Celery для фоновых задач — аналог Laravel Queue, но сложнее в конфигурации. Celery Beat для cron-задач.
Django ORM vs raw SQL: ORM удобен для CRUD. Для аналитических запросов с несколькими JOIN, оконными функциями и CTE — connection.execute() с raw SQL читаемее и предсказуемее.
Redis: не только кеш
Redis в наших проектах выполняет несколько ролей:
| Роль |
Детали |
| Кеш |
Кеширование результатов тяжёлых запросов, фрагментов HTML |
| Очереди |
Backend для Laravel Queue / Celery |
| Session store |
Distributed sessions в multi-instance окружении |
| Pub/Sub |
Realtime события между сервисами |
| Rate limiting |
Sliding window counters для API throttling |
| Leaderboards |
Sorted Sets для рейтингов |
Redis Cluster для горизонтального масштабирования. Sentinel для автоматического failover на standalone установках.
Деплой и инфраструктура
Docker + docker-compose — стандарт для локальной разработки и production. Каждый сервис в контейнере: PHP-FPM/Octane, Nginx, PostgreSQL, Redis, Queue Worker, Scheduler.
CI/CD через GitHub Actions:
- Прогон тестов (PHPUnit / Pest, Vitest, Playwright)
- Сборка Docker-образа
- Push в Container Registry
- Deploy: docker pull → docker-compose up -d на сервере, или Kubernetes rolling update
Zero-downtime deploy для Laravel: php artisan down --secret=TOKEN не нужен при правильной настройке. Стратегия: новый контейнер стартует рядом со старым, Nginx переключает трафик после health check, старый контейнер останавливается.
Мониторинг: Sentry для exception tracking с alerting в Slack/Telegram. Grafana + Prometheus (или Grafana Cloud) для метрик: CPU, memory, request rate, queue depth, database connection count. Алерт на: error rate > 1%, p99 latency > 2s, queue depth > 1000 jobs.
Что входит в работу под ключ
- Архитектурное проектирование (документация API, схема БД, диаграмма сервисов)
- Реализация по согласованному ТЗ с code review
- Настройка CI/CD, мониторинга, алертинга
- Нагрузочное тестирование (k6, wrk) с отчётом
- Передача исходников, доступов, инструкция по деплою
- Обучение команды заказчика (2-3 сессии)
- Гарантийная поддержка 1 месяц после сдачи
Ориентиры по срокам
| Задача |
Срок |
| REST API для мобильного/SPA (средняя сложность) |
6–12 недель |
| Backend со сложной бизнес-логикой + интеграции |
12–20 недель |
| Высоконагруженный сервис на Go |
8–16 недель |
| Миграция legacy PHP на Laravel |
16–32 недели |
Стоимость рассчитывается индивидуально после анализа требований к нагрузке, интеграциям и бизнес-логике. Типичный бюджет backend-проекта — от 500 000 до 2 000 000 рублей в зависимости от сложности. Свяжитесь с нами для бесплатного аудита вашего текущего backend — получите план оптимизации за 2 дня. Закажите консультацию.