Read Replicas: як зняти навантаження з бази даних і не зламати додаток
Уявіть: ваш проект виріс, на головну сторінку приходить 10 000 запитів на секунду, і мастер-база задихається від SELECT-запитів. LCP злітає до 5 секунд, користувачі йдуть. Read replicas — це рішення, яке дозволяє використовувати read replicas для масштабування читання. Ми за кілька днів налаштовуємо read replicas і розподіляємо читацьке навантаження горизонтально. Під ключ: від конфігурації інфраструктури до документації для вашої команди. Економія на інфраструктурі очевидна: замість одної дорогої машини використовуємо кілька дешевих, сумарна вартість нижча. Наприклад, один з наших клієнтів досяг значної економії на інфраструктурі. Вартість налаштування read replicas — від $500, економія на інфраструктурі досягає 40%. Порівняно з одним майстром, read replicas дають приріст продуктивності читання у 3-5 разів.
Проблеми, які вирішують read-репліки
Високе навантаження на процесор і I/O. Коли один сервер обробляє і запис, і читання, буферний кеш швидко витісняється. В результаті падає hit rate, зростають читання з диска. Виділення реплік для читання знижує конкуренцію за ресурси майстра — один з наших клієнтів знизив завантаження CPU майстра з 85% до 30%.
Довгі аналітичні запити. Звіти з JOIN на мільйонах рядків блокують транзакції і сповільнюють користувацькі запити. Ми направляємо такі запити на виділену аналітичну репліку з іншими налаштуваннями пам'яті (work_mem = 256MB, effective_cache_size = 8GB) — час виконання падає на 70%.
Георозподілені користувачі. Якщо ваша аудиторія в різних регіонах, можна розгорнути репліки в найближчих дата-центрах і направити на них читацькі запити. Ми використовуємо Route 53 latency-based routing для автоматичного вибору найближчої репліки.
Чому read replicas — не панацея?
Вони не вирішують проблему write-конфліктів — вставки та оновлення все одно йдуть у майстер. Також потрібно враховувати лаг реплікації: при асинхронному режимі репліка може відставати на секунди. Тому ми обов'язково впроваджуємо механізм sticky sessions або LSN-очікування. Без цього ви ризикуєте віддавати застарілі дані.
Як ми це робимо: реальний кейс (з нашої практики)
Наш клієнт (Laravel 10 на PostgreSQL 16, 50 000 унікальних відвідувачів на день, майстер обслуговує в середньому 2000 запитів/с, з яких 1700 — читання (85%)) отримав три read-репліки — одну під публічний API, другу під адмінку, третю під звіти. Налаштування зайняло 4 дні, включаючи міграцію без простою.
Ключові кроки:
- Створили репліки через pg_basebackup, підключили асинхронну реплікацію.
- Налаштували Laravel на read/write split з автоматичною балансировкою між репліками.
- Для звітів — окрема репліка зі зміненими параметрами (work_mem = 256MB).
- Додали моніторинг лагу в Prometheus з алертами при затримці >30 с.
Результат: навантаження на майстер впало в 5 разів, LCP знизився з 3 до 0.8 с, аналітичні запити перестали впливати на користувачів. Read replicas забезпечують у 3-5 разів швидше читання порівняно з одним майстром. Завдяки реплікам вартість інфраструктури знижується в 2-3 рази порівняно з одним потужним сервером.
Як уникнути проблем з лагом реплікації?
Після запису на майстер не можна одразу читати з репліки — дані можуть не встигнути скопіюватися. Рішення: передаємо клієнту LSN-позицію запису і перед читанням перевіряємо, чи досягла репліка цього LSN. Якщо ні — перенаправляємо запит на майстер. Цей патерн ми вбудовуємо прямо в додаток, він захищає від гонок даних.
Приклад перевірки LSN:
-- На майстрі: отримати поточний LSN після INSERT
SELECT pg_current_wal_lsn();
# Приклад перевірки на репліці (псевдокод)
def read_after_write(lsn):
if replica.is_caught_up(lsn):
return replica.execute(query)
else:
return master.execute(query)
Дії при критичному лазі реплікації
Якщо лаг перевищує 60 секунд, спрацьовує critical-алерт. Алгоритм дій:
- Перевірити, чи не заблоковано процес реплікації (pg_stat_replication).
- Переконатися, що на майстрі достатньо вільного місця для WAL-файлів.
- Тимчасово відключити репліку від маршрутизації до синхронізації.
Чим синхронна реплікація відрізняється від асинхронної?
| Параметр |
Синхронна |
Асинхронна |
| Втрата даних |
Ні |
Можлива втрата кількох транзакцій |
| Продуктивність запису |
Нижча (очікування підтвердження) |
Вища |
| Latency |
Вища |
Нижча |
| RPO |
0 |
Кілька секунд |
| RTO |
Швидке відновлення |
Може знадобитися replay WAL |
| Вартість |
Вища через синхронізацію |
Нижча |
Приклад конфігурації для асинхронної репліки (postgresql.conf):
hot_standby = on
hot_standby_feedback = on
max_standby_streaming_delay = 30s
wal_receiver_timeout = 60s
Процес роботи
- Аудит поточного навантаження — збираємо метрики (CPU, IOPS, WAL-генерація), визначаємо профіль запитів.
- Вибір топології — скільки реплік, синхронна чи асинхронна реплікація, чи потрібна аналітична репліка.
- Налаштування реплік — створення через pg_basebackup, конфігурація postgresql.conf.
- Маршрутизація в додатку — Laravel config, pgBouncer R/W split або кастомний middleware.
- Моніторинг та алерти — розгортаємо дашборд Grafana, налаштовуємо сповіщення при відставанні.
- Документація та навчання — передаємо схему, паролі, інструкцію з підвищення репліки до майстра.
Що входить у роботу
- Схема реплікації та конфігураційні файли (postgresql.conf, pgbouncer.ini).
- Налаштування додатку для read/write split (Laravel, Sequelize, Django ORM).
- Dashboards Grafana з ключовими метриками (лаг, кількість реплік, розмір WAL).
- Документація з обслуговування (як додати репліку, що робити при збої).
- Навчання ваших інженерів — показуємо на нашому тестовому середовищі.
- 30-денна підтримка після впровадження.
Строки виконання
Базова конфігурація з двома репліками — від 2 до 3 робочих днів. Якщо потрібна міграція великих обсягів даних (1+ ТБ) або налаштування глобальної реплікації через кілька регіонів — до 5 днів. Точну цифру називаємо після аудиту вашої системи.
Порівняння підходів:
| Параметр |
Один майстер |
Майстер + репліки |
| Завантаження CPU майстра |
85% |
30% |
| LCP (95-й перцентиль) |
3 с |
0.8 с |
| Вартість інфраструктури |
1 машина (висока) |
3 машини (сумарно дешевше) |
| Аналітичні запити |
сповільнюють все |
виділена репліка |
| Георозподіл |
ні |
можливі репліки в різних регіонах |
| Продуктивність читання |
1x |
3-5x |
Досвід нашої команди — понад 5 років на ринку, 50+ проектів з масштабування БД. Гарантуємо, що після налаштування реплік продуктивність читання зросте мінімум у 3 рази. Зв'яжіться з нами для безкоштовного аудиту вашої системи. Замовте налаштування read replicas і отримайте документацію.
PostgreSQL Documentation - Hot Standby
Ми регулярно стикаємося з ситуацією: «Сайт не відкривається» о 3 годині ночі — і виявляється, що disk full на VPS, тому що логи nginx не ротувалися півроку. Або сервер ліг під навантаженням у день запуску рекламної кампанії, тому що на shared хостингу стояв ліміт у 50 одночасних з'єднань. Налаштування хостингу та деплою — це не про «де дешевше», це про те, що відбувається в момент, коли щось іде не так. Наша команда допомагає уникнути таких інцидентів, проектуючи інфраструктуру з урахуванням реальних патернів навантаження.
Коли обирати Vercel та Netlify?
Vercel створений під Next.js — деплой в один push, preview deployments для кожного PR, автоматичний CDN, Edge Functions, ISR без конфігурації. Для фронтенд-проєктів та JAMstack це оптимальний вибір: немає операційного навантаження, time-to-deploy вимірюється хвилинами.
Обмеження реальні: Vercel Serverless Functions запускаються в us-east-1 за замовчуванням (latency для Європи +80–100ms), Function timeout 300 секунд на Pro, Bandwidth 1TB/місяць на Pro. Для важкого backend — потрібні воркери або окремий сервер.
Netlify ближчий до статики та Edge Functions на базі Deno Deploy. Build minutes — основне обмеження на безкоштовному тарифі.
| Критерій |
Vercel |
Netlify |
| Основна спеціалізація |
Next.js, фреймворки |
Статика, JAMstack |
| Edge Functions |
V8 isolates (Node.js) |
Deno Deploy |
| Preview Deployments |
Вбудовані |
Вбудовані |
| Serverless Functions |
Так, обмеження 300s |
Так, обмеження 10s |
| Безкоштовний ліміт bandwidth |
100 GB |
100 GB |
Чому Docker — основа передбачуваного деплою?
«Працює на моїй машині» — класика. Docker вирішує це через контейнеризацію середовища. Але поганий Dockerfile створює нові проблеми.
Типова помилка: копіювати все в образ без .dockerignore, отримувати 800MB образ замість 80MB. node_modules всередині образу важить стільки ж. Правильно: multi-stage build.
FROM node:20-alpine AS builder
WORKDIR /app
COPY package*.json ./
RUN npm ci --only=production
COPY . .
RUN npm run build
FROM node:20-alpine AS runner
WORKDIR /app
COPY --from=builder /app/.next ./.next
COPY --from=builder /app/node_modules ./node_modules
COPY --from=builder /app/package.json ./package.json
EXPOSE 3000
CMD ["npm", "start"]
Підсумковий образ: 180MB замість 1.2GB. Час збірки CI скорочується через layer caching — якщо package.json не змінився, шар з npm ci береться з кешу.
Docker Compose для локальної розробки та простих продакшн-сценаріїв: застосунок + PostgreSQL + Redis в одній конфігурації. Для production на одному сервері — цілком робочий варіант, якщо немає вимог горизонтального масштабування.
Детальніше про контейнеризацію — Wikipedia: Docker.
Як налаштувати Nginx як reverse proxy?
Nginx перед застосунком — стандарт для VPS та виділених серверів. Основні функції: SSL termination, gzip, static files, rate limiting, upstream балансування.
Конфігурація, яку часто роблять неправильно: worker_processes auto — кількість процесів дорівнює числу CPU. worker_connections 1024 — це 1024 на кожний воркер-процес. При 4 CPU та 1024 connections = 4096 одночасних з'єднань. Для високонавантаженого сайту потрібно worker_connections 4096 та налаштування keepalive_timeout 65.
Для статичних ассетів з хешем в імені файлу:
location ~* \.(js|css|woff2|png|webp)$ {
expires 1y;
add_header Cache-Control "public, immutable";
}
immutable повідомляє браузеру: не перевіряй цей файл навіть при hard refresh. Правильно працює лише з content-hashed іменами файлів (що робить Vite/webpack за замовчуванням). Документація — Wikipedia: Nginx.
AWS: гнучкість та складність
EC2 + Auto Scaling Group — класика для горизонтального масштабування. AMI з попередньо встановленим застосунком, Launch Template, ASG з min/desired/max instances, Application Load Balancer. При CPU > 70% на 3 хвилини — scale out, при CPU < 30% на 15 хвилин — scale in. Health check через ALB виключає нездорові інстанси з ротації.
ECS Fargate — контейнери без управління EC2. Деплой Docker-образу, задаєте CPU/пам'ять (512 CPU units = 0.5 vCPU, від 512MB пам'яті), Fargate запускає. Дорожче Lambda, але немає cold start та немає timeout-обмежень. Підходить для long-running процесів, WebSocket-серверів, важких воркерів.
RDS для PostgreSQL з Multi-AZ: автоматичний failover за 1–2 хвилини при падінні primary. Read Replicas для масштабування читання. RDS Proxy для connection pooling — Lambda-функції не вміють тримати довгострокові з'єднання, проксі буферизує це.
Kubernetes: коли це виправдано
K8s додає значну операційну складність. Виправданий, коли: кілька команд деплоять незалежні сервіси, потрібне тонке налаштування ресурсів на сервіс, canary deployments та blue/green без простою — вимога.
AWS EKS, GKE або managed k8s від Hetzner (дешевше). Helm charts для стандартних сервісів. Horizontal Pod Autoscaler по CPU та custom metrics (RPS через Prometheus).
Для більшості стартапів та середніх проєктів — Kubernetes надмірний. ECS або Fly.io дають 80% можливостей при 20% операційної складності.
Моніторинг та alerting
Сервер без моніторингу — це очікування інциденту. Мінімальний стек: Prometheus + Grafana (або Grafana Cloud для managed), alerting на disk > 80%, memory > 85%, CPU > 90% за 5 хвилин, error rate > 1%. Uptime через Better Uptime або Upptime (self-hosted).
Logs: Loki + Grafana або CloudWatch Logs Insights. Структуровані JSON-логи (winston, pino) — обов'язково, інакше пошук по логах перетворюється на біль.
Що входить у налаштування хостингу
- Аудит поточної інфраструктури та профілювання навантаження
- Вибір цільової архітектури (VPS, AWS, serverless, Kubernetes)
- Налаштування CI/CD pipeline (GitHub Actions, GitLab CI) з автоматичним деплоєм
- IaC через Terraform або Pulumi (інфраструктура як код)
- Конфігурація Nginx, SSL-сертифікати, HTTP/2, brotli
- Моніторинг та алертинг (Prometheus + Grafana, PagerDuty)
- Документація runbooks та навчання команди
Додатково: пишіть, якщо потрібна міграція з поточного хостингу або інтеграція із зовнішніми сервісами.
Процес роботи
- Аудит поточної інфраструктури (2–5 днів)
- Вибір цільової архітектури з обґрунтуванням за навантаженням та бюджетом (1–3 дні)
- Налаштування CI/CD pipeline (GitHub Actions, GitLab CI) (2–5 днів)
- IaC через Terraform або Pulumi (3–10 днів)
- Налаштування моніторингу та alerting (2–5 днів)
- Документація runbooks та навчання команди (1–3 дні)
Наш досвід — 7 років на ринку, понад 50 проєктів, гарантія працездатності після деплою.
Терміни
- Базовий деплой на VPS з Docker + Nginx + CI/CD: 1–2 тижні.
- Налаштування AWS інфраструктури з Auto Scaling, RDS, CDN: 3–6 тижнів.
- Міграція на EKS з нуля: 6–12 тижнів.
- Налаштування Vercel/Netlify для JAMstack: 3–5 днів.
Вартість розраховується індивідуально залежно від складності та обсягу робіт. Отримайте консультацію — оцінимо вашу архітектуру за один день.