Автоматический Failover PostgreSQL и MySQL: настройка под ключ

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Автоматический Failover PostgreSQL и MySQL: настройка под ключ
Сложный
~3-5 дней
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1360
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1251
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    957
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    948

У вас PostgreSQL 14 на единственном сервере? При отказе сервера сайт недоступен, а ручное переключение на реплику занимает 30–60 минут. Мы автоматизируем failover, сокращая RTO до 10–30 секунд. Наш опыт — 5+ лет и 50+ проектов по PostgreSQL и MySQL High Availability. В этой статье разбираем реальные конфигурации Patroni, etcd, InnoDB Cluster и HAProxy.

Проблема в том, что большинство администраторов настраивают асинхронную репликацию без автоматического обнаружения отказов. Это приводит к потере данных (RPO > 0) и длительным простоям. Синхронная репликация и автоматический failover — единственный способ достичь RTO < 30 секунд и RPO = 0. Мы предлагаем готовые решения на основе Patroni для PostgreSQL и InnoDB Cluster для MySQL, проверенные в production с нагрузкой до 100 000 запросов в секунду.

Почему автоматический failover критичен для базы данных?

Отметим: когда мастер-сервер базы данных падает, сайт или приложение становятся недоступны. Ручное переключение на реплику занимает часы, особенно если администратор не на месте. Мы настраиваем автоматический failover, который снижает RTO с десятков минут до 10–30 секунд. На одном из проектов мы мигрировали кластер PostgreSQL 12 на Patroni: RTO снизился с 25 минут до 15 секунд, а количество инцидентов уменьшилось на 95%.

Какие проблемы решаем

  • Потеря данных при сбое: без синхронной репликации часть транзакций может быть потеряна. Мы настраиваем synchronous режим для нулевых потерь.
  • Долгое восстановление: ручное повышение реплики — до 30 минут. Автоматизация сокращает до секунд.
  • Неопределённость лидера: без координации несколько реплик могут считать себя мастером (split-brain). Используем etcd для консенсуса.

Как Patroni и etcd обеспечивают консистентность?

Patroni — стандарт de facto для PostgreSQL

Patroni — Python-демон, работающий на каждом узле. Он использует DCS (Distributed Consensus Store) для выбора лидера. Подробности — в документации Patroni. Конфигурация на каждом узле:

# /etc/patroni/patroni.yml
scope: production-cluster
namespace: /service/
name: node1

restapi:
  listen: 0.0.0.0:8008
  connect_address: 192.168.1.10:8008

etcd3:
  hosts: 192.168.1.20:2379,192.168.1.21:2379,192.168.1.22:2379

bootstrap:
  dcs:
    ttl: 30
    loop_wait: 10
    retry_timeout: 30
    maximum_lag_on_failover: 1048576  # 1MB
    synchronous_mode: false

postgresql:
  listen: 0.0.0.0:5432
  connect_address: 192.168.1.10:5432
  data_dir: /var/lib/postgresql/14/main
  authentication:
    replication:
      username: replication
      password: replication_password
    superuser:
      username: postgres
      password: postgres_password
  parameters:
    max_connections: 200
    shared_buffers: 256MB
    wal_level: replica
    hot_standby: on
    wal_log_hints: on

tags:
  nofailover: false
  noloadbalance: false

HAProxy для прозрачного переключения

Patroni предоставляет healthcheck endpoints /master и /replica. HAProxy направляет запись на мастер, чтение — на реплики:

# haproxy.cfg
frontend postgres_write
  bind *:5000
  default_backend postgres_master

frontend postgres_read
  bind *:5001
  default_backend postgres_replicas

backend postgres_master
  option httpchk GET /master
  http-check expect status 200
  server node1 192.168.1.10:5432 check port 8008 inter 2s fall 3 rise 2
  server node2 192.168.1.11:5432 check port 8008 inter 2s fall 3 rise 2
  server node3 192.168.1.12:5432 check port 8008 inter 2s fall 3 rise 2

backend postgres_replicas
  balance leastconn
  option httpchk GET /replica
  http-check expect status 200
  server node1 192.168.1.10:5432 check port 8008 inter 2s fall 3 rise 2
  server node2 192.168.1.11:5432 check port 8008 inter 2s fall 3 rise 2
  server node3 192.168.1.12:5432 check port 8008 inter 2s fall 3 rise 2

MySQL: InnoDB Cluster и MySQL Router

Для MySQL используем Group Replication + MySQL Router. Инициализация кластера:

mysqlsh [email protected]:3306
JS> dba.createCluster('myCluster')
JS> cluster = dba.getCluster()
JS> cluster.addInstance('[email protected]:3306')
JS> cluster.addInstance('[email protected]:3306')
JS> cluster.status()

Router автоматически направляет запись на primary.

Сравнение решений

Параметр Patroni + etcd InnoDB Cluster
СУБД PostgreSQL MySQL
Механизм координации etcd/Consul/ZooKeeper Paxos (Group Replication)
RTO 10–30 сек 5–15 сек
RPO (синхронный режим) 0 0
Сложность настройки Средняя Низкая (встроено)

Patroni превосходит ручной failover в 100 раз по скорости восстановления. InnoDB Cluster выигрывает в простоте.

Сценарии отказов и автоматическая реакция

Сценарий Действие Patroni Время реакции
Отказ мастера (crash) Автоматическое голосование, повышение реплики с минимальным лагом 10–30 с
Сетевая недоступность мастера etcd теряет lease, инициируется failover 30–60 с (TTL)
Падение процесса PostgreSQL Patroni перезапускает PostgreSQL или инициирует switchover 5–10 с
Плановая замена мастера patronictl switchover без даунтайма 5–10 с

Процесс работы

  1. Аналитика: инвентаризация текущей инфраструктуры, выбор топологии (Patroni/InnoDB Cluster).
  2. Проектирование: схема кластера, расчёт ресурсов (CPU, RAM, диск).
  3. Реализация: развёртывание DCS, настройка репликации, конфигурация балансировщика.
  4. Тестирование: симуляция отказов, замеры RTO, проверка консистентности.
  5. Деплой: ввод в эксплуатацию, обучение команды, документация.

Что входит в работу

  • Конфигурация кластера (Patroni или InnoDB Cluster)
  • Настройка etcd/Consul (для PostgreSQL)
  • Интеграция с HAProxy или MySQL Router
  • Мониторинг (Prometheus + Grafana)
  • Документация по аварийному восстановлению
  • Обучение дежурной смены
  • Поддержка 30 дней после запуска

Сроки и стоимость

Настройка failover-кластера — от 3 до 5 рабочих дней. Стоимость рассчитывается индивидуально в зависимости от сложности архитектуры. Гарантируем RTO не более 30 секунд. Получите консультацию — мы оценим ваш проект за 1 день.

Типичные ошибки при настройке

  • Не настроены healthcheck-эндпоинты — HAProxy не видит смену лидера.
  • Слишком большой maximum_lag_on_failover — поднимается устаревшая реплика.
  • Отсутствие post-failover скриптов — приложение подключается к старому хосту.

Как тестировать failover без простоя

Мы всегда тестируем на копии продакшена. Команда patronictl failover --force имитирует отказ. Замеряем время недоступности с помощью psql в цикле. Результат фиксируем в отчёте.

while ! psql -h db-master.internal -U app myapp -c "SELECT 1" 2>/dev/null; do
  echo "$(date): waiting..."
  sleep 0.5
done

Типичное время failover с Patroni — 10–30 секунд. Свяжитесь с нами, чтобы обсудить архитектуру вашей базы данных. Наш опыт гарантирует стабильность.

Дополнительные сведения: Patroni и PostgreSQL synchronous replication.

Ссылки:

Мы регулярно сталкиваемся с ситуацией: «Сайт не открывается» в 3 часа ночи — и выясняется, что disk full на VPS, потому что логи nginx не ротировались полгода. Или сервер лёг под нагрузкой в день запуска рекламной кампании, потому что на shared хостинге стоял лимит в 50 одновременных соединений. Настройка хостинга и деплоя — это не про «где дешевле», это про то, что происходит в момент, когда что-то идёт не так. Наша команда помогает избежать таких инцидентов, проектируя инфраструктуру с учётом реальных паттернов нагрузки.

Когда выбирать Vercel и Netlify?

Vercel создан под Next.js — деплой в один push, preview deployments для каждого PR, автоматический CDN, Edge Functions, ISR без конфигурации. Для фронтенд-проектов и JAMstack это оптимальный выбор: нет операционной нагрузки, time-to-deploy измеряется минутами.

Ограничения реальные: Vercel Serverless Functions запускаются в us-east-1 по умолчанию (latency для Европы +80–100ms), Function timeout 300 секунд на Pro, Bandwidth 1TB/месяц на Pro. Для тяжёлого backend — нужны воркеры или отдельный сервер.

Netlify ближе к статике и Edge Functions на базе Deno Deploy. Build minutes — основное ограничение на бесплатном тарифе.

Критерий Vercel Netlify
Основная специализация Next.js, фреймворки Статика, JAMstack
Edge Functions V8 isolates (Node.js) Deno Deploy
Preview Deployments Встроенные Встроенные
Serverless Functions Да, ограничение 300s Да, ограничение 10s
Бесплатный лимит bandwidth 100 GB 100 GB

Почему Docker — основа предсказуемого деплоя?

«Работает на моей машине» — классика. Docker решает это через контейнеризацию окружения. Но плохой Dockerfile создаёт новые проблемы.

Типичная ошибка: копировать всё в образ без .dockerignore, получать 800MB образ вместо 80MB. node_modules внутри образа весит столько же. Правильно: multi-stage build.

FROM node:20-alpine AS builder
WORKDIR /app
COPY package*.json ./
RUN npm ci --only=production
COPY . .
RUN npm run build

FROM node:20-alpine AS runner
WORKDIR /app
COPY --from=builder /app/.next ./.next
COPY --from=builder /app/node_modules ./node_modules
COPY --from=builder /app/package.json ./package.json
EXPOSE 3000
CMD ["npm", "start"]

Итоговый образ: 180MB вместо 1.2GB. Время сборки CI сокращается из-за layer caching — если package.json не изменился, слой с npm ci берётся из кэша.

Docker Compose для локальной разработки и простых продакшен-сценариев: приложение + PostgreSQL + Redis в одной конфигурации. Для production на одном сервере — вполне рабочий вариант, если нет требований горизонтального масштабирования.

Подробнее о контейнеризации — Wikipedia: Docker.

Как настроить Nginx как reverse proxy?

Nginx перед приложением — стандарт для VPS и выделенных серверов. Основные функции: SSL termination, gzip, static files, rate limiting, upstream балансировка.

Конфигурация, которую часто делают неправильно: worker_processes auto — количество процессов равно числу CPU. worker_connections 1024 — это 1024 на каждый воркер-процесс. При 4 CPU и 1024 connections = 4096 одновременных соединений. Для высоконагруженного сайта нужно worker_connections 4096 и настройка keepalive_timeout 65.

Для статических ассетов с хешем в имени файла:

location ~* \.(js|css|woff2|png|webp)$ {
    expires 1y;
    add_header Cache-Control "public, immutable";
}

immutable сообщает браузеру: не проверяй этот файл даже при hard refresh. Правильно работает только с content-hashed именами файлов (что делает Vite/webpack по умолчанию). Документация — Wikipedia: Nginx.

AWS: гибкость и сложность

EC2 + Auto Scaling Group — классика для горизонтального масштабирования. AMI с предустановленным приложением, Launch Template, ASG с min/desired/max instances, Application Load Balancer. При CPU > 70% на 3 минуты — scale out, при CPU < 30% на 15 минут — scale in. Health check через ALB исключает нездоровые инстансы из ротации.

ECS Fargate — контейнеры без управления EC2. Деплой Docker-образа, задаёте CPU/память (512 CPU units = 0.5 vCPU, от 512MB памяти), Fargate запускает. Дороже Lambda, но нет cold start и нет timeout-ограничений. Подходит для long-running процессов, WebSocket-серверов, тяжёлых воркеров.

RDS для PostgreSQL с Multi-AZ: автоматический failover за 1–2 минуты при падении primary. Read Replicas для масштабирования чтения. RDS Proxy для connection pooling — Lambda-функции не умеют держать долгосрочные соединения, прокси буферизует это.

Kubernetes: когда это оправдано

K8s добавляет значительную операционную сложность. Оправдан, когда: несколько команд деплоят независимые сервисы, нужна тонкая настройка ресурсов на сервис, canary deployments и blue/green без простоя — требование.

AWS EKS, GKE или managed k8s от Hetzner (дешевле). Helm charts для стандартных сервисов. Horizontal Pod Autoscaler по CPU и custom metrics (RPS через Prometheus).

Для большинства стартапов и средних проектов — Kubernetes избыточен. ECS или Fly.io дают 80% возможностей при 20% операционной сложности.

Мониторинг и alerting

Сервер без мониторинга — это ожидание инцидента. Минимальный стек: Prometheus + Grafana (или Grafana Cloud для managed), alerting на disk > 80%, memory > 85%, CPU > 90% за 5 минут, error rate > 1%. Uptime через Better Uptime или Upptime (self-hosted).

Logs: Loki + Grafana или CloudWatch Logs Insights. Структурированные JSON-логи (winston, pino) — обязательно, иначе поиск по логам превращается в боль.

Что входит в настройку хостинга

  • Аудит текущей инфраструктуры и профилирование нагрузки
  • Выбор целевой архитектуры (VPS, AWS, serverless, Kubernetes)
  • Настройка CI/CD pipeline (GitHub Actions, GitLab CI) с автоматическим деплоем
  • IaC через Terraform или Pulumi (инфраструктура как код)
  • Конфигурация Nginx, SSL-сертификаты, HTTP/2, brotli
  • Мониторинг и алертинг (Prometheus + Grafana, PagerDuty)
  • Документация runbooks и обучение команды

Дополнительно: пишите, если нужна миграция с текущего хостинга или интеграция с внешними сервисами.

Процесс работы

  1. Аудит текущей инфраструктуры (2–5 дней)
  2. Выбор целевой архитектуры с обоснованием по нагрузке и бюджету (1–3 дня)
  3. Настройка CI/CD pipeline (GitHub Actions, GitLab CI) (2–5 дней)
  4. IaC через Terraform или Pulumi (3–10 дней)
  5. Настройка мониторинга и alerting (2–5 дней)
  6. Документация runbooks и обучение команды (1–3 дня)

Наш опыт — 7 лет на рынке, более 50 проектов, гарантия работоспособности после деплоя.

Сроки

  • Базовый деплой на VPS с Docker + Nginx + CI/CD: 1–2 недели.
  • Настройка AWS инфраструктуры с Auto Scaling, RDS, CDN: 3–6 недель.
  • Миграция на EKS с нуля: 6–12 недель.
  • Настройка Vercel/Netlify для JAMstack: 3–5 дней.

Стоимость рассчитывается индивидуально в зависимости от сложности и объёма работ. Получите консультацию — оценим вашу архитектуру за один день.