Ми зіткнулися з ситуацією: команда підтримки з трьох осіб вигоріла за два місяці через хаотичні нічні виклики. Інциденти накопичувалися, MTTA зріс до години. Рішення — впровадження on-call ротації з чіткими правилами ескалації. За два тижні MTTA знизився до 5 хвилин, а навантаження розподілилося рівномірно. Правильне налаштування окупається за перший місяць, а вартість організації ротації варіюється залежно від обсягу інтеграцій.
Аналіз проблеми: чому команди вигорають на чергуваннях
On-call ротація — це система, при якій відповідальність за реакцію на інциденти поза робочим часом розподіляється між членами команди по черзі. Без ротації — один черговий вигорає за місяць. З правильно налаштованою ротацією — навантаження рівномірне, а реакція передбачувана. Наш досвід показує, що weekly ротація краща за щомісячну в 3 рази за швидкістю відновлення контексту.
Проектування схеми ротації
Як вибрати період ротації?
| Період | Утримання контексту | Alert fatigue | Для яких команд |
|---|---|---|---|
| 1 тиждень | Високе | Середнє | Більшість (2–6 осіб) |
| 2 тижні | Середнє | Низьке | Зрілі команди з низьким noise |
| 4 тижні | Низьке | Дуже низьке | Великі команди (8+) |
Primary on-call: перший рівень, отримує всі алерти. Час реакції — 5-15 хвилин. Secondary on-call (backup): якщо primary не відповів за 10-15 хвилин — ескалація на secondary. Escalation path: Primary → Secondary → Engineering Manager → CTO. Кожен рівень додає 10-15 хвилин.
Інструменти онкол-системи: PagerDuty та альтернативи
Налаштування ескалацій в PagerDuty
Service → Escalation Policy: Level 1: On-Call schedule (primary) - Notify after: immediately - Escalate after: 15 minutes Level 2: On-Call schedule (secondary) - Notify after: escalation - Escalate after: 15 minutes Level 3: Engineering Manager - Notify after: escalation Schedule (Primary): Rotation type: Weekly Handoff time: Monday 10:00 local time Restrictions: None (24/7 coverage) Layer 1: [Engineer A, Engineer B, Engineer C, Engineer D] Handoff в робочий час — інженер приймає зміну в спокійній обстановці, вивчає відкриті інциденти.
Інтеграція з моніторингом
Інтегруйте моніторинг (Prometheus, Datadog, Sentry) з PagerDuty через webhook. Налаштуйте smart-нотифікації: вдень Slack, вночі дзвінок. Це знижує alert fatigue і підвищує MTTA.
Впровадження: покрокова інструкція для команди
- Визначте розмір команди та години покриття. Для 4 осіб оптимальна тижнева ротація.
- Створіть schedule в PagerDuty/OpsGenie: вкажіть учасників, тип ротації (weekly), час handoff (наприклад, понеділок 10:00).
- Налаштуйте escalation policy: primary отримує алерт одразу, якщо не відповідає 15 хвилин — secondary, ще 15 хвилин — менеджер.
- Налаштуйте канали нотифікації: Slack, дзвінок, SMS.
- Проведіть пілотний прогін.
Підготовка runbook і handoff-процедури
Runbook для типових інцидентів прискорює реакцію. Приклад: при 503 — перезапустити Nginx. Handoff-замітка містить: список відкритих інцидентів, нестабільні компоненти, заплановані зміни, «гарячі» місця. Шаблон у Slack або Confluence.
Навчання та пілотний прогін
Проведіть навчання команди по runbook і handoff. Пілотний прогін протягом тижня виявить вузькі місця.
Управління інцидентами: як боротися з alert fatigue
Що таке alert fatigue і як з ним боротися?
On-call працює тільки якщо алерти значущі. Якщо за черговий тиждень приходить 50 алертів, з яких 45 — шум, через місяць команда перестає реагувати. Alert fatigue — головний ворог чергового. Інструменти боротьби: alert grouping, smart-нотифікації, щотижневий рев’ю, SLO-based alerting на burn rate.
Метрики здоров'я онкол-системи
| Метрика | Норма | Як покращити |
|---|---|---|
| Incidents per week per engineer | <5 | Знижувати alarm noise |
| After-hours incidents % | <30% | Покращувати моніторинг вдень |
| MTTA | <15 хвилин | Посилити escalation policy |
| Fatigue score | <3/5 | Регулярні рев’ю, компенсація |
Компенсація та утримання чергових
On-call — це додаткове навантаження, яке має компенсуватися: грошова надбавка за черговий тиждень, відгул після важкого тижня, компенсація за кожен нічний виклик. Команда без компенсації — команда, яка саботує чергування або йде.
Терміни та що входить у налаштування під ключ
- Проектування схеми ротації з урахуванням розміру команди та графіка
- Налаштування PagerDuty/OpsGenie: schedules, escalation policies, layers
- Інтеграція з моніторингом (Prometheus, Datadog, Sentry)
- Конфігурація каналів нотифікації: Slack, дзвінок, SMS
- Документація: runbook, handoff шаблон, інструкції для чергових
- Навчання команди та пілотний прогін
Джерело: документація PagerDuty
Терміни налаштування
- PagerDuty/OpsGenie + schedules + escalation policy — 1-2 дні
- Інтеграція з Prometheus/Datadog алертами — 1-2 дні
- Налаштування каналів нотифікації (Slack, дзвінок, SMS) — 1 день
- Документація процесу + навчання команди — 1-2 дні
Отримайте консультацію щодо впровадження on-call ротації для вашої команди. Зв'яжіться з нами — оцінимо проект і запропонуємо рішення за 2 дні. Замовте налаштування під ключ, і ми гарантуємо зниження MTTA до 5 хвилин.







