Налаштування On-Call ротації для команди підтримки сайту

Ми зіткнулися з ситуацією: команда підтримки з трьох осіб вигоріла за два місяці через хаотичні нічні виклики. Інциденти накопичувалися, MTTA зріс до години. Рішення — впровадження **on-call ротації** з чіткими правилами ескалації. За два тижні MTTA знизився до 5 хвилин, а навантаження розподілилося

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Налаштування On-Call ротації для команди підтримки сайту
Середній
~2-3 дні

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    983
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1242
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    997

Ми зіткнулися з ситуацією: команда підтримки з трьох осіб вигоріла за два місяці через хаотичні нічні виклики. Інциденти накопичувалися, MTTA зріс до години. Рішення — впровадження on-call ротації з чіткими правилами ескалації. За два тижні MTTA знизився до 5 хвилин, а навантаження розподілилося рівномірно. Правильне налаштування окупається за перший місяць, а вартість організації ротації варіюється залежно від обсягу інтеграцій.

Аналіз проблеми: чому команди вигорають на чергуваннях

On-call ротація — це система, при якій відповідальність за реакцію на інциденти поза робочим часом розподіляється між членами команди по черзі. Без ротації — один черговий вигорає за місяць. З правильно налаштованою ротацією — навантаження рівномірне, а реакція передбачувана. Наш досвід показує, що weekly ротація краща за щомісячну в 3 рази за швидкістю відновлення контексту.

Проектування схеми ротації

Як вибрати період ротації?

Період Утримання контексту Alert fatigue Для яких команд
1 тиждень Високе Середнє Більшість (2–6 осіб)
2 тижні Середнє Низьке Зрілі команди з низьким noise
4 тижні Низьке Дуже низьке Великі команди (8+)

Primary on-call: перший рівень, отримує всі алерти. Час реакції — 5-15 хвилин. Secondary on-call (backup): якщо primary не відповів за 10-15 хвилин — ескалація на secondary. Escalation path: Primary → Secondary → Engineering Manager → CTO. Кожен рівень додає 10-15 хвилин.

Інструменти онкол-системи: PagerDuty та альтернативи

Налаштування ескалацій в PagerDuty

Service → Escalation Policy: Level 1: On-Call schedule (primary) - Notify after: immediately - Escalate after: 15 minutes Level 2: On-Call schedule (secondary) - Notify after: escalation - Escalate after: 15 minutes Level 3: Engineering Manager - Notify after: escalation Schedule (Primary): Rotation type: Weekly Handoff time: Monday 10:00 local time Restrictions: None (24/7 coverage) Layer 1: [Engineer A, Engineer B, Engineer C, Engineer D] 

Handoff в робочий час — інженер приймає зміну в спокійній обстановці, вивчає відкриті інциденти.

Інтеграція з моніторингом

Інтегруйте моніторинг (Prometheus, Datadog, Sentry) з PagerDuty через webhook. Налаштуйте smart-нотифікації: вдень Slack, вночі дзвінок. Це знижує alert fatigue і підвищує MTTA.

Впровадження: покрокова інструкція для команди

  1. Визначте розмір команди та години покриття. Для 4 осіб оптимальна тижнева ротація.
  2. Створіть schedule в PagerDuty/OpsGenie: вкажіть учасників, тип ротації (weekly), час handoff (наприклад, понеділок 10:00).
  3. Налаштуйте escalation policy: primary отримує алерт одразу, якщо не відповідає 15 хвилин — secondary, ще 15 хвилин — менеджер.
  4. Налаштуйте канали нотифікації: Slack, дзвінок, SMS.
  5. Проведіть пілотний прогін.

Підготовка runbook і handoff-процедури

Runbook для типових інцидентів прискорює реакцію. Приклад: при 503 — перезапустити Nginx. Handoff-замітка містить: список відкритих інцидентів, нестабільні компоненти, заплановані зміни, «гарячі» місця. Шаблон у Slack або Confluence.

Навчання та пілотний прогін

Проведіть навчання команди по runbook і handoff. Пілотний прогін протягом тижня виявить вузькі місця.

Управління інцидентами: як боротися з alert fatigue

Що таке alert fatigue і як з ним боротися?

On-call працює тільки якщо алерти значущі. Якщо за черговий тиждень приходить 50 алертів, з яких 45 — шум, через місяць команда перестає реагувати. Alert fatigue — головний ворог чергового. Інструменти боротьби: alert grouping, smart-нотифікації, щотижневий рев’ю, SLO-based alerting на burn rate.

Метрики здоров'я онкол-системи

Метрика Норма Як покращити
Incidents per week per engineer <5 Знижувати alarm noise
After-hours incidents % <30% Покращувати моніторинг вдень
MTTA <15 хвилин Посилити escalation policy
Fatigue score <3/5 Регулярні рев’ю, компенсація

Компенсація та утримання чергових

On-call — це додаткове навантаження, яке має компенсуватися: грошова надбавка за черговий тиждень, відгул після важкого тижня, компенсація за кожен нічний виклик. Команда без компенсації — команда, яка саботує чергування або йде.

Терміни та що входить у налаштування під ключ

  • Проектування схеми ротації з урахуванням розміру команди та графіка
  • Налаштування PagerDuty/OpsGenie: schedules, escalation policies, layers
  • Інтеграція з моніторингом (Prometheus, Datadog, Sentry)
  • Конфігурація каналів нотифікації: Slack, дзвінок, SMS
  • Документація: runbook, handoff шаблон, інструкції для чергових
  • Навчання команди та пілотний прогін

Джерело: документація PagerDuty

Терміни налаштування

  • PagerDuty/OpsGenie + schedules + escalation policy — 1-2 дні
  • Інтеграція з Prometheus/Datadog алертами — 1-2 дні
  • Налаштування каналів нотифікації (Slack, дзвінок, SMS) — 1 день
  • Документація процесу + навчання команди — 1-2 дні

Отримайте консультацію щодо впровадження on-call ротації для вашої команди. Зв'яжіться з нами — оцінимо проект і запропонуємо рішення за 2 дні. Замовте налаштування під ключ, і ми гарантуємо зниження MTTA до 5 хвилин.