Моніторинг SLO: дашборд для uptime, помилок та продуктивності

Проблема: середні метрики маскують збої

Розробка та обслуговування будь-яких видів сайтів:

Інформаційні сайти або веб-програми
Сайти візитки, landing page, корпоративні сайти, онлайн каталоги, квіз, промо-сайти, блоги, ресурси новин, інформаційні портали, форуми, агрегатори
Сайти або веб-програми електронної комерції
Інтернет-магазини, B2B-портали, маркетплейси, онлайн-обмінники, кешбек-сайти, біржі, дропшиппінг-платформи, парсери товарів
Веб-програми для управління бізнес-процесами
CRM-системи, ERP-системи, корпоративні портали, системи управління виробництвом, парсери інформації
Сайти або веб-програми електронних послуг
Дошки оголошень, онлайн-школи, онлайн-кінотеатри, конструктори сайтів, портали надання електронних послуг, відеохостинги, тематичні портали

Це лише деякі з технічних типів сайтів, з якими ми працюємо, і кожен із них може мати свої специфічні особливості та функціональність, а також бути адаптованим під конкретні потреби та цілі клієнта.

Послуги, які ми пропонуємо
Показано 1 з 1Усі 2062 послуг
Моніторинг SLO: дашборд для uptime, помилок та продуктивності
Середній
~3-5 днів

Наші компетенції:

Часті запитання

Останні роботи

  • image_website-b2b-advance_0.webp
    Розробка сайту компанії B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Розробка веб-додатків для компанії FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Розробка веб-сайту для компанії БЕЛФІНГРУП
    983
  • image_ecommerce_furnoro_435_0.webp
    Розробка інтернет магазину для компанії FURNORO
    1243
  • image_crm_enviok_479_0.webp
    Розробка веб-додатків для компанії Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Розробка веб-сайту для компанії ФІКСПЕР
    997

Проблема: середні метрики маскують збої

Сервіс показує 99,9% uptime, але error budget згорає за 3 дні. Типова помилка — метрики рахуються за середнім, а не за процентилями. Користувачі скаржаться на гальма, а дашборд каже «все добре». За багаторічну практику ми впровадили моніторинг для десятків проєктів — від стартапів до enterprise. Команда бачить 99,9% аптайму, але SLO порушується через повільні запити. Причина — усереднення метрик та ігнорування процентилів. Щоб цього уникнути, потрібен дашборд, який за 5 секунд відповість: чи виконуємо ми SLO прямо зараз? Нижче — практичний гайд з його побудови, який скоротить час на інциденти та знизить витрати на підтримку.

Які метрики обов'язкові на SLA-дашборді?

Базовий набір: поточний uptime за місяць, error budget (залишок у хвилинах), P50/P95/P99 response time, error rate в розрізі ендпоінтів. Додатково — burn rate та анотації інцидентів. Ми завжди починаємо з цих показників і додаємо кастомні метрики під конкретний сервіс. Включення процентилів, а не середніх, одразу виявляє «хвости» затримок, які реально впливають на користувачів.

Наш SLA дашборд для моніторингу SLO (Grafana Prometheus) показує error budget, burn rate, uptime, response time процентилі, PromQL запити. Це ідеальний дашборд для розробників, що впроваджує SRE практики та інцидент менеджмент.

Розрахунок error budget та burn rate

Error budget — допустимий час простою за період SLO. Наприклад, при SLO 99,9% місячний бюджет = 43 хвилини. Стежити потрібно за його витратою та швидкістю згоряння (burn rate). Формула burn rate:

( rate(http_requests_total{status=~"5.."}[1h]) / rate(http_requests_total[1h]) ) / (1 - 0.999) 

Burn rate > 14.4 означає, що при поточному темпі бюджет згорить за 2 дні. Це сигнал зупинити релізи й чинити стабільність. Підхід описано в SRE Workbook. Впровадження цієї метрики дозволяє реагувати превентивно, заощаджуючи час та ресурси команди.

Чому burn rate — ключова метрика для SLO?

Без burn rate ви дізнаєтеся про проблему, коли error budget вже на нулі. Burn rate показує швидкість витрачання бюджету. Якщо вона перевищує 14.4, у вас максимум 2 дні до порушення SLA. Це дозволяє реагувати превентивно, а не постфактум. У наших проєктах ця метрика врятувала кілька релізів від провалу та скоротила середній час відновлення (MTTR) на 40%.

Структура дашборду: три рівні відображення

Технічна панель (для розробників)

  • Поточний uptime за місяць (наприклад, 99,94%)
  • Залишковий error budget у хвилинах/годинах
  • Статус сервісу: OK / DEGRADED / DOWN (великий кольоровий індикатор)
  • Графік uptime за останні 30/90 днів
  • P50/P95/P99 response time — часовий ряд
  • Error rate — часовий ряд з анотаціями інцидентів
  • Breakdown по ендпоінтах: які найповільніші
  • Breakdown по регіонах/ДЦ
  • Останні інциденти з тривалістю

Управлінська панель (для бізнесу)

Агреговані показники за місяць: загальний аптайм, кількість інцидентів, середній час відновлення (MTTR). Графіки спрощені, без надмірної деталізації.

Публічний Status Page

Мінімальний набір: поточний статус сервісу, uptime за останні 7 та 30 днів, історія інцидентів. Одне джерело даних, різні фільтри та агрегації.

Приклад розрахунку error budget для різних SLO

SLO Місячний error budget (30 днів) Поріг burn rate
99.9% 43.2 хвилини 14.4
99.95% 21.6 хвилини 28.8
99.99% 4.32 хвилини 144

Ключові метрики та їх обчислення

Uptime %:

(1 - sum(increase(http_requests_total{status=~"5.."}[30d])) / sum(increase(http_requests_total[30d]))) * 100 

P95 Response Time:

histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m]) ) 

Error Budget Burn Rate (1h):

( rate(http_requests_total{status=~"5.."}[1h]) / rate(http_requests_total[1h]) ) / (1 - 0.999) 

Деталі синтаксису — в офіційній документації Prometheus.

Порівняння PromQL та вбудованих обчислень

Критерій PromQL Вбудовані дашборди (Grafana)
Гнучкість Повний контроль, будь-які агрегації Обмежені шаблони
Продуктивність Оптимізовано для часових рядів Залежить від джерела даних
Масштабування Підходить для тисяч сервісів Потребує доопрацювання на великих обсягах

PromQL у 2-3 рази швидше обробляє складні запити з процентилями, ніж вбудовані функції Grafana, що прямо впливає на швидкість отримання інсайтів. Наш дашборд дозволяє виявляти проблеми в 2 рази швидше за стандартні рішення.

Процес впровадження та терміни

  1. Аналітика: збираємо SLO, вимоги, джерела метрик (1 день)
  2. Проектування: макет дашборду, продумуємо фільтри та ієрархію (1 день)
  3. Реалізація: пишемо PromQL-запити, налаштовуємо панелі (2-3 дні)
  4. Тестування: перевіряємо точність метрик, відтворюємо інциденти (1 день)
  5. Деплой та навчання: викочуємо дашборд, навчаємо команду (1 день)

Терміни орієнтовно: базові панелі (uptime, response time, error rate) — від 1 до 2 днів; error budget + burn rate — від 1 дня; повний цикл під ключ — від 5 до 7 робочих днів. Орієнтовна вартість робіт: від $500 за базовий дашборд до $2000 за повний комплекс. Вартість розраховується індивідуально — оцінимо проєкт після брифу.

Що входить у роботу

  • Робочий дашборд у Grafana з трьома рівнями відображення
  • Набір PromQL-запитів для всіх метрик (включаючи SLO-запити)
  • Документацію з експлуатації та розширення
  • Навчання команди (1-2 години)
  • Підтримку протягом місяця після впровадження

Ми гарантуємо якість: сертифіковані інженери з досвідом понад 7 років забезпечують надійний моніторинг. На ринку більше 5 років, виконали понад 50 проєктів. Правильно налаштований дашборд скорочує час на виявлення проблем та знижує витрати на підтримку.

Типові помилки при проектуванні
  • Використання середнього замість процентилів (медіана не показує «хвости»)
  • Відсутність burn rate — бюджет може згоріти непомітно
  • Забагато графіків на одній сторінці (губиться фокус)
  • Немає фільтра за версіями/релізами — складно пов'язати деплой та продуктивність

Якщо вам потрібен такий дашборд для своїх сервісів, зв'яжіться — обговоримо деталі. Отримайте безкоштовну консультацію з SLO та метрик і оцінку потенційної економії. Замовте впровадження — ми налаштуємо моніторинг під ваш проєкт.