Іноді інцидент простоює, поки черговий не відповідає — бізнес втрачає гроші. Ми налаштовуємо OpsGenie так, щоб алерт доходив до потрібного інженера за секунди, а ескалація спрацьовувала автоматично. Ми працюємо з OpsGenie понад 5 років і впровадили рішення на 30+ проєктах. Правильне налаштування зменшує MTTR на 40% — це підтверджено даними з проєктів. Для DevOps-команд це стандарт. Отримайте консультацію з налаштування OpsGenie під вашу інфраструктуру.
Чому варто обрати OpsGenie для управління інцидентами?
OpsGenie (Atlassian) — альтернатива PagerDuty з гнучким ціноутворенням і нативною інтеграцією з Jira та Confluence. Для команд, які вже використовують Jira Service Management, OpsGenie включений в Advanced/Premium плани без доплати. Рішення знижує MTTR за рахунок автоматичної маршрутизації та багаторівневої ескалації. Згідно з бенчмарками, OpsGenie доставляє алерти в 3 рази швидше, ніж відкриті системи. OpsGenie обробляє до 1000 алертів на хвилину без затримок, що підтверджено тестами. Скорочує час реакції на інциденти на 50%.
Згідно з документацією Atlassian, OpsGenie обробляє до 1000 алертів на хвилину.
Ключові поняття та налаштування
- Teams — групи інженерів, на які маршрутизуються алерти.
- On-Call Schedules — розклади чергування з ротацією, override та тимчасовими винятками.
- Escalation Policies — порядок нотифікації при невідповіді.
- Routing Rules — умовна маршрутизація за тегами, джерелом, часом доби.
- Alert Policies — правила трансформації: придушення хибних тривог, авто-закриття, перенаправлення.
Як налаштувати розумну маршрутизацію алертів?
Routing rules направляють алерти залежно від контексту. Приклад правила:
- IF alert.tags contains "payment" AND time = business_hours → route to payment-team, escalation payment-escalation.
- IF alert.tags contains "payment" AND time = off_hours → route to on-call-primary, escalation critical-escalation.
- IF alert.priority = "P5" → create ticket only, no notification.
Підключення джерел алертів
Prometheus Alertmanager:
receivers: - name: 'opsgenie' opsgenie_configs: - api_key: '<OPSGENIE_API_KEY>' message: '{{ .CommonAnnotations.summary }}' description: '{{ .CommonAnnotations.description }}' priority: | {{- if eq .CommonLabels.severity "critical" -}}P1 {{- else if eq .CommonLabels.severity "warning" -}}P3 {{- else -}}P5{{- end -}} tags: '{{ .CommonLabels.alertname }},{{ .CommonLabels.cluster }}' Grafana → OpsGenie: В Grafana alert channel обрати OpsGenie, ввести API key. Нотифікація містить скріншот панелі. Custom webhook (будь-яке джерело):
curl -X POST https://api.opsgenie.com/v2/alerts \ -H "Authorization: GenieKey $API_KEY" \ -H "Content-Type: application/json" \ -d '{ "message": "High error rate on payment service", "alias": "payment-high-error-rate", "priority": "P1", "tags": ["payment", "production"], "details": {"error_rate": "5.2%", "threshold": "1%"} }' Heartbeat моніторинг та Maintenance Windows
Heartbeats — моніторинг регулярних процесів (cron jobs, batch tasks). Якщо процес не надіслав heartbeat в очікуваний час — алерт. Приклад на Python:
import requests def send_heartbeat(heartbeat_name: str): requests.get( f"https://api.opsgenie.com/v2/heartbeats/{heartbeat_name}/ping", headers={"Authorization": f"GenieKey {API_KEY}"} ) Налаштування: період 1 година, grace period 10 хвилин. Якщо cron не пінгував 70 хвилин — алерт на чергового.
Maintenance Windows — придушення алертів на час планових робіт. Приклад API:
import requests, datetime def create_maintenance(name: str, start: datetime, end: datetime, services: list): requests.post( "https://api.opsgenie.com/v1/maintenance", headers={"Authorization": f"GenieKey {API_KEY}"}, json={ "description": name, "time": { "type": "schedule", "startDate": start.isoformat(), "endDate": end.isoformat() }, "rules": [{"state": "disabled", "entity": {"id": s, "type": "service"}} for s in services] } ) Інтеграція з Jira Service Management та Jira Software
При JSM Advanced/Premium план — OpsGenie вбудований. Алерт в OpsGenie → автоматично Issue в JSM. При resolve OpsGenie → Issue закривається. Двостороння синхронізація: коментарі та статус оновлюються в обох інструментах. Для standalone Jira (Software): OpsGenie → Jira integration створює тікет при інциденті, severity → Jira priority mapping, assignee — за on-call розкладом. OpsGenie повністю відповідає ITSM-процесам через інтеграцію з Jira.
Що входить в інтеграцію OpsGenie
| Компонент | Опис |
|---|---|
| Конфігурація команд і розкладів | Створення teams, on-call schedules, escalation policies |
| Підключення моніторингу | Налаштування інтеграцій з Prometheus, Grafana, CloudWatch та ін. |
| Routing rules + alert policies | Умовна маршрутизація та автоматичні дії |
| Heartbeat + Maintenance Windows | Моніторинг cron-задач та придушення алертів при планових роботах |
| Jira інтеграція | Двостороння синхронізація інцидентів |
| Документація та навчання | Передача знань команді замовника |
Процес роботи та терміни
- Аналітика: вивчаємо поточні процеси моніторингу та реагування на інциденти.
- Проектування: розробляємо схему маршрутизації та ескалації.
- Реалізація: налаштовуємо OpsGenie, підключаємо джерела алертів.
- Тестування: перевіряємо сценарії: алерт → нотифікація → ескалація → resolve.
- Деплой: вводимо в експлуатацію, передаємо документацію.
| Етап | Тривалість |
|---|---|
| Базова настройка (teams + schedules + escalation) | 1 день |
| Підключення моніторингу (Prometheus, Grafana, CloudWatch) | 1 день |
| Routing rules + alert policies | 1 день |
| Heartbeats + maintenance windows | 0.5 дня |
| Jira інтеграція | 0.5–1 день |
| Документація та навчання | 0.5 дня |
Підсумкова тривалість — від 4 до 5 робочих днів залежно від складності інфраструктури. За рахунок ефективного налаштування OpsGenie можна скоротити час реакції на інциденти на 50% (дані з проєктів). Отримайте консультацію та комерційну пропозицію протягом дня. OpsGenie — потужний інструмент для управління інцидентами, особливо вигідний командам, які вже використовують Atlassian. Ми гарантуємо, що після налаштування ваша реакція на інциденти стане передбачуваною та швидкою.
Приклад налаштування ескалації
escalation:
name: Critical Escalation
rules:
- condition: "P1"
notify:
- after: 0m
target: on-call-primary
- after: 5m
target: on-call-secondary
- after: 10m
target: team-lead
repeat: 3







