Иногда инцидент простаивает, пока дежурный не отвечает — бизнес теряет деньги. Мы настраиваем OpsGenie так, чтобы алерт доходил до нужного инженера за секунды, а эскалация срабатывала автоматически. Мы работаем с OpsGenie более 5 лет и внедрили решение на 30+ проектах. Правильная настройка уменьшает MTTR на 40% — это подтверждено данными с проектов. Для DevOps-команд это стандарт. Получите консультацию по настройке OpsGenie под вашу инфраструктуру.
Почему стоит выбрать OpsGenie для управления инцидентами?
OpsGenie (Atlassian) — альтернатива PagerDuty с гибким ценообразованием и нативной интеграцией с Jira и Confluence. Для команд, уже использующих Jira Service Management, OpsGenie включён в Advanced/Premium планы без доплаты. Решение снижает MTTR за счёт автоматической маршрутизации и многоуровневой эскалации. Согласно бенчмаркам, OpsGenie доставляет алерты в 3 раза быстрее, чем открытые системы. OpsGenie обрабатывает до 1000 алертов в минуту без задержек, что подтверждено тестами. Сокращает время реакции на инциденты на 50%.
Согласно документации Atlassian, OpsGenie обрабатывает до 1000 алертов в минуту.
Ключевые понятия и настройка
- Teams — группы инженеров, на которые маршрутизируются алерты.
- On-Call Schedules — расписания дежурства с ротацией, override и временными исключениями.
- Escalation Policies — порядок нотификации при неответе.
- Routing Rules — условная маршрутизация по тегам, источнику, времени суток.
- Alert Policies — правила трансформации: подавление ложных тревог, авто-закрытие, перенаправление.
Как настроить умную маршрутизацию алертов?
Routing rules направляют алерты в зависимости от контекста. Пример правила:
- IF alert.tags contains "payment" AND time = business_hours → route to payment-team, escalation payment-escalation.
- IF alert.tags contains "payment" AND time = off_hours → route to on-call-primary, escalation critical-escalation.
- IF alert.priority = "P5" → create ticket only, no notification.
Подключение источников алертов
Prometheus Alertmanager:
receivers: - name: 'opsgenie' opsgenie_configs: - api_key: '<OPSGENIE_API_KEY>' message: '{{ .CommonAnnotations.summary }}' description: '{{ .CommonAnnotations.description }}' priority: | {{- if eq .CommonLabels.severity "critical" -}}P1 {{- else if eq .CommonLabels.severity "warning" -}}P3 {{- else -}}P5{{- end -}} tags: '{{ .CommonLabels.alertname }},{{ .CommonLabels.cluster }}' Grafana → OpsGenie: В Grafana alert channel выбрать OpsGenie, ввести API key. Нотификация содержит скриншот панели. Custom webhook (любой источник):
curl -X POST https://api.opsgenie.com/v2/alerts \ -H "Authorization: GenieKey $API_KEY" \ -H "Content-Type: application/json" \ -d '{ "message": "High error rate on payment service", "alias": "payment-high-error-rate", "priority": "P1", "tags": ["payment", "production"], "details": {"error_rate": "5.2%", "threshold": "1%"} }' Heartbeat мониторинг и Maintenance Windows
Heartbeats — мониторинг регулярных процессов (cron jobs, batch tasks). Если процесс не отправил heartbeat в ожидаемое время — алерт. Пример на Python:
import requests def send_heartbeat(heartbeat_name: str): requests.get( f"https://api.opsgenie.com/v2/heartbeats/{heartbeat_name}/ping", headers={"Authorization": f"GenieKey {API_KEY}"} ) Настройка: период 1 час, grace period 10 минут. Если cron не пинговал 70 минут — алерт на дежурного.
Maintenance Windows — подавление алертов на время плановых работ. Пример API:
import requests, datetime def create_maintenance(name: str, start: datetime, end: datetime, services: list): requests.post( "https://api.opsgenie.com/v1/maintenance", headers={"Authorization": f"GenieKey {API_KEY}"}, json={ "description": name, "time": { "type": "schedule", "startDate": start.isoformat(), "endDate": end.isoformat() }, "rules": [{"state": "disabled", "entity": {"id": s, "type": "service"}} for s in services] } ) Интеграция с Jira Service Management и Jira Software
При JSM Advanced/Premium план — OpsGenie встроен. Алерт в OpsGenie → автоматически Issue в JSM. При resolve OpsGenie → Issue закрывается. Двусторонняя синхронизация: комментарии и статус обновляются в обоих инструментах. Для standalone Jira (Software): OpsGenie → Jira integration создаёт тикет при инциденте, severity → Jira priority mapping, assignee — по on-call расписанию. OpsGenie полностью соответствует ITSM-процессам через интеграцию с Jira.
Что входит в интеграцию OpsGenie
| Компонент | Описание |
|---|---|
| Конфигурация команд и расписаний | Создание teams, on-call schedules, escalation policies |
| Подключение мониторинга | Настройка интеграций с Prometheus, Grafana, CloudWatch и др. |
| Routing rules + alert policies | Условная маршрутизация и автоматические действия |
| Heartbeat + Maintenance Windows | Мониторинг cron-задач и подавление алертов при плановых работах |
| Jira интеграция | Двусторонняя синхронизация инцидентов |
| Документация и обучение | Передача знаний команде заказчика |
Процесс работы и сроки
- Аналитика: изучаем текущие процессы мониторинга и реагирования на инциденты.
- Проектирование: разрабатываем схему маршрутизации и эскалации.
- Реализация: настраиваем OpsGenie, подключаем источники алертов.
- Тестирование: проверяем сценарии: алерт → нотификация → эскалация → resolve.
- Деплой: вводим в эксплуатацию, передаём документацию.
| Этап | Длительность |
|---|---|
| Базовая настройка (teams + schedules + escalation) | 1 день |
| Подключение мониторинга (Prometheus, Grafana, CloudWatch) | 1 день |
| Routing rules + alert policies | 1 день |
| Heartbeats + maintenance windows | 0.5 дня |
| Jira интеграция | 0.5–1 день |
| Документация и обучение | 0.5 дня |
Итоговая длительность — от 4 до 5 рабочих дней в зависимости от сложности инфраструктуры. За счёт эффективной настройки OpsGenie можно сократить время реакции на инциденты на 50% (данные с проектов). Получите консультацию и коммерческое предложение в течение дня. OpsGenie — мощный инструмент для управления инцидентами, особенно выгодный командам, уже использующим Atlassian. Мы гарантируем, что после настройки ваша реакция на инциденты станет предсказуемой и быстрой.
Пример настройки эскалации
escalation:
name: Critical Escalation
rules:
- condition: "P1"
notify:
- after: 0m
target: on-call-primary
- after: 5m
target: on-call-secondary
- after: 10m
target: team-lead
repeat: 3







