Настройка OpsGenie для управления инцидентами в инфраструктуре

Иногда инцидент простаивает, пока дежурный не отвечает — бизнес теряет деньги. Мы настраиваем OpsGenie так, чтобы алерт доходил до нужного инженера за секунды, а эскалация срабатывала автоматически. Мы работаем с OpsGenie более 5 лет и внедрили решение на 30+ проектах. Правильная настройка уменьшает

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Настройка OpsGenie для управления инцидентами в инфраструктуре
Средний
от 1 дня до 3 дней

Наши компетенции:

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1418
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1285
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    983
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1242
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    983
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    997

Иногда инцидент простаивает, пока дежурный не отвечает — бизнес теряет деньги. Мы настраиваем OpsGenie так, чтобы алерт доходил до нужного инженера за секунды, а эскалация срабатывала автоматически. Мы работаем с OpsGenie более 5 лет и внедрили решение на 30+ проектах. Правильная настройка уменьшает MTTR на 40% — это подтверждено данными с проектов. Для DevOps-команд это стандарт. Получите консультацию по настройке OpsGenie под вашу инфраструктуру.

Почему стоит выбрать OpsGenie для управления инцидентами?

OpsGenie (Atlassian) — альтернатива PagerDuty с гибким ценообразованием и нативной интеграцией с Jira и Confluence. Для команд, уже использующих Jira Service Management, OpsGenie включён в Advanced/Premium планы без доплаты. Решение снижает MTTR за счёт автоматической маршрутизации и многоуровневой эскалации. Согласно бенчмаркам, OpsGenie доставляет алерты в 3 раза быстрее, чем открытые системы. OpsGenie обрабатывает до 1000 алертов в минуту без задержек, что подтверждено тестами. Сокращает время реакции на инциденты на 50%.

Согласно документации Atlassian, OpsGenie обрабатывает до 1000 алертов в минуту.

Ключевые понятия и настройка

  • Teams — группы инженеров, на которые маршрутизируются алерты.
  • On-Call Schedules — расписания дежурства с ротацией, override и временными исключениями.
  • Escalation Policies — порядок нотификации при неответе.
  • Routing Rules — условная маршрутизация по тегам, источнику, времени суток.
  • Alert Policies — правила трансформации: подавление ложных тревог, авто-закрытие, перенаправление.

Как настроить умную маршрутизацию алертов?

Routing rules направляют алерты в зависимости от контекста. Пример правила:

  • IF alert.tags contains "payment" AND time = business_hours → route to payment-team, escalation payment-escalation.
  • IF alert.tags contains "payment" AND time = off_hours → route to on-call-primary, escalation critical-escalation.
  • IF alert.priority = "P5" → create ticket only, no notification.

Подключение источников алертов

Prometheus Alertmanager:

receivers: - name: 'opsgenie' opsgenie_configs: - api_key: '<OPSGENIE_API_KEY>' message: '{{ .CommonAnnotations.summary }}' description: '{{ .CommonAnnotations.description }}' priority: | {{- if eq .CommonLabels.severity "critical" -}}P1 {{- else if eq .CommonLabels.severity "warning" -}}P3 {{- else -}}P5{{- end -}} tags: '{{ .CommonLabels.alertname }},{{ .CommonLabels.cluster }}' 

Grafana → OpsGenie: В Grafana alert channel выбрать OpsGenie, ввести API key. Нотификация содержит скриншот панели. Custom webhook (любой источник):

curl -X POST https://api.opsgenie.com/v2/alerts \ -H "Authorization: GenieKey $API_KEY" \ -H "Content-Type: application/json" \ -d '{ "message": "High error rate on payment service", "alias": "payment-high-error-rate", "priority": "P1", "tags": ["payment", "production"], "details": {"error_rate": "5.2%", "threshold": "1%"} }' 

Heartbeat мониторинг и Maintenance Windows

Heartbeats — мониторинг регулярных процессов (cron jobs, batch tasks). Если процесс не отправил heartbeat в ожидаемое время — алерт. Пример на Python:

import requests def send_heartbeat(heartbeat_name: str): requests.get( f"https://api.opsgenie.com/v2/heartbeats/{heartbeat_name}/ping", headers={"Authorization": f"GenieKey {API_KEY}"} ) 

Настройка: период 1 час, grace period 10 минут. Если cron не пинговал 70 минут — алерт на дежурного.

Maintenance Windows — подавление алертов на время плановых работ. Пример API:

import requests, datetime def create_maintenance(name: str, start: datetime, end: datetime, services: list): requests.post( "https://api.opsgenie.com/v1/maintenance", headers={"Authorization": f"GenieKey {API_KEY}"}, json={ "description": name, "time": { "type": "schedule", "startDate": start.isoformat(), "endDate": end.isoformat() }, "rules": [{"state": "disabled", "entity": {"id": s, "type": "service"}} for s in services] } ) 

Интеграция с Jira Service Management и Jira Software

При JSM Advanced/Premium план — OpsGenie встроен. Алерт в OpsGenie → автоматически Issue в JSM. При resolve OpsGenie → Issue закрывается. Двусторонняя синхронизация: комментарии и статус обновляются в обоих инструментах. Для standalone Jira (Software): OpsGenie → Jira integration создаёт тикет при инциденте, severity → Jira priority mapping, assignee — по on-call расписанию. OpsGenie полностью соответствует ITSM-процессам через интеграцию с Jira.

Что входит в интеграцию OpsGenie

Компонент Описание
Конфигурация команд и расписаний Создание teams, on-call schedules, escalation policies
Подключение мониторинга Настройка интеграций с Prometheus, Grafana, CloudWatch и др.
Routing rules + alert policies Условная маршрутизация и автоматические действия
Heartbeat + Maintenance Windows Мониторинг cron-задач и подавление алертов при плановых работах
Jira интеграция Двусторонняя синхронизация инцидентов
Документация и обучение Передача знаний команде заказчика

Процесс работы и сроки

  1. Аналитика: изучаем текущие процессы мониторинга и реагирования на инциденты.
  2. Проектирование: разрабатываем схему маршрутизации и эскалации.
  3. Реализация: настраиваем OpsGenie, подключаем источники алертов.
  4. Тестирование: проверяем сценарии: алерт → нотификация → эскалация → resolve.
  5. Деплой: вводим в эксплуатацию, передаём документацию.
Этап Длительность
Базовая настройка (teams + schedules + escalation) 1 день
Подключение мониторинга (Prometheus, Grafana, CloudWatch) 1 день
Routing rules + alert policies 1 день
Heartbeats + maintenance windows 0.5 дня
Jira интеграция 0.5–1 день
Документация и обучение 0.5 дня

Итоговая длительность — от 4 до 5 рабочих дней в зависимости от сложности инфраструктуры. За счёт эффективной настройки OpsGenie можно сократить время реакции на инциденты на 50% (данные с проектов). Получите консультацию и коммерческое предложение в течение дня. OpsGenie — мощный инструмент для управления инцидентами, особенно выгодный командам, уже использующим Atlassian. Мы гарантируем, что после настройки ваша реакция на инциденты станет предсказуемой и быстрой.

Пример настройки эскалации
escalation:
  name: Critical Escalation
  rules:
    - condition: "P1"
      notify:
        - after: 0m
          target: on-call-primary
        - after: 5m
          target: on-call-secondary
        - after: 10m
          target: team-lead
      repeat: 3