Мониторинг сервера с Datadog: настройка агента, APM, логов и алертов

Наша компания занимается разработкой, поддержкой и обслуживанием сайтов любой сложности. От простых одностраничных сайтов до масштабных кластерных систем построенных на микро сервисах. Опыт разработчиков подтвержден сертификатами от вендоров.

Разработка и обслуживание любых видов сайтов:

Информационные сайты или веб-приложения
Сайты визитки, landing page, корпоративные сайты, онлайн каталоги, квиз, промо-сайты, блоги, новостные ресурсы, информационные порталы, форумы, агрегаторы
Сайты или веб-приложения электронной коммерции
Интернет-магазины, B2B-порталы, маркетплейсы, онлайн-обменники, кэшбэк-сайты, биржи, дропшиппинг-платформы, парсеры товаров
Веб-приложения для управления бизнес-процессами
CRM-системы, ERP-системы, корпоративные порталы, системы управления производством, парсеры информации
Сайты или веб-приложения электронных услуг
Доски объявлений, онлайн-школы, онлайн-кинотеатры, конструкторы сайтов, порталы предоставления электронных услуг, видеохостинги, тематические порталы

Это лишь некоторые из технических типов сайтов, с которыми мы работаем, и каждый из них может иметь свои специфические особенности и функциональность, а также быть адаптированным под конкретные потребности и цели клиента

Услуги, которые мы предлагаем
Показано 1 из 1Все 2062 услуг
Мониторинг сервера с Datadog: настройка агента, APM, логов и алертов
Средний
~2-3 дня
Часто задаваемые вопросы

Наши компетенции:

Этапы разработки

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1358
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1250
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    956
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1188
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    929
  • image_bitrix-bitrix-24-1c_fixper_448_0.webp
    Разработка веб-сайта для компании ФИКСПЕР
    947

Почему именно Datadog для мониторинга серверов?

Вы замечаете, что сайт медленно грузится, но не можете понять, где узкое место? Ошибки 500 без стека, а пользователи уходят к конкурентам. Мы сталкивались с этим не раз: production-среда — чёрный ящик, пока не внедришь инструментарий. Datadog решает эту задачу: SaaS-платформа мониторинга с агентом на серверах. Она собирает метрики инфраструктуры, APM (трассировка запросов), логи и синтетические тесты в едином интерфейсе. Наши инженеры имеют сертификаты Datadog и 10+ лет опыта в веб-разработке, поэтому гарантируем качественную настройку под ключ.

Стоимость облачной подписки Datadog начинается от $15 на хост в месяц, но наш сервис настройки окупается за счёт предотвращения простоев. Datadog documentation подтверждает, что компании, использующие APM, сокращают время на поиск корневых причин инцидентов на 50%.

Почему Datadog лучше open-source стека?

Prometheus + Grafana — мощная связка, но она требует ручного конфигурирования алертов, хранения метрик и интеграции с APM. Datadog из коробки даёт готовые дашборды, автоматическое обнаружение сервисов (например, через Docker labels) и единый интерфейс для логов, метрик и трейсов. Сравните: настройка Prometheus с нуля занимает 3–5 дней, а Datadog — 1–2 дня. Кроме того, Datadog поддерживает 600+ интеграций, включая AWS, GCP, Azure, что критично для гибридной инфраструктуры.

Проблемы, которые решаем с помощью Datadog

Невидимые ошибки в production

Без APM вы видите только HTTP-статусы. Datadog автоматически собирает стеки ошибок и связывает их с конкретными транзакциями. Например, в Laravel мы настраиваем DDTrace\GlobalTracer, чтобы ловить исключения в сервисах. Это помогает обнаружить, что метод OrderService::processOrder() падает с PDOException из-за блокировки в PostgreSQL.

N+1 запросы и медленные SQL

Datadog APM показывает длительность каждого SQL-запроса. Мы видим, что страница каталога делает 200 запросов вместо 5. Решение — добавить eager loading или кэширование через Redis. Без Datadog вы бы гадали, а с ним — точная цифра: avg: 342ms на запрос.

Утечки памяти и рост CPU

Мониторинг инфраструктуры: system.cpu.user и system.mem.used. Datadog алерты срабатывают при превышении порога 85% CPU. В одном проекте мы обнаружили утечку в Node.js из-за неоптимального setInterval. Datadog показал рост heap-памяти, и мы заменили цикл на worker_threads.

Как мы настраиваем мониторинг

Процесс включает несколько этапов:

Этап Что делаем Срок
Аудит Определяем критические сервисы, точки замера и сценарии 1 день
Установка агента Настраиваем агент на серверах, включаем интеграции 1 день
APM Внедряем tracers для Laravel/Node.js, настраиваем кастомные спаны 1–2 дня
Логи и алерты Настраиваем сбор логов, мониторы и уведомления (Slack, PagerDuty) 1 день
Дашборды Создаём визуализацию с ключевыми метриками 0.5 дня

Установка агента

# Ubuntu/Debian
DD_API_KEY="your-api-key" DD_SITE="datadoghq.eu" \
  bash -c "$(curl -L https://s3.amazonaws.com/dd-agent/scripts/install_script_agent7.sh)"

# Docker
docker run -d --name datadog-agent \
  -e DD_API_KEY="your-api-key" \
  -e DD_SITE="datadoghq.eu" \
  -e DD_LOGS_ENABLED=true \
  -e DD_LOGS_CONFIG_CONTAINER_COLLECT_ALL=true \
  -e DD_APM_ENABLED=true \
  -v /var/run/docker.sock:/var/run/docker.sock:ro \
  -v /proc/:/host/proc/:ro \
  -v /sys/fs/cgroup/:/host/sys/fs/cgroup:ro \
  gcr.io/datadoghq/agent:7

Конфигурация агента

# /etc/datadog-agent/datadog.yaml
api_key: your-api-key
site: datadoghq.eu
hostname: web01.example.com

tags:
  - env:production
  - app:myapp
  - region:eu-west-1

logs_enabled: true
apm_config:
  enabled: true

process_config:
  enabled: true

# Интеграции
integrations:
  nginx:
    - nginx_status_url: http://localhost/nginx_status
  php_fpm:
    - status_url: http://localhost/status
      ping_url: http://localhost/ping
  postgres:
    - host: localhost
      username: datadog
      password: ENC[k8s_secret,v1.0/namespace/secret/pass]
      dbname: myapp

PostgreSQL: пользователь для мониторинга

CREATE USER datadog WITH PASSWORD 'secure-password';
GRANT pg_monitor TO datadog;
GRANT SELECT ON pg_stat_database TO datadog;

APM для Laravel

// composer.json
// "datadog/dd-trace": "^0.90"

// Трассировка кастомных операций
use DDTrace\GlobalTracer;

class OrderService
{
    public function processOrder(Order $order): void
    {
        $tracer = GlobalTracer::get();
        $span   = $tracer->startActiveSpan('order.process');

        try {
            $span->setTag('order.id', $order->id);
            $span->setTag('order.total', $order->total);

            $this->validateInventory($order);
            $this->chargePayment($order);
            $this->sendConfirmation($order);

        } catch (\Throwable $e) {
            $span->setError($e);
            throw $e;
        } finally {
            $span->finish();
        }
    }
}

Алерты через Datadog Monitor

resource "datadog_monitor" "cpu_high" {
  name    = "High CPU on web servers"
  type    = "metric alert"
  query   = "avg(last_5m):avg:system.cpu.user{env:production} by {host} > 85"

  message = <<-EOT
    CPU использование превысило 85% на {{host.name}}.
    @slack-monitoring
  EOT

  thresholds = {
    critical = 85
    warning  = 75
  }

  notify_no_data    = true
  renotify_interval = 60
  tags              = ["env:production", "app:myapp"]
}

resource "datadog_monitor" "error_rate" {
  name  = "High error rate"
  type  = "metric alert"
  query = "sum(last_5m):sum:trace.web.request.errors{env:production}.as_count() / sum:trace.web.request.hits{env:production}.as_count() * 100 > 5"

  message = "Error rate > 5% @pagerduty-oncall"
  thresholds = { critical = 5, warning = 2 }
}

Как Datadog помогает оптимизировать бюджет?

Datadog в 2 раза сокращает время обнаружения инцидентов по сравнению с Prometheus+Grafana. Синтетические тесты позволяют выявить проблемы до того, как они затронут пользователей. Мы настраиваем мониторинг ключевых сценариев (логин, каталог, корзина) за один день. Каждый предотвращённый простой экономит в среднем $5000 в час для e-commerce проектов.

Сроки и что входит в работу

Компонент Срок Входит в стоимость
Установка агента с интеграциями (Nginx, PHP-FPM, PostgreSQL) 1–2 дня Да: документация по настройкам, тестовый прогон
APM для Laravel/Node.js с кастомными спанами 2–3 дня Да: обучение команды, шаблоны дашбордов
Настройка мониторов и алертов 1 день Да: триггеры для критичных метрик, интеграция с Slack/PagerDuty
Синтетические тесты 1 день Да: 5 тестов для основных сценариев (логин, каталог, корзина)

Мы подключаемся к вашему проекту удалённо через VPN. После настройки передаём доступы и инструкцию по эксплуатации. Гарантируем, что мониторинг будет работать стабильно — в течение 30 дней после внедрения бесплатно дорабатываем алерты и дашборды по вашим замечаниям.

Как Datadog помогает находить узкие места?

APM-трассировка показывает каждый HTTP-запрос от входа до выхода. Например, в Laravel мы видим, что OrderController@store тратит 2.5 секунды, из которых 2 секунды — вызов внешнего API. Без Datadog это было бы "чёрным ящиком". С Datadog вы точно знаете: проблема не в коде, а в стороннем сервисе. Подробнее о APM читайте в официальной документации Datadog.

Закажите настройку мониторинга у нас — получите консультацию бесплатно. Свяжитесь с нами, чтобы обсудить ваш проект. Мы подготовим индивидуальное предложение в течение одного рабочего дня.

Настройка веб-аналитики: GA4, GTM, Яндекс.Метрика и Amplitude

Мы часто видим: конверсия 1.2 %, трафик растёт, а конверсия стоит. Маркетолог смотрит в Google Analytics и говорит: «пользователи уходят с шага 2 оформления заказа». Разработчик открывает тот же шаг — ошибок нет, в Sentry тишина. Значит, дело не в JS-баге, а в UX или в кривых данных, которые показывает аналитика. Аналитика ломается незаметно: событие перестало трекаться после редеплоя — никто не заметил; GTM-тег стреляет дважды — данные задвоились; фильтр GA4 исключает бота, который на самом деле — реальный трафик с корпоративного прокси. Закажите аудит текущих тегов — мы найдём причину за неделю.

После правильной настройки экономия рекламного бюджета может достигать 150 000 ₽ в месяц — это реальный кейс интернет-магазина с 50 000 сессий в день, где дедупликация purchase вернула 20 % неверно приписанных конверсий.

Почему события GA4 дублируются и как это исправить?

Universal Analytics закрыт, его место заняла событийная модель GA4. В ней нет фиксированных хитов страниц и транзакций — только события с параметрами. Это гибче, но требует правильного дизайна событий.

Автоматические события GA4 собирает сам: page_view, scroll, click, session_start. Рекомендуемые события нужно реализовать самостоятельно: purchase, add_to_cart, begin_checkout, view_item. Google ожидает конкретную схему параметров — если передать product_id вместо item_id, данные попадут в GA4, но не в стандартные отчёты e-commerce. Кастомные события для специфики проекта: filter_applied, video_progress, form_step_completed. Кастомные параметры необходимо зарегистрировать в GA4 Admin → Custom definitions, иначе они не будут доступны в отчётах.

Частая ошибка — событие purchase с дублями. Причина: тег срабатывает на странице /thank-you, пользователь обновляет страницу — второй purchase уходит в GA4. Решение: на бэкенде генерируем уникальный transaction_id и передаём в событие. GA4 de-duplicates по нему (в теории — проверяйте через DebugView). Правильная атрибуция экономит до 20 % рекламного бюджета, который раньше уходил на неверно приписанные конверсии.

Как настроить data layer, чтобы не потерять данные?

GTM — инструмент для управления тегами без деплоя кода. Но «без кода» не значит «без архитектуры». Data Layer — основа всего. Передаём данные из приложения в GTM через dataLayer.push(). Структура: event + контекстные данные. Для e-commerce: перед открытием страницы продукта — push с данными товара. GTM-тег читает из dataLayer, не из DOM.

window.dataLayer = window.dataLayer || [];
dataLayer.push({
  event: 'view_item',
  ecommerce: {
    items: [{
      item_id: 'SKU-12345',
      item_name: 'Название товара',
      price: 1990.00,
      currency: 'RUB'
    }]
  }
});

Плохая практика: GTM-тег парсит DOM — ищет цену в span.price, название в h1. Это ломается при любом изменении верстки. Хорошая практика: всегда dataLayer. Используем Preview Mode для отладки и GTM Server-Side для чувствительных данных — отправка с сервера, не с браузера, обходит блокировщики рекламы, не теряет данные.

Как Яндекс.Метрика дополняет веб-аналитику?

Для российской аудитории Метрика обязательна — особенно Вебвизор. Запись сессии пользователя, который бросил корзину, часто даёт ответ быстрее, чем неделя анализа воронки. Цели в Метрике: событийные (через ym(COUNTER_ID, 'reachGoal', 'GOAL_NAME')) или автоматические (клик по кнопке, посещение страницы). Связка с CRM через Метрика Плюс — передача офлайн-конверсий. Наш опыт: в 8 из 10 проектов после настройки Метрики находили скрытые баги в UX, которые не показывали другие системы.

Что даёт product analytics в Amplitude?

Amplitude — продуктовый инструмент, в отличие от маркетинговых GA4 и Метрики. Он заточен под анализ поведения пользователей внутри продукта: воронки, ретеншн, user paths. Amplitude подходит для SaaS-продуктов, мобильных приложений и любых сервисов с зарегистрированными пользователями, где важно понять, как проходят онбординг, на каком шаге уходят, какие фичи используют чаще. Ключевые концепции: identify (связать анонимного пользователя с userId после авторизации), group (аккаунт в B2B SaaS), когорты для удержания. Amplitude Chart — воронка шагов за последние 30 дней с разбивкой по источнику.

Мониторинг качества данных

Аналитика без мониторинга — чёрный ящик. Настраиваем:

  • GA4 Realtime — проверяем после каждого деплоя, что ключевые события приходят
  • Alerting в GA4 — аномалия в количестве событий purchase (резкое падение = что-то сломалось)
  • GTM Preview в staging-окружении перед продакшеном
  • Ручные тесты воронок раз в неделю — просто пройти путь покупателя и проверить, что всё трекается

Что проверяем после каждого деплоя

  • Все ли рекомендуемые события присутствуют в DebugView
  • Нет ли задвоений (считаем количество purchase на 100 сессий)
  • Не изменилась ли структура dataLayer после обновления фронтенда

Что входит в работу

Компонент Описание
Аудит текущих тегов Проверка существующих GTM-тегов, dataLayer, дублей и ошибок
Дизайн событийной схемы Документация: список событий, параметры, триггеры
Настройка GA4 + GTM Создание конфигурации, тегов, Custom definitions
Яндекс.Метрика Установка счётчика, создание целей, настройка Вебвизора
Amplitude (опционально) Настройка клиентского и серверного SDK, когорты
QA и мониторинг Тестирование в Preview Mode, Alerting
Обучение и передача Доступы, инструкция по добавлению новых событий, консоль

Процесс и сроки

  1. Аудит текущих тегов и данных (2 дня)
  2. Дизайн событийной схемы (2 дня)
  3. Разработка Data Layer и настройка тегов (3–5 дней)
  4. QA в Preview Mode и на staging (2 дня)
  5. Деплой и настройка дашбордов (1 день)
Сценарий Срок
Базовая настройка GA4 + GTM 1 неделя
Полный e-commerce tracking + Метрика 2–3 недели
Server-side GTM + Amplitude 3–5 недель

Стоимость рассчитывается индивидуально. Получите консультацию по настройке веб-аналитики для вашего проекта — мы оценим объём работ за один день. Свяжитесь с нами, чтобы начать.

Wikipedia: Веб-аналитика — подробнее о методах и метриках. Официальная документация по событийной модели GA4 доступна в Google Analytics 4.