Мы сталкивались с проектами, где прод начинает сыпать 500-ми из-за перегрузки одного эндпоинта, а разработчики тратят часы на поиск причины по разрозненным логам. Без единой точки входа — шлюза — вы слепы: не видите, кто вызывает API, с какой задержкой, какие роуты падают. Настройка логирования и мониторинга трафика через API Gateway решает эти проблемы за пару дней и даёт прозрачность всего трафика. Наш опыт внедрения подобных решений гарантирует стабильность и сокращение времени поиска инцидентов до 15 минут.
Мы интегрируем в ваш шлюз сбор минимально необходимых полей: request_id (сквозная трассировка), consumer_id (идентификация клиента), method, path, status_code, latency_ms, размеры запросов. Тело запроса не логируем по умолчанию — только в дебаг-режиме для выбранных роутов, чтобы не светить чувствительные данные. После внедрения одна из команд сократила время поиска инцидентов с 2 часов до 15 минут.
Какие метрики критичны для отладки API?
Без централизованного сбора вы не сможете быстро ответить на вопросы: какой эндпоинт самый медленный, кто генерирует 90% ошибок, почему упал upstream. Мы настраиваем шлюз так, чтобы каждый запрос оставлял полный цифровой след:
| Поле | Пример | Зачем |
|---|---|---|
request_id |
uuid4 |
Сквозная трассировка через сервисы |
consumer_id |
client_abc |
Кто делает запрос |
method + path |
GET /api/v2/orders |
Статистика по эндпоинтам |
status_code |
429 |
Мониторинг ошибок |
latency_ms |
143 |
Производительность |
upstream_latency_ms |
138 |
Где тратится время |
request_size |
1024 |
Аномалии в трафике |
response_size |
4096 |
— |
ip |
1.2.3.4 |
Безопасность |
Каждый запрос также обогащается метками (consumer, route) — это позволяет строить срезы по клиентам и эндпоинтам.
Риски логирования тела запроса
В production тело запроса содержит чувствительные данные: пароли, токены, PAN-данные. Мы настраиваем шлюз так, чтобы body логировался только для выбранных роутов в дебаг-режиме. В Kong это контролируется флагом dataTraceEnabled, в AWS — отдельным конфигом. Если нужно отладить конкретный запрос, включаем логирование тела на 15 минут и отключаем. Kong documentation recommends enabling body logging only when necessary to avoid data leaks.
Как работает сквозная трассировка с request_id?
request_id — это UUID, который генерируется на шлюзе и передаётся всем бэкенд-сервисам через HTTP-заголовок X-Request-ID. Каждый сервис записывает свой request_id в логи, что позволяет собрать полную картину выполнения одного запроса. Для этого достаточно добавить заголовок во все исходящие вызовы — это делается middleware за час. После этого можно построить дашборд «путь запроса», где видны все вызовы между микросервисами.
Как настроить Kong Gateway для сбора метрик?
Kong — самый популярный self-hosted шлюз. Логирование через плагин http-log и метрики через prometheus настраиваются в одном конфиге:
plugins:
- name: http-log
config:
http_endpoint: http://logstash:5044/kong
method: POST
timeout: 1000
keepalive: 1000
flush_timeout: 2
retry_count: 10
queue:
max_batch_size: 200
max_coalescing_delay: 1
max_entries: 10000
- name: prometheus
config:
per_consumer: true
status_code_metrics: true
latency_metrics: true
bandwidth_metrics: true
upstream_health_metrics: true
После этого /metrics на Kong Manager отдаёт все метрики в формате Prometheus. Scrape-интервал — 15 секунд.
Настройка в AWS API Gateway
В AWS логирование настраивается на уровне Stage через CloudWatch:
{
"loggingLevel": "INFO",
"dataTraceEnabled": false,
"metricsEnabled": true,
"accessLogDestinationArn": "arn:aws:logs:us-east-1:123456789:log-group:api-gateway-access",
"accessLogFormat": "{\"requestId\":\"$context.requestId\",\"ip\":\"$context.identity.sourceIp\",\"caller\":\"$context.identity.caller\",\"user\":\"$context.identity.user\",\"requestTime\":\"$context.requestTime\",\"httpMethod\":\"$context.httpMethod\",\"resourcePath\":\"$context.resourcePath\",\"status\":\"$context.status\",\"protocol\":\"$context.protocol\",\"responseLength\":\"$context.responseLength\",\"integrationLatency\":\"$context.integrationLatency\",\"responseLatency\":\"$context.responseLatency\"}"
}
dataTraceEnabled: false — никогда не включать в production, пишет тела запросов.
CloudWatch Insights-запрос для p95 latency по эндпоинту:
fields @timestamp, resourcePath, responseLatency
| filter status >= 200
| stats pct(responseLatency, 95) as p95 by resourcePath
| sort p95 desc
| limit 20
Nginx API Gateway + OpenTelemetry
Если gateway на Nginx (nginx-plus или OpenResty), логирование настраивается через log_format:
log_format api_json escape=json
'{'
'"timestamp":"$time_iso8601",'
'"request_id":"$request_id",'
'"method":"$request_method",'
'"path":"$uri",'
'"status":$status,'
'"latency_ms":$request_time,'
'"upstream_latency_ms":"$upstream_response_time",'
'"bytes_sent":$bytes_sent,'
'"consumer":"$http_x_consumer_id",'
'"ip":"$remote_addr"'
'}';
access_log /var/log/nginx/api_access.log api_json buffer=32k flush=5s;
Для распределённой трассировки используйте opentelemetry-nginx-module — мы подключаем его при необходимости.
Какой стек визуализации выбрать: ELK или Grafana?
| Критерий | ELK (Elasticsearch, Logstash, Kibana) | Grafana Stack (Loki, Prometheus, Grafana) |
|---|---|---|
| Хранение логов | Индексирует все поля — дорого | Хранит сжатые логи без индексации — дешево |
| Поиск по логам | Полнотекстовый, быстрый | Ограниченный (по меткам) |
| Метрики | Только через beats | Prometheus — нативный |
| Сложность настройки | Высокая (Logstash pipeline) | Средняя (PromQL, LogQL) |
| Типичная цена для 100 ГБ/день | 200–400 $/мес | 50–100 $/мес |
Для большинства проектов Grafana Stack проще в эксплуатации и дешевле. ELK оправдан, когда требуется сложный поиск по логам (анализ инцидентов, ретроспектива).
Алертинг
Минимальный набор алертов (Prometheus AlertManager / Grafana Alerting):
- alert: APIHighErrorRate
expr: |
sum(rate(kong_http_requests_total{status=~"5.."}[5m]))
/ sum(rate(kong_http_requests_total[5m])) > 0.05
for: 2m
labels:
severity: critical
annotations:
summary: "Error rate > 5% за последние 5 минут"
- alert: APIHighLatency
expr: |
histogram_quantile(0.95,
sum(rate(kong_request_latency_ms_bucket[5m])) by (le, route)
) > 2000
for: 5m
labels:
severity: warning
annotations:
summary: "p95 latency > 2s для роута {{ $labels.route }}"
Типичные ошибки при настройке логирования
- Забывают включить `request_id` — теряется сквозная трассировка. - Включают `dataTraceEnabled` в production — утечка данных и рост стоимости хранения. - Не настраивают ротацию логов — переполнение диска. - Не тестируют алерты на staging — ложные срабатывания в prod.Процесс работы и что входит в результат
- Аналитика: изучаем архитектуру API, текущие шлюзы, объём трафика, требования к хранению. Обрабатываем до 100 000 req/s.
- Проектирование: выбираем стек (Kong/AWS/Nginx), определяем схему логирования, настраиваем retention на 30 дней.
- Реализация: разворачиваем gateway с плагинами, настраиваем сбор метрик, подключаем Logstash/Loki. Гарантируем корректность конфигурации.
- Тестирование: проверяем корректность логов, симулируем ошибки, тестируем алерты.
- Деплой: публикуем конфигурацию, обучаем команду работе с дашбордами.
В итоге вы получаете:
- Документацию по схеме логирования и полям.
- Доступы к дашбордам (Grafana/Kibana) для каждого члена команды.
- Настроенные алерты на критичные метрики.
- Обучение команды: как читать логи, как реагировать на алерты.
- Поддержку в течение 2 недель после запуска.
Сроки реализации
Базовое логирование и дашборды: 2–3 дня. Полноценный стек с алертингом, трассировкой и ретроспективным анализом: 1–2 недели в зависимости от зрелости инфраструктуры.
Оценим ваш проект и предложим оптимальную конфигурацию за 1-2 дня. Свяжитесь с нами для аудита вашего шлюза — мы подготовим архитектуру и пришлём пример конфигурации. Получите консультацию по настройке мониторинга вашего API-шлюза прямо сейчас.







