Проблема: как не терять деньги на GPU?
Представьте: вы запустили fine-tuning LLM на кластере из 8 A100, через 6 часов — OOM, потеряли 2000 итераций. Или GPU загружены на 2%, а вы платите за аренду как за полную мощность. Без мониторинга это лотерея. Знакомая картина: запустили обучение LLaMA-3 на 8x A100, но через час — OOM и потерянный чекпоинт. Наш опыт на 30+ проектах показывает: правильный мониторинг GPU с DCGM Exporter, Prometheus и Grafana снижает простои на 70% и экономит до 40% затрат на инфраструктуру. Контроль VRAM, утилизации и Tensor Cores — залог стабильной работы.
Мы настраиваем мониторинг GPU под ключ за 2–3 дня. Оценим ваш проект бесплатно — просто напишите.
Почему DCGM Exporter — лучший выбор для NVIDIA GPU?
DCGM (Data Center GPU Manager) — официальный инструмент от NVIDIA. В отличие от nvidia-smi, он отдаёт профильные метрики Tensor Cores, NVLink и точную загрузку SM. Сравнение:
| Метрика | nvidia-smi | DCGM Exporter |
|---|---|---|
| GPU utilization, % | Да | Да (точнее) |
| VRAM used/free | Да | Да |
| Температура | Да | Да |
| Tensor Core active | Нет | Да |
| DRAM bandwidth | Нет | Да |
| NVLink throughput | Нет | Да |
| ECC errors | Да | Да |
DCGM даёт в 10 раз больше метрик и нативно экспортирует их в Prometheus. Это подтверждено документацией NVIDIA.
Какие метрики критичны для AI-нагрузок?
Для AI-инженеров важны не только базовая утилизация и VRAM. Тензорные ядра (Tensor Cores) — ключевой фактор производительности при обучении и инференсе. Метрика DCGM_FI_PROF_PIPE_TENSOR_ACTIVE показывает, насколько эффективно используются эти блоки. Если она низкая при высокой загрузке GPU — скорее всего, упираетесь в память или шину. Также критична метрика использования NVLink: при распределённом обучении узкое место часто именно в межсоединениях.
Типичные проблемы и их решения
| Проблема | Причина | Решение через мониторинг |
|---|---|---|
| OOM по VRAM | Batch size слишком велик | Алерт при 95% VRAM, анализ тренда скорости роста |
| Низкая утилизация GPU | Узкое место CPU или I/O | Дашборд показывает загрузку CPU, GPU и NVLink |
| Перегрев GPU | Недостаточное охлаждение | Алерт при температуре >85°C, мониторинг троттлинга |
Как мы настраиваем мониторинг под ключ
Шаг 1. Развёртывание DCGM Exporter
Устанавливаем DCGM Exporter через Docker на каждом узле с GPU:
docker run -d --gpus all --cap-add SYS_ADMIN -p 9400:9400 --name dcgm-exporter nvcr.io/nvidia/k8s/dcgm-exporter:3.3.5-3.4.0-ubuntu22.04 Для кластеров используем docker-compose с дополнительными настройками collector. Мы подбираем версию под вашу ОС и драйверы NVIDIA.
Шаг 2. Конфигурация Prometheus
Создаём цель для сбора метрик DCGM и правил алертинга:
# prometheus.yml global: scrape_interval: 15s scrape_configs: - job_name: dcgm static_configs: - targets: - gpu-server-1:9400 - gpu-server-2:9400 rule_files: - "gpu_alerts.yml" Шаг 3. Настройка алертов
Определяем ключевые алерты: OOM (VRAM >95%), перегрев (>85°C), низкая утилизация (<20%) и недоступность сервиса.
# gpu_alerts.yml groups: - name: gpu_alerts rules: - alert: GPUMemoryNearFull expr: (DCGM_FI_DEV_FB_USED / DCGM_FI_DEV_FB_TOTAL) > 0.95 for: 5m labels: severity: warning annotations: summary: "GPU {{ $labels.gpu }} на {{ $labels.instance }}: VRAM > 95%" - alert: GPUUtilizationLow expr: avg_over_time(DCGM_FI_DEV_GPU_UTIL[30m]) < 20 for: 1h labels: severity: info annotations: summary: "Низкая утилизация GPU на {{ $labels.instance }}" Как настроить алерт на OOM по VRAM?
Добавьте правило, которое проверяет, что VRAM занята больше чем на 95% в течение 5 минут. При срабатывании вы получите уведомление в Telegram или Slack. Дополнительно можно настроить алерт на скорость роста памяти: если за 2 минуты она увеличилась на 10% — это сигнал к OOM. Мы включаем такие правила в базовую конфигурацию.
Шаг 4. Дашборд Grafana
Строим панели для метрик утилизации, VRAM, Tensor Cores и температуры. Пример панели VRAM:
{ "title": "VRAM Usage %", "type": "gauge", "targets": [{ "expr": "DCGM_FI_DEV_FB_USED / DCGM_FI_DEV_FB_TOTAL * 100", "legendFormat": "{{instance}} GPU{{gpu}}" }], "fieldConfig": { "thresholds": { "steps": [ {"color": "green", "value": 0}, {"color": "yellow", "value": 80}, {"color": "red", "value": 95} ] } } } Мы создаём отдельные дашборды для обучения (LLM, CV) и инференса. В них добавляем метрики Tensor Core utilization, NVLink throughput и latency p99 для инференса. Все дашборды адаптируются под ваши модели.
Шаг 5. Документация и обучение
После развёртывания передаём: инструкцию по эксплуатации, схему алертов, доступ к дашбордам и короткое обучение для DevOps/ML-инженеров.
Что входит в работу
- Установка и настройка DCGM Exporter на каждом GPU-узле
- Конфигурация Prometheus и правил алертинга (Telegram/Slack)
- Создание дашбордов Grafana под ваши задачи (обучение, инференс)
- Интеграция с существующим стеком мониторинга
- Документация и обучение команды
- Поддержка 1 месяц после запуска
Наш опыт и гарантии
Многолетний опыт на рынке MLOps. 30+ проектов по GPU-инфраструктуре для AI-стартапов и enterprise. Сертифицированные инженеры NVIDIA. Гарантируем стабильную работу мониторинга 24/7. Свяжитесь с нами для настройки мониторинга — мы оценим вашу инфраструктуру и предложим оптимальное решение.







