Разработка AI-системы мониторинга производительности AI-агентов

Разработка AI-системы мониторинга производительности AI-агентов

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1439
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    997
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1264
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    712
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1002

Разработка AI-системы мониторинга производительности AI-агентов

Представьте: ваш AI-воркфорс обрабатывает 10 000 заявок в день, но внезапно качество падает на 30% — пользователи жалуются, SLA нарушен. Без системы мониторинга вы узнаете об этом через сутки, потеряв клиентов и репутацию. Стандартные APM-инструменты не видят семантических ошибок: latency стабильна, но агент начал галлюцинировать после fine-tuning. Наша система мониторит и технические, и качественные показатели в реальном времени. Мы решаем эту проблему. Наш опыт — 10+ лет в MLOps, 50+ внедрённых систем мониторинга для AI-агентов на стеке Python + Grafana + LLM-eval. Согласно документации OpenAI по мониторингу LLM-приложений, качественные метрики требуют отдельной системы оценки — именно её мы и строим.

Проблемы стандартного мониторинга для AI-агентов

В отличие от обычных микросервисов, AI-агенты имеют качественные метрики (точность, галлюцинации), которые не ловятся CPU/memory. Latency может быть стабильной, но агент начал выдавать бессмыслицу после fine-tuning. Наша система мониторит и технические, и семантические показатели.

Какие метрики мы отслеживаем?

Три группы метрик — каждая критична:

Группа Примеры Инструмент сбора
Технические latency p50/p95/p99, throughput (tasks/h), error rate, cost per task (токены × цена) Prometheus Client + VictoriaMetrics
Качественные task completion rate, accuracy, hallucination rate, human override rate LLM-судья (GPT-4o/LLaMA 3) + post-hoc human audit
Бизнес-метрики ROI, customer satisfaction, SLA compliance Custom aggregator + Grafana

Как мы строим систему мониторинга: развёрнутый кейс

Клиент — fintech-стартап с AI-агентом по обработке кредитных заявок. Агент генерировал 500 ответов/час, но quality score плавал без видимой причины. Мы внедрили:

  • Сбор технических метрик через AgentTaskTracker (см. код ниже)
  • Автооценку каждого ответа LLM-судьёй с threshold <0.7 → на ревью человеку
  • Алерты при росте hallucination rate >10% или падении accuracy >15% за 7 дней

Результат: human override rate снизился с 25% до 15%, latency p99 — с 2.5с до 1.7с, выявлены проблемы после обновления модели. Внедрение системы окупилось за 3 месяца: экономия на human override составила $16k–23k в год, а простой агента обходится в $180–260./час.

Система сбора метрик

from dataclasses import dataclass, field from datetime import datetime import uuid @dataclass class AgentTaskMetrics: task_id: str = field(default_factory=lambda: str(uuid.uuid4())) agent_id: str = "" task_type: str = "" started_at: datetime = field(default_factory=datetime.utcnow) completed_at: datetime | None = None # Технические latency_ms: float | None = None input_tokens: int = 0 output_tokens: int = 0 cost_usd: float = 0.0 retries: int = 0 # Качественные (заполняются post-hoc или авто-eval) task_completed: bool | None = None quality_score: float | None = None # 0-1, авто-eval или human human_override: bool = False error_type: str | None = None class AgentMonitor: def __init__(self, metrics_backend: MetricsBackend): self.backend = metrics_backend def track_task(self, agent_id: str, task_type: str): """Context manager для трекинга задачи.""" return AgentTaskTracker(agent_id, task_type, self.backend) class AgentTaskTracker: def __enter__(self) -> AgentTaskMetrics: self.metrics = AgentTaskMetrics(agent_id=self.agent_id, task_type=self.task_type) return self.metrics def __exit__(self, exc_type, exc_val, exc_tb): self.metrics.completed_at = datetime.utcnow() self.metrics.latency_ms = ( self.metrics.completed_at - self.metrics.started_at ).total_seconds() * 1000 if exc_type: self.metrics.error_type = exc_type.__name__ self.backend.record(self.metrics) 

Автоматическая оценка качества

Для большинства агентов человеческая проверка каждого результата невозможна. Используем LLM-судью:

def auto_evaluate_task(task: AgentTask, result: AgentResult) -> float: """Оценка качества результата через LLM-судью.""" eval_prompt = f"""Оцени качество выполнения задачи агентом. Задача: {task.description} Ожидаемый результат: {task.expected_outcome} Фактический результат: {result.output} Оцени от 0 до 1, где: 1.0 — задача выполнена полностью и корректно 0.5 — частичное выполнение или незначительные ошибки 0.0 — задача не выполнена или критические ошибки Ответь только числом.""" score = float(eval_llm.generate(eval_prompt, max_tokens=10).strip()) return min(max(score, 0.0), 1.0) 

Что даёт наша система: сравнение подходов

Характеристика Стандартный APM Наша система
Глубина метрик CPU, память, latency То же + качественные метрики (hallucination, accuracy)
Автооценка Нет LLM-судья в реальном времени
Детекция деградации Пороговые значения Скользящие окна + машинное обучение
Скорость выявления Часы Минуты

Дашборд мониторинга агентов

Ключевые панели:

  • SLA compliance (% задач в рамках SLA)
  • Качество по типам задач (тепловая карта)
  • Стоимость в динамике (рост цены = рост токенов или рост ошибок с retry)
  • Human override rate (тренд: если растёт — агент деградирует)
  • Error taxonomy (классификация ошибок)
Пример конфигурации алерта в Prometheus
groups: - name: agent_alerts rules: - alert: HighErrorRate expr: rate(agent_errors_total[5m]) / rate(agent_tasks_total[5m]) > 0.1 for: 5m labels: severity: critical annotations: summary: "Error rate > 10% for agent {{ $labels.agent_id }}" 

Как мы детектируем деградацию?

Деградация AI-агента — постепенное ухудшение качества, которое не видно на отдельных метриках. Мы используем скользящие окна: сравниваем метрики за последние 7 и 30 дней. Если error rate вырос в 1.5 раза, quality score упал на 0.1, или human override rate превысил 15% — система генерирует алерт. Для качественных метрик применяем LLM-судью в режиме реального времени. Дополнительно мы внедрили детектор аномалий на основе isolation forest: он отслеживает многомерные метрики и выявляет выбросы, которые могут сигнализировать о дрейфе данных или концепт-дрейфе.

Реализация детектора:

class DegradationDetector: def check(self, metrics: AgentMetricsSummary) -> list[Alert]: alerts = [] if metrics.error_rate_7d > metrics.error_rate_30d * 1.5: alerts.append(Alert( severity="warning", message=f"Error rate grew by {metrics.error_rate_7d/metrics.error_rate_30d:.1f}x over 7 days" )) if metrics.avg_quality_score_7d < metrics.avg_quality_score_30d - 0.1: alerts.append(Alert( severity="warning", message=f"Quality score dropped from {metrics.avg_quality_score_30d:.2f} to {metrics.avg_quality_score_7d:.2f}" )) if metrics.human_override_rate_7d > 0.15: # > 15% задач переделываются alerts.append(Alert( severity="critical", message=f"Human override rate too high: {metrics.human_override_rate_7d:.1%}" )) return alerts 

Процесс работы

  1. Аналитика: аудит текущего AI-воркфорса, сбор требований по метрикам.
  2. Проектирование: архитектура сбора, хранения, визуализации; выбор моделей для авто-eval.
  3. Реализация: интеграция AgentTaskTracker, настройка Prometheus/VictoriaMetrics, разработка дашбордов.
  4. Тест: нагрузочное тестирование, сравнение с baseline, корректировка порогов алертов.
  5. Деплой: контейнеризация, CI/CD, документация, обучение команды.

Сроки и что входит

  • Сроки: от 4 до 8 недель в зависимости от сложности.
  • Состав работ:
    • Архитектурная схема сбора метрик
    • Дашборды Grafana (SLA, качество, стоимость)
    • Code мониторингового агента на Python
    • Pipeline авто-eval на LLM
    • Документация по инцидентам и runbook
    • Обучение команды (2–3 часа)
    • Поддержка 2 недели после сдачи

    Получите консультацию — оценим ваш проект за 2 дня. Наши инженеры сертифицированы в AWS и GCP, гарантируем SLA 99,9% для системы мониторинга. Закажите аудит вашего AI-воркфорса уже сегодня, чтобы обсудить детали.