Настройка отслеживания стоимости AI-запросов
Представьте: в понедельник утром вы видите счёт от OpenAI на $15 000, хотя планировали $10 000 в месяц. Знакомая ситуация? Без учёта стоимости токенов по проектам и пользователям такой перерасход — вопрос времени. Cost tracking для LLM — не опция, а necessity, если вы хотите управлять бюджетом AI-инфраструктуры. Наш опыт показывает: компании теряют до 40% бюджета на неконтролируемых запросах. Мы настроим систему, которая в реальном времени считает затраты по каждой модели, проекту и фиче. В результате вы сможете точно планировать расходы и вовремя замечать аномалии.
Какие проблемы решает Cost Tracking?
Без системы учёта вы не увидите, какой отдел или функция генерирует 80% затрат. Типичная ситуация: RAG-фича для поддержки клиентов использует длинные контексты — 50% всех токенов уходит на неё, но это незаметно до прихода счёта. Другая проблема — бесконтрольные тесты в dev-среде: разработчики запускают тяжёлые промпты на GPT-4o, хотя для тестов достаточно gpt-4o-mini. Ещё одна боль — отсутствие алертов: если стоимость вырастет в 10 раз за сутки из-за бага, вы узнаете об этом только в конце месяца. Наше решение даёт прозрачность: вы видите стоимость в реальном времени, а при превышении порогов — мгновенное оповещение.
Чтобы понять корень проблемы, разберём типичные ошибки в настройке учёта. Во-первых, многие не логируют количество токенов на каждый запрос — без этого нельзя посчитать точную стоимость. Во-вторых, игнорируют агрегацию по фичам: видят только общий счёт, не понимая, что именно дорого. В-третьих, не выставляют бюджетные лимиты — тогда любая ошибка в коде (например, бесконечный цикл с вызовом LLM) может сжечь месячный бюджет за час.
Как мы настраиваем учёт токенов?
Каждый запрос к LLM генерирует входные и выходные токены. Стоимость зависит от модели и количества токенов. Например, для GPT-4o цена за 1M входных токенов — $2.50, выходных — $10.00. Для локальной LLaMA 3-8B затраты определяются только GPU-ресурсами.
# Example pricing (update periodically via API) MODEL_PRICING = { "gpt-4o": {"input": 2.50, "output": 10.00}, "gpt-4o-mini": {"input": 0.15, "output": 0.60}, "claude-3-5-sonnet-20241022": {"input": 3.00, "output": 15.00}, "claude-3-haiku-20240307": {"input": 0.25, "output": 1.25}, "llama-3-8b-local": {"input": 0.0, "output": 0.0}, } def calculate_cost(model: str, prompt_tokens: int, completion_tokens: int) -> float: if model not in MODEL_PRICING: return 0.0 pricing = MODEL_PRICING[model] return (prompt_tokens * pricing["input"] + completion_tokens * pricing["output"]) / 1_000_000 Агрегация по измерениям
Для анализа мы агрегируем стоимость по нескольким измерениям: проект, пользователь, feature-тег (chat, RAG, classification), временной интервал. Это позволяет ответить на вопрос: «Почему счёт за AI вырос на 30% за неделю?»
class CostTracker: def record(self, request: LLMRequest, cost_usd: float): self.db.insert({ "timestamp": request.timestamp, "cost_usd": cost_usd, "model": request.model, "project_id": request.project_id, "user_id": request.user_id, "feature": request.feature_tag, "prompt_tokens": request.prompt_tokens, "completion_tokens": request.completion_tokens, }) def get_daily_by_project(self, days: int = 30) -> dict: return self.db.query(""" SELECT project_id, DATE(timestamp) as date, SUM(cost_usd) as total_cost, SUM(prompt_tokens) as total_tokens FROM llm_costs WHERE timestamp > NOW() - INTERVAL %s DAY GROUP BY project_id, date ORDER BY date, total_cost DESC """, (days,)) Какие алерты помогают не превысить бюджет?
Бюджетные алерты — ключевой элемент Cost Tracking. Мы настраиваем два порога: daily и hourly. При достижении 80% лимита отправляется предупреждение в Slack или Telegram, а при 100% — автоматическое троттлирование запросов.
| Порог | Действие |
|---|---|
| 80% дневного лимита | Предупреждение команде |
| 100% дневного лимита | Троттлинг (замедление) или блокировка новых запросов |
| Аномалия >50% за день | Уведомление с анализом причины |
class BudgetGuard: def __init__(self, limits: dict): self.daily_limit_usd = limits["daily"] self.hourly_limit_usd = limits["hourly"] def check_budget(self, project_id: str) -> BudgetStatus: daily_spend = self.tracker.get_spend(project_id, hours=24) hourly_spend = self.tracker.get_spend(project_id, hours=1) alerts = [] if daily_spend > self.daily_limit_usd * 0.8: alerts.append(f"80% of daily budget consumed: ${daily_spend:.2f}/${self.daily_limit_usd:.2f}") if daily_spend > self.daily_limit_usd: alerts.append("DAILY BUDGET EXCEEDED — throttling enabled") return BudgetStatus(daily_spend=daily_spend, alerts=alerts, throttle_enabled=daily_spend > self.daily_limit_usd) Почему мониторинг в реальном времени лучше?
Задержка в учёте даже в час может привести к перерасходу. Например, при запуске новой функции без ограничений стоимость может взлететь в 10 раз за сутки. Система с алертами реагирует за минуты, а не дни. Наше решение даёт экономию до 30% бюджета за счёт раннего обнаружения аномалий.
Что входит в настройку Cost Tracking?
Мы предоставляем:
- Интеграцию с логами провайдеров (OpenAI, Anthropic, локальные модели)
- Дашборд с графиками (дневная стоимость, топ фич, стоимость на запрос)
- Настройку алертов в мессенджеры
- Документацию по добавлению новых моделей
- Поддержку в течение месяца после внедрения
Сроки реализации: от 5 до 15 дней в зависимости от сложности инфраструктуры. Стоимость рассчитывается индивидуально — пишите, оценим ваш проект. Получите консультацию по оптимизации затрат AI.
Сравнение: самописный трекер vs наше решение
| Критерий | Самописный трекер | Наше решение |
|---|---|---|
| Время на разработку | 2–4 недели | 5–15 дней |
| Алерты «из коробки» | Нет | Slack, Telegram, Email |
| Поддержка новых моделей | Вручную | API-обновление |
| Гарантия корректности | Нет | Юнит-тесты и code review |
Наше решение сокращает время внедрения в 2–4 раза по сравнению с самописным трекером. Опыт нашей команды — более 5 лет в ML-инфраструктуре и 50+ внедрений Cost Tracking для AI-продуктов. Обращайтесь за консультацией.







