Настройка Cost Tracking для AI-запросов: мониторинг стоимости токенов

Настройка отслеживания стоимости AI-запросов

Направления AI-разработки

Часто задаваемые вопросы

Последние работы

  • image_website-b2b-advance_0.webp
    Разработка сайта компании B2B ADVANCE
    1441
  • image_web-applications_feedme_466_0.webp
    Разработка веб-приложения для компании FEEDME
    1301
  • image_websites_belfingroup_462_0.webp
    Разработка веб-сайта для компании БЕЛФИНГРУПП
    998
  • image_ecommerce_furnoro_435_0.webp
    Разработка интернет магазина для компании FURNORO
    1267
  • image_logo-advance_0.webp
    Разработка логотипа компании B2B Advance
    713
  • image_crm_enviok_479_0.webp
    Разработка веб-приложения для компании Enviok
    1003

Настройка отслеживания стоимости AI-запросов

Представьте: в понедельник утром вы видите счёт от OpenAI на $15 000, хотя планировали $10 000 в месяц. Знакомая ситуация? Без учёта стоимости токенов по проектам и пользователям такой перерасход — вопрос времени. Cost tracking для LLM — не опция, а necessity, если вы хотите управлять бюджетом AI-инфраструктуры. Наш опыт показывает: компании теряют до 40% бюджета на неконтролируемых запросах. Мы настроим систему, которая в реальном времени считает затраты по каждой модели, проекту и фиче. В результате вы сможете точно планировать расходы и вовремя замечать аномалии.

Какие проблемы решает Cost Tracking?

Без системы учёта вы не увидите, какой отдел или функция генерирует 80% затрат. Типичная ситуация: RAG-фича для поддержки клиентов использует длинные контексты — 50% всех токенов уходит на неё, но это незаметно до прихода счёта. Другая проблема — бесконтрольные тесты в dev-среде: разработчики запускают тяжёлые промпты на GPT-4o, хотя для тестов достаточно gpt-4o-mini. Ещё одна боль — отсутствие алертов: если стоимость вырастет в 10 раз за сутки из-за бага, вы узнаете об этом только в конце месяца. Наше решение даёт прозрачность: вы видите стоимость в реальном времени, а при превышении порогов — мгновенное оповещение.

Чтобы понять корень проблемы, разберём типичные ошибки в настройке учёта. Во-первых, многие не логируют количество токенов на каждый запрос — без этого нельзя посчитать точную стоимость. Во-вторых, игнорируют агрегацию по фичам: видят только общий счёт, не понимая, что именно дорого. В-третьих, не выставляют бюджетные лимиты — тогда любая ошибка в коде (например, бесконечный цикл с вызовом LLM) может сжечь месячный бюджет за час.

Как мы настраиваем учёт токенов?

Каждый запрос к LLM генерирует входные и выходные токены. Стоимость зависит от модели и количества токенов. Например, для GPT-4o цена за 1M входных токенов — $2.50, выходных — $10.00. Для локальной LLaMA 3-8B затраты определяются только GPU-ресурсами.

# Example pricing (update periodically via API) MODEL_PRICING = { "gpt-4o": {"input": 2.50, "output": 10.00}, "gpt-4o-mini": {"input": 0.15, "output": 0.60}, "claude-3-5-sonnet-20241022": {"input": 3.00, "output": 15.00}, "claude-3-haiku-20240307": {"input": 0.25, "output": 1.25}, "llama-3-8b-local": {"input": 0.0, "output": 0.0}, } def calculate_cost(model: str, prompt_tokens: int, completion_tokens: int) -> float: if model not in MODEL_PRICING: return 0.0 pricing = MODEL_PRICING[model] return (prompt_tokens * pricing["input"] + completion_tokens * pricing["output"]) / 1_000_000 

Агрегация по измерениям

Для анализа мы агрегируем стоимость по нескольким измерениям: проект, пользователь, feature-тег (chat, RAG, classification), временной интервал. Это позволяет ответить на вопрос: «Почему счёт за AI вырос на 30% за неделю?»

class CostTracker: def record(self, request: LLMRequest, cost_usd: float): self.db.insert({ "timestamp": request.timestamp, "cost_usd": cost_usd, "model": request.model, "project_id": request.project_id, "user_id": request.user_id, "feature": request.feature_tag, "prompt_tokens": request.prompt_tokens, "completion_tokens": request.completion_tokens, }) def get_daily_by_project(self, days: int = 30) -> dict: return self.db.query(""" SELECT project_id, DATE(timestamp) as date, SUM(cost_usd) as total_cost, SUM(prompt_tokens) as total_tokens FROM llm_costs WHERE timestamp > NOW() - INTERVAL %s DAY GROUP BY project_id, date ORDER BY date, total_cost DESC """, (days,)) 

Какие алерты помогают не превысить бюджет?

Бюджетные алерты — ключевой элемент Cost Tracking. Мы настраиваем два порога: daily и hourly. При достижении 80% лимита отправляется предупреждение в Slack или Telegram, а при 100% — автоматическое троттлирование запросов.

Порог Действие
80% дневного лимита Предупреждение команде
100% дневного лимита Троттлинг (замедление) или блокировка новых запросов
Аномалия >50% за день Уведомление с анализом причины
class BudgetGuard: def __init__(self, limits: dict): self.daily_limit_usd = limits["daily"] self.hourly_limit_usd = limits["hourly"] def check_budget(self, project_id: str) -> BudgetStatus: daily_spend = self.tracker.get_spend(project_id, hours=24) hourly_spend = self.tracker.get_spend(project_id, hours=1) alerts = [] if daily_spend > self.daily_limit_usd * 0.8: alerts.append(f"80% of daily budget consumed: ${daily_spend:.2f}/${self.daily_limit_usd:.2f}") if daily_spend > self.daily_limit_usd: alerts.append("DAILY BUDGET EXCEEDED — throttling enabled") return BudgetStatus(daily_spend=daily_spend, alerts=alerts, throttle_enabled=daily_spend > self.daily_limit_usd) 

Почему мониторинг в реальном времени лучше?

Задержка в учёте даже в час может привести к перерасходу. Например, при запуске новой функции без ограничений стоимость может взлететь в 10 раз за сутки. Система с алертами реагирует за минуты, а не дни. Наше решение даёт экономию до 30% бюджета за счёт раннего обнаружения аномалий.

Что входит в настройку Cost Tracking?

Мы предоставляем:

  • Интеграцию с логами провайдеров (OpenAI, Anthropic, локальные модели)
  • Дашборд с графиками (дневная стоимость, топ фич, стоимость на запрос)
  • Настройку алертов в мессенджеры
  • Документацию по добавлению новых моделей
  • Поддержку в течение месяца после внедрения

Сроки реализации: от 5 до 15 дней в зависимости от сложности инфраструктуры. Стоимость рассчитывается индивидуально — пишите, оценим ваш проект. Получите консультацию по оптимизации затрат AI.

Сравнение: самописный трекер vs наше решение

Критерий Самописный трекер Наше решение
Время на разработку 2–4 недели 5–15 дней
Алерты «из коробки» Нет Slack, Telegram, Email
Поддержка новых моделей Вручную API-обновление
Гарантия корректности Нет Юнит-тесты и code review

Наше решение сокращает время внедрения в 2–4 раза по сравнению с самописным трекером. Опыт нашей команды — более 5 лет в ML-инфраструктуре и 50+ внедрений Cost Tracking для AI-продуктов. Обращайтесь за консультацией.

Типичные ошибки при настройке - Не логировать количество токенов на каждый запрос. - Игнорировать агрегацию по фичам. - Не выставлять бюджетные лимиты. - Использовать устаревший прайс-лист моделей. - Не тестировать алерты на реальных сценариях.