Запись архива

Как измерить стоимость AI-агента: пошаговый метод расчёта затрат на токены, вызовы и время выполнения

Разбираем практический метод оценки стоимости работы AI-агента: от токенов на промпт и генерацию до затрат на tool calling и время выполнения. Реальные цифры для GPT-4o, Claude 3.5 Sonnet и локальных моделей.

Дашборд расчёта стоимости AI-агента с метриками токенов, вызовов и времени выполнения
Дашборд расчёта стоимости AI-агента с метриками токенов, вызовов и времени выполнения
A complex interactive user interface made of ILNumerics interactive panels.png | by Hpcguy014 | wikimedia_commons | CC BY-SA 4.0

Когда вы запускаете AI-агента в продакшен, один из первых вопросов — сколько это будет стоить. Не в абстрактных единицах качества, а в долларах или рублях за задачу. Проблема в том, что стандартные калькуляторы стоимости API учитывают только базовые токены ввода и вывода, а реальный агент делает гораздо больше: он вызывает инструменты, обрабатывает результаты, повторяет шаги при ошибках и тратит время на ожидание.

Разберём метод, который позволяет оценить стоимость агента до запуска и отслеживать её после. Метод не требует специальных инструментов — только логи API, секундомер и таблицу.

Что именно мы считаем: четыре компонента затрат

Любой AI-агент тратит ресурсы на четыре вещи, и каждая считается по-своему.

Токены на промпт (вход). Системный промпт, история диалога, результаты предыдущих вызовов инструментов, контекст задачи. Чем длиннее контекст, тем дороже каждый следующий шаг.

Токены на генерацию (выход). Ответ модели, включая структурированные вызовы функций. Здесь цена за токен обычно выше, чем на входе.

Вызовы инструментов (tool calls). Каждый раз, когда агент решает вызвать функцию, вы платите за токены, сгенерированные для формирования вызова, и за токены, которые возвращает результат вызова (они идут во вход следующего шага).

Время выполнения. Если вы используете модели с оплатой за минуту (например, некоторые локальные хостинги или batch API), время становится отдельной метрикой. Даже при подписке на локальную модель время работы = затраты на электричество и аренду GPU.

Практический метод: три шага

Шаг 1. Замерьте базовые метрики на трёх тестовых запусках

Возьмите типовую задачу, которую будет решать агент. Запустите её три раза, запишите:

  • Общее количество токенов на вход (prompt_tokens)
  • Общее количество токенов на выход (completion_tokens)
  • Количество вызовов инструментов (tool_calls)
  • Количество шагов (iterations) — сколько раз агент возвращался к модели после вызова инструмента
  • Общее время выполнения в секундах

Для примера возьмём агента, который ищет информацию в базе данных по описанию пользователя и возвращает структурированный ответ. После трёх запусков средние значения:

Метрика Значение
Токены на вход 4 200
Токены на выход 1 800
Вызовы инструментов 3
Шаги 4
Время выполнения 12 секунд

Шаг 2. Примените цены вашей модели

Возьмём актуальные цены OpenAI на GPT-4o (август 2026): $2.50 за миллион токенов на вход, $10.00 за миллион токенов на выход.

Стоимость одного запуска:
— Вход: 4 200 × ($2.50 / 1 000 000) = $0.0105
— Выход: 1 800 × ($10.00 / 1 000 000) = $0.018
— Итого за шаги: $0.0285

Но это без учёта tool calls. Каждый из трёх вызовов инструмента генерирует дополнительный выход (сам вызов функции) и принимает результат на вход следующего шага. Реальные метрики с учётом tool calls:

Компонент Токены Цена
Промпт (включая результаты tool calls) 5 400 $0.0135
Генерация (включая вызовы функций) 2 600 $0.026
Итого 8 000 $0.0395

Разница с первым расчётом — 38%. Если вы считали только базовые токены, вы underestimating реальную стоимость на треть.

Шаг 3. Учтите повторные попытки и граничные случаи

В реальной работе агенты не всегда успешны с первой попытки. Если агент возвращает ошибку или не может выполнить задачу, он может сделать несколько повторных попыток. Добавьте коэффициент повторных попыток на основе ваших тестов.

Для агента с 10% вероятностью повторной попытки и средней стоимостью одной попытки $0.04, ожидаемая стоимость задачи:
$0.04 + 0.1 × $0.04 + 0.01 × $0.04 + … = $0.04 / 0.9 ≈ $0.044

Сравнение моделей: GPT-4o, Claude 3.5 Sonnet и локальная модель

Теперь применим метод к трём разным моделям для одной задачи — агент, который анализирует текстовый файл, извлекает ключевые сущности и записывает результат в базу данных.

Условия: файл на 3 000 токенов, задача требует 2 вызова инструментов (поиск по словарю и запись), средний успех с первой попытки.

Модель Цена за вход (1M токенов) Цена за выход (1M токенов) Средние токены на задачу Стоимость задачи
GPT-4o $2.50 $10.00 6 200 входа, 2 100 выхода $0.0365
Claude 3.5 Sonnet $3.00 $15.00 5 800 входа, 2 400 выхода $0.0534
Локальная Llama 3 70B (4× A100, $3/час) — — 8 400 токенов (всего) $0.017 (12 сек × $3/3600)

Локальная модель оказывается дешевле при высокой загрузке, но требует капитальных затрат на GPU. При 10 000 задач в день разница между GPT-4o ($365/день) и Claude ($534/день) становится существенной.

Ограничения метода и как их обойти

Не учитывается кэширование. Если вы используете prompt caching (поддерживается и OpenAI, и Anthropic), повторяющиеся системные промпты не тарифицируются. В тестах с длинным контекстом кэширование может снизить стоимость на 50-90%. Пересчитайте с учётом кэша, если ваша платформа его поддерживает.

Разный размер контекста между моделями. Claude 3.5 Sonnet может потребовать меньше шагов для той же задачи, чем GPT-4o, из-за лучшего понимания tool calling. Это компенсирует более высокую цену за токен. Единственный способ проверить — прогнать одну задачу на обеих моделях.

Batch API дешевле, но медленнее. OpenAI предлагает скидку 50% на batch API, но ответ занимает до нескольких часов. Для агентов реального времени это не подходит, но для фоновых задач — прямой путь к снижению бюджета.

Стоимость инфраструктуры для локальных моделей. Цена GPU в облаке ($2-4/час за A100) не включает хранение, сеть и обслуживание. Для продакшена с 24/7 загрузкой добавьте 20-30% к расчётной стоимости.

Что делать с этими цифрами

После того как вы рассчитали стоимость одной задачи, вы можете:

  • Установить бюджет на день/неделю и настроить алерты при превышении
  • Сравнить разные модели и выбрать оптимальную по соотношению цена/качество для вашего сценария
  • Оптимизировать промпты для сокращения количества шагов (меньше tool calls = дешевле)
  • Перевести часть задач на batch API или локальные модели

Главный вывод: не считайте стоимость агента по базовым ценам API. Реальная цена складывается из токенов на все шаги, вызовы инструментов и повторные попытки. Измерьте на трёх тестовых запусках, пересчитайте с поправкой на повторения — и вы получите цифру, на которую можно опираться при планировании бюджета.

Проверьте: если ваш агент делает больше 5 вызовов инструментов на задачу или использует контекст длиннее 10 000 токенов, стоимость может быть в 2-3 раза выше, чем показывают стандартные калькуляторы. Запустите тест прямо сейчас, пока не получили счёт за продакшен.

Источники