
Когда AI-агент Codex из проекта Cognition Labs сжёг $78 000 на токенах за несколько часов автономной работы, это стало не мемом, а предупреждением для всей индустрии. Счёт мог быть ещё выше, если бы агент не упёрся в лимиты API. История, которую The Verge и Hacker News обсуждали в апреле 2026 года, показала: без понимания реальной стоимости AI-агента любой проект рискует превратиться в финансовую чёрную дыру.
Проблема в том, что разработчики привыкли оценивать затраты на уровне одного запроса. Но AI-агент — это не однократный вызов LLM. Это каскад вызовов: планирование, вызов инструментов, обработка результатов, повторные попытки, обработка ошибок. Каждый шаг множит расходы, и без системы учёта вы узнаете о проблеме только по счёту в конце месяца.
Эта статья — практический метод оценки стоимости AI-агента, который можно применить к любому проекту: от простого чат-бота до сложного мультиагентного пайплайна.
Почему стандартные калькуляторы токенов не работают для агентов
Провайдеры LLM предлагают удобные калькуляторы стоимости. OpenAI показывает цену за 1K токенов, Anthropic — за миллион. Но эти цифры обманчивы для агентных систем по нескольким причинам.
Во-первых, агент делает не один, а множество вызовов. Типичный цикл агента включает: системный промпт (1-2K токенов), пользовательский запрос (0.5-1K), ответ модели с выбором инструмента (0.5-1.5K), результат выполнения инструмента (часто десятки килобайт), повторная обработка результата и так далее. Каждый шаг — отдельный вызов с полной оплатой.
Во-вторых, агенты часто используют длинные контексты. Для выполнения задачи агент может накопить историю из тысяч токенов — каждый последующий вызов оплачивается с учётом всего накопленного контекста. Это особенно критично для моделей с контекстным окном 200K токенов и выше.
В-третьих, существуют скрытые расходы: повторные попытки при ошибках, вызовы инструментов (калькуляторы, поиск, базы данных), которые сами по себе могут быть платными, и затраты на инфраструктуру для хостинга агента.
Разбор затрат: от токена до инфраструктуры
Реальная стоимость AI-агента складывается из трёх компонентов: прямые затраты на LLM, затраты на инструменты и инфраструктурные расходы.
Прямые затраты на LLM. Это самая очевидная часть. OpenAI GPT-4o стоит $2.50 за 1M входных токенов и $10 за 1M выходных. Claude Opus 5.5 от Anthropic — $15 за 1M входных и $75 за 1M выходных. Разница в цене между моделями может достигать 5-10 раз, что напрямую влияет на итоговую стоимость агента.
Затраты на инструменты. Когда агент вызывает внешние API — поиск, базы данных, калькуляторы, рендеринг — каждый вызов добавляет свою цену. Например, вызов поискового API может стоить $0.001-0.01, а вызов платного сервиса генерации изображений — $0.02-0.10. Для агента, который делает сотни вызовов инструментов за сессию, это становится значимой статьёй расходов.
Инфраструктурные расходы. Хостинг агента, базы данных для хранения состояния, очереди сообщений, мониторинг — всё это добавляет фиксированные и переменные затраты. Для облачного развёртывания на AWS или Google Cloud минимальная конфигурация для одного агента обходится в $20-50 в месяц, не считая трафика.
Метод оценки: формула и примеры
Для расчёта реальной стоимости AI-агента используйте следующую формулу:
C_total = (C_llm × N_calls × T_avg) + (C_tools × N_tool_calls) + C_infra
Где:
— C_llm — стоимость 1K токенов для выбранной модели (входные + выходные)
— N_calls — среднее количество вызовов LLM на одну задачу
— T_avg — среднее количество токенов на вызов (входные + выходные)
— C_tools — средняя стоимость одного вызова инструмента
— N_tool_calls — количество вызовов инструментов на задачу
— C_infra — фиксированные инфраструктурные расходы на задачу
Пример 1: Простой чат-бот с поиском. Модель GPT-4o mini ($0.15/$0.60 за 1M токенов). Средний вызов: 2K входных + 1K выходных токенов. 10 вызовов на сессию, 3 поисковых запроса по $0.005. Инфраструктура: $0.01 на сессию. Итого: (0.15×3K/1M×10) + (0.005×3) + 0.01 = $0.0295 за сессию. 1000 сессий в день — $29.50.
Пример 2: Автономный AI-агент с выполнением задач. Модель Claude Opus 5.5 ($15/$75 за 1M токенов). Средний вызов: 5K входных + 3K выходных токенов. 50 вызовов на задачу, 20 вызовов инструментов по $0.01. Инфраструктура: $0.05 на задачу. Итого: (15×8K/1M×50) + (0.01×20) + 0.05 = $6.25 за задачу. 100 задач в день — $625.
Разница между примерами — более чем в 200 раз на задачу. Выбор модели и архитектуры агента напрямую определяет его экономическую целесообразность.
Как собрать реальные метрики для расчёта
Без данных — это гадание. Чтобы получить точные цифры, нужно внедрить инструментацию в самого агента.
Логирование токенов. Каждый вызов LLM должен логировать: количество входных токенов (отдельно системный промпт, история, пользовательский запрос), количество выходных токенов, время выполнения, код ошибки. OpenAI и Anthropic возвращают эти данные в ответе API — используйте их.
Счётчики вызовов инструментов. Каждый вызов внешнего инструмента должен фиксироваться с указанием: тип инструмента, статус (успех/ошибка), стоимость (если применимо), время выполнения. Это позволит выявить неэффективные или дорогие инструменты.
Мониторинг времени. Время выполнения важно не только для UX, но и для расчёта инфраструктурных затрат. Долгие вызовы могут блокировать ресурсы и увеличивать стоимость хостинга.
Агрегация по сессиям. Собирайте метрики не по отдельным вызовам, а по полным сессиям агента. Это даст реальную картину: средняя стоимость сессии, медианное количество вызовов, распределение стоимости по типам операций.
Типичные ошибки при оценке и как их избежать
Игнорирование повторных попыток. Когда агент получает ошибку от LLM или инструмента, он часто повторяет вызов. По данным исследования Google Research, до 15-20% вызовов в агентных системах — это повторные попытки. Учитывайте это в расчётах.
Недооценка контекстного окна. Агент накапливает историю. Первый вызов может стоить $0.01, а сотый — уже $0.50 из-за выросшего контекста. Используйте средневзвешенную стоимость, а не стоимость первого вызова.
Забывание про rate limits. Когда агент упирается в лимиты API, он начинает ждать (тратя время) или переключаться на более дорогую модель. Это неявные затраты, которые сложно измерить, но они реальны.
Путаница между входными и выходными токенами. Выходные токены обычно стоят в 2-4 раза дороже входных. Агенты, которые генерируют длинные ответы или много промежуточных рассуждений, платят значительно больше.
Практический чеклист для внедрения
Определите сценарий использования. Что делает агент? Сколько шагов в типичной задаче? Какие инструменты используются?
2. Выберите модель и провайдера. Сравните стоимость GPT-4o, Claude Opus, Gemini Pro для вашего сценария.
3. Внедрите логирование. Каждый вызов LLM и инструмента должен логироваться с метриками токенов и стоимости.
4. Соберите baseline. Запустите 100-1000 тестовых сессий, соберите статистику по стоимости, времени, ошибкам.
5. Оптимизируйте. Сократите контекст, кэшируйте повторяющиеся вызовы, используйте более дешёвые модели для подзадач.
6. Установите бюджетные лимиты. Настройте автоматическую остановку агента при превышении лимита стоимости или количества вызовов.
7. Мониторьте в реальном времени. Используйте дашборды, которые показывают текущую стоимость сессии и прогноз до завершения.
Что дальше: инструменты и сервисы для автоматизации учёта
Ручной сбор метрик — трудоёмкий процесс. Существуют готовые решения:
- LangSmith от LangChain — трассировка вызовов LLM, агрегация стоимости, дашборды.
- LangFuse — open-source платформа для мониторинга LLM-приложений с учётом стоимости.
- Helicone — прокси для OpenAI/Anthropic с логированием токенов и стоимости.
- Weights & Biases Prompts — трекинг промптов с метриками токенов.
Эти инструменты интегрируются за несколько часов и дают прозрачную картину затрат без необходимости писать собственную систему учёта.
Ограничения метода и что с ними делать
Предложенная формула даёт хорошую оценку, но не учитывает несколько факторов. Волатильность цен на API — провайдеры меняют тарифы без предупреждения. Сезонность нагрузки — инфраструктурные расходы могут расти неравномерно. Стоимость человеческого времени на отладку и поддержку агента — часто самая большая статья расходов, которую сложно измерить.
Лучший подход — регулярно пересматривать метрики и адаптировать бюджет. Раз в месяц запускайте полный аудит стоимости: сравнивайте фактические расходы с прогнозом, проверяйте, не появились ли более дешёвые модели или инструменты.
Начните с малого: выберите одного агента, внедрите логирование, соберите данные за неделю. Цифры, которые вы увидите, скорее всего, удивят вас — и, возможно, заставят пересмотреть архитектуру всего проекта.










