
Когда речь заходит о развёртывании AI-агента, первый вопрос после выбора архитектуры — бюджет. Чат с LLM обходится дёшево, но агент, который делает десятки вызовов инструментов и обрабатывает многошаговую логику, съедает токены значительно быстрее. Разница между провайдерами по стоимости достигает 20 раз, и не всегда самая дешёвая модель выгоднее из-за потерь на ретраях или низкой точности.
В этой статье — практическое сравнение стоимости 1000 вызовов инструментов (tool calls) на трёх популярных моделях и рекомендации по выбору под конкретные сценарии.
Почему стоимость агентов отличается от стоимости чата
В простом диалоге LLM получает промпт и возвращает ответ. В агентных сценариях к этому добавляются вызовы функций: модель генерирует JSON с именем инструмента и аргументами, а затем получает результат выполнения. Каждый шаг — это входные токены (system prompt, история, описание инструментов, текущий ответ) и выходные токены (сгенерированный вызов). Если агент ошибается (неверный инструмент, невалидные аргументы), приходится повторять вызов.
По оценке провайдеров и практическим замерам, средний вызов инструмента на модели среднего размера (GPT-4o, Claude Sonnet) требует от 300 до 700 входных токенов и от 100 до 300 выходных токенов. Для 1000 успешных tool calls это 300 000–700 000 входных и 100 000–300 000 выходных токенов. С учётом ретраев (обычно 5–15%) реальный расход выше на 10–20%.
Ниже расчёт сделан для типичного агента поддержки: system prompt 500 токенов, история 2 сообщения (по 200 токенов), описание 5 инструментов (~600 токенов), single tool call. Без учёта кэширования и streaming.
Сколько стоят 1000 вызовов инструментов: таблица
Данные взяты с официальных страниц провайдеров на июнь 2026 года. Из расчёта: 500 входных + 200 выходных токенов на попытку, 10% ретраев (1100 попыток для 1000 успешных).
| Провайдер | Модель | Цена за 1 000 входных токенов | Цена за 1 000 выходных токенов | Стоимость 1000 успешных вызовов | С ретраями (1100 попыток) |
|---|---|---|---|---|---|
| OpenAI | GPT-4o | $2,50 | $10,00 | $3,25 | $3,58 |
| OpenAI | GPT-4o mini | $0,15 | $0,60 | $0,20 | $0,22 |
| Anthropic | Claude Sonnet 4.5 | $3,00 | $15,00 | $4,50 | $4,95 |
| Anthropic | Claude Haiku 3.5 | $0,80 | $4,00 | $1,20 | $1,32 |
| Gemini 2.5 Flash | $0,15 | $0,60 | $0,20 | $0,22 | |
| Gemini 2.5 Pro | $1,25 | $5,00 | $1,63 | $1,79 |
Вывод: Gemini 2.5 Flash и GPT-4o mini — лидеры дешевизны. Claude Sonnet дороже примерно в 20 раз по сравнению с ними. Но цена — не единственный критерий.
Скорость и качество: компромиссы
Gemini 2.5 Flash привлекает ценой — $0,22 за 1000 вызовов. Но у неё есть ограничения: по данным независимого трекера Artificial Analysis, медианная задержка первого токена для Gemini Flash составляет около 1,2 с, а для GPT‑4o mini — 0,7 с. Для агента, который делает 20 вызовов подряд, разница в 0,5 с на каждом шаге превращается в дополнительные 10 секунд ожидания — критично для real-time поддержки.
GPT‑4o mini показывает лучшее соотношение цена/скорость среди компактных моделей. Однако её точность при сложной tool calling (много параметров, зависимые инструменты) ниже, чем у полноразмерных моделей. В тестах сообщества (Hugging Face open-tool-calling-leaderboard) GPT‑4o mini набирает 82% успешных вызовов против 91% у GPT‑4o и 93% у Claude Sonnet. Это означает, что на 1000 успешных вызовов с mini потребуется больше ретраев: фактическое число попыток может вырасти на 30% вместо 10%, что нивелирует ценовое преимущество.
Расчёт реальной стоимости с учётом точности
- GPT‑4o mini: точность tool calling 82% → 1220 попыток на 1000 успешных. Стоимость: 0,22 × (1220/1100) ≈ $0,24.
- GPT‑4o: точность 91% → 1099 попыток. Стоимость: $3,58 × (1099/1100) ≈ $3,57.
- Claude Sonnet: точность 93% → 1075 попыток. Стоимость: $4,95 × (1075/1100) ≈ $4,84.
Разрыв между дешёвыми и дорогими моделями сокращается, но всё ещё значителен. Для простых агентов с 1–2 инструментами mini очень выгоден; для сложной логики с 5+ инструментами переплата за более точную модель может окупиться снижением количества ретраев и времени разработки.
Как сэкономить: кэширование, батчинг, локальный инференс
Все крупные провайдеры предлагают механизмы снижения затрат.
- Prompt caching (Anthropic, OpenAI, Google). Если system prompt и описания инструментов повторяются от вызова к вызову, кэширование позволяет платить только за уникальные токены. Экономия — от 50% до 90% на входных токенах. Например, для агента со статичным набором из 5 инструментов (600 токенов) и постоянным system prompt (500 токенов) — всего 1100 токенов кэшируются. При 1000 вызовах это сокращает входной расход с 500 до 500 уникальных токенов на вызов. Реальная экономия зависит от провайдера: у Anthropic кэш дешевле в 4 раза, у OpenAI — в 2–3 раза.
- Batch API. OpenAI и Google позволяют отправлять запросы батчами со скидкой 50% (выполнение в течение суток). Для асинхронных агентов, где не нужна мгновенная скорость, это прямой способ уполовинить счёт.
- Локальные модели. Если задача не требует frontier-модели (достаточно Llama 3 70B или Qwen 2.5 72B), инференс на собственных GPU может быть дешевле при объёмах свыше 1 000 000 вызовов в месяц. Стоимость аренды A100 в облаке — $1,5–2,5/ч, что при 500 запросах в час даёт около $0,003–0,005 за вызов — сопоставимо с Gemini Flash, но без риска vendor lock-in.
Когда дешёвая модель дороже
Есть сценарии, в которых экономия на модели оборачивается косвенными потерями:
- Чувствительность к формату вызова. Некоторые LLM (особенно Gemini Flash) генерируют JSON с ошибками (лишние поля, невалидные типы) чаще, чем дорогие аналоги. Это приводит к сбоям агента и необходимости запускать парсинговые fallback или повторные запросы.
- Проблемы с длинным контекстом. Агенты, которые накапливают историю вызовов, быстро заполняют контекст. GPT‑4o mini и Gemini Flash заметно теряют в точности при контексте >32K токенов. Для сложных многошаговых операций — например, изучение кодовой базы — дешёвая модель может требовать дополнительных «сжатий» контекста или повторов шагов.
- Время отладки. Разработчик тратит часы на отладку нестабильного tool calling. Если модель регулярно ошибается, трудоёмкость поддержки растёт, и сэкономленные $2–3 на тысячу вызовов превращаются в часы инженерного времени по $100–200/ч.
Итог: как выбирать модель под задачу
Универсального рецепта нет, но можно сформулировать три сценария:
Простой агент с 1–2 инструментами, нечувствительный к ошибкам (например, преобразование голоса в текст или отправка email по расписанию). Выбор: Gemini 2.5 Flash или GPT-4o mini. Бюджет — от $0,20 за 1000 вызовов. Подходит при невысокой частоте (до 10 000 вызовов в день).
Агент средней сложности с 3–5 инструментами и требованием к надёжности (интеграция с CRM, проверка данных). Выбор: GPT-4o mini с усилением (re‑prompting) или GPT-4o. Стоимость — $0,25–3,50 за 1000 вызовов. Оправдано, если количество ретраев с mini начинает расти.
Агент с глубокой логикой, зависимыми вызовами и длинным контекстом (coding agent, анализ документов, исследовательские цепочки). Выбор: Claude Sonnet 4.5 или GPT-4o. Стоимость — $4–5 за 1000 вызовов. Здесь экономия на модели ведёт к нестабильности и дополнительным затратам на разработку и отладку.
Что проверить перед выбором: актуальные цены провайдера (они меняются раз в несколько месяцев), возможность prompt caching для вашего сценария, скорость первого токена для ваших пользователей, точность tool calling именно на ваших инструментах — прогнать 100–200 тестовых вызовов на каждой модели и сравнить процент успешных. Только после этого можно принимать решение, окупится ли премиальная модель.
Цена за токен — лишь одна метрика; реальная стоимость агента складывается из точности, ретраев, задержки и времени разработки. Расчёт выше даёт вам точку отсчёта, но финальный выбор потребует эксперимента на ваших данных.
