Запись архива

Сколько стоят AI-агенты на разных моделях: бюджет, скорость и качество

Практический расчёт стоимости 1000 вызовов инструментов на Claude, GPT-4o и Gemini 2.5. Как не переплатить за агентов, где сэкономить и когда дешёвая модель выходит дороже.

Сравнение цен на API Claude, GPT-4o и Gemini 2.5 для AI-агентов
Сравнение цен на API Claude, GPT-4o и Gemini 2.5 для AI-агентов
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-36).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

Когда речь заходит о развёртывании AI-агента, первый вопрос после выбора архитектуры — бюджет. Чат с LLM обходится дёшево, но агент, который делает десятки вызовов инструментов и обрабатывает многошаговую логику, съедает токены значительно быстрее. Разница между провайдерами по стоимости достигает 20 раз, и не всегда самая дешёвая модель выгоднее из-за потерь на ретраях или низкой точности.

В этой статье — практическое сравнение стоимости 1000 вызовов инструментов (tool calls) на трёх популярных моделях и рекомендации по выбору под конкретные сценарии.

Почему стоимость агентов отличается от стоимости чата

В простом диалоге LLM получает промпт и возвращает ответ. В агентных сценариях к этому добавляются вызовы функций: модель генерирует JSON с именем инструмента и аргументами, а затем получает результат выполнения. Каждый шаг — это входные токены (system prompt, история, описание инструментов, текущий ответ) и выходные токены (сгенерированный вызов). Если агент ошибается (неверный инструмент, невалидные аргументы), приходится повторять вызов.

По оценке провайдеров и практическим замерам, средний вызов инструмента на модели среднего размера (GPT-4o, Claude Sonnet) требует от 300 до 700 входных токенов и от 100 до 300 выходных токенов. Для 1000 успешных tool calls это 300 000–700 000 входных и 100 000–300 000 выходных токенов. С учётом ретраев (обычно 5–15%) реальный расход выше на 10–20%.

Ниже расчёт сделан для типичного агента поддержки: system prompt 500 токенов, история 2 сообщения (по 200 токенов), описание 5 инструментов (~600 токенов), single tool call. Без учёта кэширования и streaming.

Сколько стоят 1000 вызовов инструментов: таблица

Данные взяты с официальных страниц провайдеров на июнь 2026 года. Из расчёта: 500 входных + 200 выходных токенов на попытку, 10% ретраев (1100 попыток для 1000 успешных).

Провайдер Модель Цена за 1 000 входных токенов Цена за 1 000 выходных токенов Стоимость 1000 успешных вызовов С ретраями (1100 попыток)
OpenAI GPT-4o $2,50 $10,00 $3,25 $3,58
OpenAI GPT-4o mini $0,15 $0,60 $0,20 $0,22
Anthropic Claude Sonnet 4.5 $3,00 $15,00 $4,50 $4,95
Anthropic Claude Haiku 3.5 $0,80 $4,00 $1,20 $1,32
Google Gemini 2.5 Flash $0,15 $0,60 $0,20 $0,22
Google Gemini 2.5 Pro $1,25 $5,00 $1,63 $1,79

Вывод: Gemini 2.5 Flash и GPT-4o mini — лидеры дешевизны. Claude Sonnet дороже примерно в 20 раз по сравнению с ними. Но цена — не единственный критерий.

Скорость и качество: компромиссы

Gemini 2.5 Flash привлекает ценой — $0,22 за 1000 вызовов. Но у неё есть ограничения: по данным независимого трекера Artificial Analysis, медианная задержка первого токена для Gemini Flash составляет около 1,2 с, а для GPT‑4o mini — 0,7 с. Для агента, который делает 20 вызовов подряд, разница в 0,5 с на каждом шаге превращается в дополнительные 10 секунд ожидания — критично для real-time поддержки.

GPT‑4o mini показывает лучшее соотношение цена/скорость среди компактных моделей. Однако её точность при сложной tool calling (много параметров, зависимые инструменты) ниже, чем у полноразмерных моделей. В тестах сообщества (Hugging Face open-tool-calling-leaderboard) GPT‑4o mini набирает 82% успешных вызовов против 91% у GPT‑4o и 93% у Claude Sonnet. Это означает, что на 1000 успешных вызовов с mini потребуется больше ретраев: фактическое число попыток может вырасти на 30% вместо 10%, что нивелирует ценовое преимущество.

Расчёт реальной стоимости с учётом точности

  • GPT‑4o mini: точность tool calling 82% → 1220 попыток на 1000 успешных. Стоимость: 0,22 × (1220/1100) ≈ $0,24.
  • GPT‑4o: точность 91% → 1099 попыток. Стоимость: $3,58 × (1099/1100) ≈ $3,57.
  • Claude Sonnet: точность 93% → 1075 попыток. Стоимость: $4,95 × (1075/1100) ≈ $4,84.

Разрыв между дешёвыми и дорогими моделями сокращается, но всё ещё значителен. Для простых агентов с 1–2 инструментами mini очень выгоден; для сложной логики с 5+ инструментами переплата за более точную модель может окупиться снижением количества ретраев и времени разработки.

Как сэкономить: кэширование, батчинг, локальный инференс

Все крупные провайдеры предлагают механизмы снижения затрат.

  • Prompt caching (Anthropic, OpenAI, Google). Если system prompt и описания инструментов повторяются от вызова к вызову, кэширование позволяет платить только за уникальные токены. Экономия — от 50% до 90% на входных токенах. Например, для агента со статичным набором из 5 инструментов (600 токенов) и постоянным system prompt (500 токенов) — всего 1100 токенов кэшируются. При 1000 вызовах это сокращает входной расход с 500 до 500 уникальных токенов на вызов. Реальная экономия зависит от провайдера: у Anthropic кэш дешевле в 4 раза, у OpenAI — в 2–3 раза.
  • Batch API. OpenAI и Google позволяют отправлять запросы батчами со скидкой 50% (выполнение в течение суток). Для асинхронных агентов, где не нужна мгновенная скорость, это прямой способ уполовинить счёт.
  • Локальные модели. Если задача не требует frontier-модели (достаточно Llama 3 70B или Qwen 2.5 72B), инференс на собственных GPU может быть дешевле при объёмах свыше 1 000 000 вызовов в месяц. Стоимость аренды A100 в облаке — $1,5–2,5/ч, что при 500 запросах в час даёт около $0,003–0,005 за вызов — сопоставимо с Gemini Flash, но без риска vendor lock-in.

Когда дешёвая модель дороже

Есть сценарии, в которых экономия на модели оборачивается косвенными потерями:

  • Чувствительность к формату вызова. Некоторые LLM (особенно Gemini Flash) генерируют JSON с ошибками (лишние поля, невалидные типы) чаще, чем дорогие аналоги. Это приводит к сбоям агента и необходимости запускать парсинговые fallback или повторные запросы.
  • Проблемы с длинным контекстом. Агенты, которые накапливают историю вызовов, быстро заполняют контекст. GPT‑4o mini и Gemini Flash заметно теряют в точности при контексте >32K токенов. Для сложных многошаговых операций — например, изучение кодовой базы — дешёвая модель может требовать дополнительных «сжатий» контекста или повторов шагов.
  • Время отладки. Разработчик тратит часы на отладку нестабильного tool calling. Если модель регулярно ошибается, трудоёмкость поддержки растёт, и сэкономленные $2–3 на тысячу вызовов превращаются в часы инженерного времени по $100–200/ч.

Итог: как выбирать модель под задачу

Универсального рецепта нет, но можно сформулировать три сценария:

Простой агент с 1–2 инструментами, нечувствительный к ошибкам (например, преобразование голоса в текст или отправка email по расписанию). Выбор: Gemini 2.5 Flash или GPT-4o mini. Бюджет — от $0,20 за 1000 вызовов. Подходит при невысокой частоте (до 10 000 вызовов в день).

Агент средней сложности с 3–5 инструментами и требованием к надёжности (интеграция с CRM, проверка данных). Выбор: GPT-4o mini с усилением (re‑prompting) или GPT-4o. Стоимость — $0,25–3,50 за 1000 вызовов. Оправдано, если количество ретраев с mini начинает расти.

Агент с глубокой логикой, зависимыми вызовами и длинным контекстом (coding agent, анализ документов, исследовательские цепочки). Выбор: Claude Sonnet 4.5 или GPT-4o. Стоимость — $4–5 за 1000 вызовов. Здесь экономия на модели ведёт к нестабильности и дополнительным затратам на разработку и отладку.

Что проверить перед выбором: актуальные цены провайдера (они меняются раз в несколько месяцев), возможность prompt caching для вашего сценария, скорость первого токена для ваших пользователей, точность tool calling именно на ваших инструментах — прогнать 100–200 тестовых вызовов на каждой модели и сравнить процент успешных. Только после этого можно принимать решение, окупится ли премиальная модель.

Цена за токен — лишь одна метрика; реальная стоимость агента складывается из точности, ретраев, задержки и времени разработки. Расчёт выше даёт вам точку отсчёта, но финальный выбор потребует эксперимента на ваших данных.

Источники