COMRAD404 / GLOSSARY

Стоимость токенов (Token pricing)

Token pricing

Стоимость токенов — это тарификация по числу входных, выходных и иногда кэшированных токенов. Ниже — как считать запросы и почему цену нужно сверять по конкретной модели, региону и поверхности биллинга.

TL;DR

Стоимость токенов — это тарификация API по числу обработанных токенов, обычно с раздельными ставками для input и output, а иногда и для кэша, аудио или отдельных региональных режимов.

Стоимость токенов (token pricing) — это модель тарификации, при которой вы платите за число токенов, обработанных моделью. Обычно отдельно считаются входные и выходные токены, а у некоторых провайдеров — ещё cached tokens, cache writes, cache hits, audio или отдельные режимы вроде batch и региональных endpoint’ов.

Если вам нужно быстро оценить бюджет, логика простая: сначала вы считаете токены официальным способом, затем умножаете их на ставку именно для вашей модели и именно для той поверхности биллинга, которой пользуетесь. Практический вывод: не существует одной «цены токенов у провайдера вообще».

Английский термин: token pricing. Также встречается: pricing per token, per-1M-token pricing, тарификация по токенам. По состоянию на: 2026-08-16.

Простыми словами

Грубо говоря, это похоже на таксометр. Вы платите не «за поездку в целом», а за измеряемые части: сколько текста отправили модели, сколько текста она сгенерировала, использовался ли кэш и не включились ли отдельные тарифные условия.

Из-за этого две похожие задачи могут стоить по-разному. Один и тот же провайдер может брать разные ставки для разных моделей, а один и тот же текст может попадать в разные категории биллинга.

Как это работает

Технически стоимость токенов складывается из нескольких шагов:

  1. Ваш input разбивается на токены.
  2. Провайдер считает, к какой категории относятся эти токены: input, output, cached, cache writes, cache hits и так далее.
  3. Для выбранной модели применяется её ставка за 1M токенов по каждой категории.
  4. Если есть особые условия — например, отдельный региональный endpoint, batch-поверхность или аудио — они тоже учитываются.
Текст / данные
      ↓
Подсчёт токенов
      ↓
Разделение по категориям биллинга
(input / output / cached / cache writes / audio ...)
      ↓
Выбор ставки для конкретной модели
      ↓
Регион / batch / surface modifiers
      ↓
Итоговая стоимость запроса

Для проверки количества токенов OpenAI рекомендует Tokenizer tool или tiktoken.encoding_for_model(model). Для Gemini официальный способ проверить размер запроса до отправки — вызов count_tokens; документация уточняет, что он возвращает только общее число токенов во входе. По Claude в этом наборе источников есть подробная страница цен, но нет отдельной подтверждённой инструкции по предзапросному подсчёту токенов, поэтому для Claude здесь корректно говорить именно о структуре тарификации, а не о едином способе локального подсчёта.

Базовая формула обычно выглядит так:

стоимость ≈ (input_tokens / 1,000,000 × input_rate)
         + (output_tokens / 1,000,000 × output_rate)
         + дополнительные категории, если они есть

Важно: эта формула верна как принцип, но итог зависит от конкретной pricing page. Именно поэтому рядом с расчётом всегда нужна сверка строки тарифа.

Проверенные примеры тарифов

Ниже — не «полный прайс-лист рынка», а только подтверждённые строки из переданного source pack.

Провайдер Подтверждённая строка Что тарифицируется Подтверждённые ставки Ограничение
OpenAI GPT-5.6 Sol input / output $5 за 1M input tokens, $30 за 1M output tokens цена зависит от модели и класса токена; проверять на странице Models
OpenAI GPT-5.6 Terra input / output $2 за 1M input tokens, $12 за 1M output tokens отдельно учитываются классы токенов; эту строку нельзя переносить на все модели
OpenAI GPT-5.6 Luna input / output $0.20 за 1M input tokens, $1.20 за 1M output tokens для cached tokens актуальную ставку нужно смотреть на официальной странице
Gemini API Одна проверенная строка Standard paid tier input / output, audio отдельно $3.50 за 1M input tokens, $21.00 за 1M output tokens в source pack не указан идентификатор модели этой строки; нельзя распространять цену на всё семейство Gemini
Claude API Claude Opus 5 input / output / 5m cache writes / 1h cache writes $5 input, $25 output, $6.25 за 1M tokens для 5m cache writes, $10 для 1h cache writes есть отдельные строки для cache hits/refreshes; регион и surface могут менять цену

Дополнительно по текущим условиям: на странице Gemini API pricing указано, что использование Google AI Studio бесплатно во всех доступных регионах. Для Claude 4.6+ Anthropic указывает, что выбор US-only inference добавляет коэффициент 1.1x ко всем категориям token pricing, включая input, output, cache writes и cache reads; по умолчанию используется global routing.

Где применяется

  • Оценка бюджета чат- и search-сценариев. Если вы строите приложение поверх LLM, стоимость почти всегда считается через токены, а не «за один запрос».
  • Выбор модели под задачу. Даже внутри одного провайдера разница по input/output ставкам может быть заметной, как видно по строкам GPT-5.6 Sol, Terra и Luna.
  • Контроль длинных запросов. Чем больше prompt и история, тем важнее понимать связь между ценой и контекстным окном.
  • Расчёт стоимости агентных цепочек. В workflow с несколькими вызовами модели расходы накапливаются по шагам, что особенно важно для оркестратора агентов.

Отдельно полезно не путать стоимость токенов с самим понятием токен (token). Сначала вы считаете единицы текста, а уже потом переводите их в деньги.

Практический пример

Представим, что вы хотите прикинуть цену одного запроса к модели OpenAI с подтверждённой ставкой GPT-5.6 Terra: $2 за 1M input tokens и $12 за 1M output tokens.

Шаг 1. Посчитать вход официальным способом.

import tiktoken

model = "MODEL_NAME"  # подставьте официальное имя вашей модели
prompt = "Ваш запрос к модели"

enc = tiktoken.encoding_for_model(model)
input_tokens = len(enc.encode(prompt))
print(input_tokens)

Шаг 2. Подставить числа в формулу. Допустим, у вас получилось 12 000 input tokens, а ответ модели занял 1 500 output tokens.

input_cost  = 12_000 / 1_000_000 × 2   = $0.024
output_cost = 1_500  / 1_000_000 × 12  = $0.018
итого ≈ $0.042

Для Gemini до отправки запроса официальный предварительный шаг — count_tokens, но документация прямо говорит, что этот вызов возвращает число токенов только во входе. Значит, вход вы можете проверить точно заранее, а выходную часть оцениваете уже по факту генерации или по собственному допущению для сценария.

Если вам нужен пошаговый прикладной шаблон для бюджета, смотрите как оценить стоимость API по токенам.

Чем отличается от…

Термин Что это значит Главный вопрос
Стоимость токенов Правило тарификации: сколько денег стоит обработка токенов Во сколько обойдётся input, output и другие категории?
Токен Единица текста или данных, которую модель считает и обрабатывает Сколько таких единиц в моём запросе?
Контекстное окно Лимит того, сколько токенов модель может принять и учитывать Поместится ли запрос и история в лимит?
Стоимость запроса Итоговая сумма за конкретный вызов API Сколько денег списалось за один реальный вызов?

Коротко: token pricing — это не токены и не лимит контекста, а денежная модель поверх них.

Ограничения и заблуждения

  • Заблуждение: «У провайдера есть одна цена за токены». На деле: цена зависит от модели и категории токена. У OpenAI это как минимум input, output и cached; у Claude страница цен отдельно показывает base input, output, 5m cache writes, 1h cache writes, cache hits/refreshes.
  • Заблуждение: «Достаточно найти цену в блоге или анонсе». На деле: в source pack прямо отмечено, что для OpenAI наиболее надёжный источник текущих API-цен — страница Models, а не маркетинговые или announcement-страницы.
  • Заблуждение: «Цена строки Gemini подходит для всех моделей Gemini». На деле: в этом наборе источников подтверждена только одна Standard paid-tier строка с $3.50 / $21.00, без идентификатора модели в самом брифе. Поэтому переносить эту цену на весь семейный ряд нельзя.
  • Заблуждение: «Регион не влияет на цену». На деле: Anthropic указывает 1.1x multiplier для US-only inference у Claude 4.6+, а датированный List Prices подтверждает, что цены могут различаться по regional endpoint и batch surface.
  • Заблуждение: «API, chat UI, cloud marketplace и enterprise-contract surfaces всегда совпадают по биллингу». На деле: в source pack отдельно отмечено, что у одного и того же провайдера могут быть разные тарифы для API, batch, cloud-platform deployments и других поверхностей.
  • Ограничение подсчёта: для Gemini count_tokens возвращает токены только во входе, то есть выход заранее не подтверждается этим методом.
  • Billing caveat: Anthropic support пишет, что использование API и Workbench биллится через prepaid usage credits, а failed requests generally not charged.

Редакционное ограничение: эта статья сознательно не пытается заменить официальные pricing pages полным прайс-листом. В переданном source pack есть только отдельные подтверждённые строки и условия; перед бюджетированием всегда сверяйте именно ту модель, регион и surface, которые собираетесь использовать.

Практический вердикт: сначала считайте токены официальным способом, затем сверяйте конкретную строку тарифа, а уже потом делайте финансовый вывод. Если пропустить хотя бы один из этих трёх шагов, смета легко окажется неверной.

Связанные материалы

Источники

Вопросы и ответы

Сколько стоит 1 миллион токенов?

Единой цены нет. По подтверждённым строкам из source pack, например, OpenAI GPT-5.6 Luna стоит $0.20 за 1M input tokens и $1.20 за 1M output tokens, а GPT-5.6 Sol — $5 и $30 соответственно. У Claude Opus 5 подтверждены отдельные ставки не только для input/output, но и для cache writes.

Как заранее узнать цену запроса?

Сначала посчитайте входные токены официальным способом: у OpenAI это Tokenizer tool или tiktoken.encoding_for_model(model), у Gemini — count_tokens. Затем умножьте число токенов на ставку вашей модели и добавьте отдельные категории, если они применяются.

Почему итоговый счёт может не совпасть с грубой оценкой?

Потому что кроме input tokens могут отдельно биллиться output, cached tokens, cache writes/hits, audio, а у некоторых поверхностей — ещё региональные или surface-specific условия. Для Anthropic дополнительно подтверждён региональный множитель 1.1x для US-only inference у Claude 4.6+.

Можно ли брать цену одной строки и применять ко всем моделям провайдера?

Нет. В source pack прямо отмечено, что для Gemini и Claude отдельные строки относятся к конкретным моделям, а для OpenAI надёжнее всего проверять текущие API-цены именно на странице Models. Перенос цены между моделями и поверхностями — частая ошибка.

Что важнее для бюджета: токены или модель?

Нужны оба параметра. Количество токенов отвечает за объём, а модель и surface биллинга — за ставку. Без подсчёта токенов вы не знаете объём расхода, без pricing page — не знаете цену единицы расхода.

Источники

SOURCES

Вопросы и ответы

FAQ
Сколько стоит 1 миллион токенов?

Единой цены нет: ставка зависит от провайдера, модели и категории токена. По подтверждённым строкам source pack, например, OpenAI GPT-5.6 Luna стоит $0.20 за 1M input tokens и $1.20 за 1M output tokens, GPT-5.6 Sol — $5 и $30, а у Claude Opus 5 есть ещё отдельные ставки для cache writes.

Как заранее узнать цену запроса?

Сначала посчитайте входные токены официальным способом: OpenAI рекомендует Tokenizer tool или tiktoken.encoding_for_model(model), Gemini — count_tokens. Затем умножьте число токенов на ставку нужной модели и добавьте отдельные категории биллинга, если они применяются.

Почему итоговый счёт может не совпасть с оценкой?

Потому что кроме input tokens могут отдельно учитываться output, cached tokens, cache writes/hits, audio, batch или региональные условия. Для Claude 4.6+ подтверждён множитель 1.1x для US-only inference по всем категориям token pricing.

Можно ли брать цену одной строки и применять ко всем моделям провайдера?

Нет. В source pack отдельно отмечено, что строки Gemini и Claude относятся к конкретным моделям, а у одного провайдера могут отличаться API, batch, cloud-platform и другие поверхности биллинга. Проверять нужно именно ту строку, которую вы реально используете.

Что важнее для бюджета: токены или модель?

Нужны оба параметра. Количество токенов показывает объём расхода, а модель и surface биллинга — ставку за этот объём. Без обоих параметров корректная смета не получится.

Читайте также

LINKS