Запись архива

Как распределять расходы на LLM-инференс в продакшене

В сообществе разработчиков обсуждают сложности с отслеживанием и распределением затрат на использование больших языковых моделей (LLM) в производственных системах.

Как распределять расходы на LLM-инференс в продакшене
Как распределять расходы на LLM-инференс в продакшене
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

По мере того как LLM-технологии выходят за рамки нескольких продуктовых фич и начинают использоваться во внутренних инструментах, агентах, службах поддержки и системах оценки, возникает вопрос о справедливом распределении расходов на их использование.

Почему это важно

Провайдеры LLM предоставляют информацию об использовании токенов, но когда дело доходит до финансовой отчетности, становится сложно определить, какая команда или проект стали причиной тех или иных затрат. Инфраструктурные команды видят сырые данные об использовании, но финальный счет получает финансовый отдел, и промежуточное звено для детальной атрибуции расходов часто оказывается недоразвитым.

Текущие подходы

В сообществе предполагают, что решение может заключаться в комбинации тегирования на уровне приложений и внутренней отчетности. Однако пока неясно, сколько команд уже формализовали эти процессы, а сколько продолжают рассматривать расходы на LLM как часть общих затрат на инфраструктуру.

Что остается неясным

Основной вопрос — насколько детально нужно отслеживать расходы на LLM. Нужны ли сложные системы тегирования для каждого запроса, или достаточно более высокоуровневой аналитики? Как обеспечить точность и актуальность данных для финансового отдела?

Что проверить дальше

  • Изучите возможности тегирования запросов на уровне ваших LLM-приложений.
  • Проанализируйте, какие метрики использования LLM уже собирает ваша инфраструктура.
  • Обсудите с финансовым отделом их требования к детализации расходов.
Пункт Деталь
Источник Reddit r/artificial
Проблема Сложность распределения расходов на LLM-инференс
Предлагаемое решение Тегирование на уровне приложений, внутренняя отчетность
Неясность Уровень детализации отслеживания, точность данных

Исходный материал обсуждается в сообществе Reddit.

Источник: Attributing LLM inference costs across teams in production
Лид верификации: comrad404.com/pulse/