Запись архива

Бесплатный роутер для LLM от FlexInference

Разработчик представил FlexInference — бесплатный инструмент, который помогает находить более дешевшие варианты запуска LLM от OpenAI, Anthropic и Google Gemini.

Логотип FlexInference
Логотип FlexInference
Imagen destacada del articulo fuente

На Hacker News появилась информация о запуске FlexInference — нового бесплатного инструмента, призванного оптимизировать расходы на использование больших языковых моделей (LLM). Разработчик утверждает, что сервис способен находить более дешевые варианты инференса для моделей от OpenAI, Anthropic и Google Gemini.

Суть предложения

FlexInference работает как роутер, который перенаправляет запросы к LLM через различные провайдеры. Основная идея заключается в поиске более выгодных предложений по инференсу в рамках заданного пользователем временного бюджета. Сервис не изменяет параметры запроса или модели, а лишь ищет оптимальные пути выполнения.

Пункт Деталь
Поддержка OpenAI, Anthropic, Google Gemini (не Vertex AI)
Принцип работы Поиск более дешевого инференса в заданное время
Безопасность Ключи API шифруются и привязаны к организации пользователя
Стоимость Базовый роутинг бесплатен, комиссия 20% от сэкономленной суммы

Как это работает

При отправке запроса FlexInference сначала пытается использовать более дешевый “flex-tier”. Если инференс начинается вовремя, пользователь получает тот же результат, но дешевле. Если “flex-tier” не справляется, запрос выполняется через стандартный сервис. В случае, если “flex-tier” не успевает, ничего не списывается. Вся обработка происходит на edge-инфраструктуре Cloudflare Workers, добавляя минимальную задержку.

Ключевые особенности

FlexInference обещает сохранение всех настроек пользователя, включая конфигурацию модели, бюджет вывода и использование инструментов. Важным аспектом является безопасность: ключи API шифруются по стандарту AES-256-GCM и привязываются к конкретной организации пользователя, что исключает их использование где-либо еще. Пользователи приносят свои ключи, поэтому биллинг остается на стороне провайдера LLM.

Ценообразование и отладка

Сам роутинг бесплатен. FlexInference берет 20% от сэкономленной суммы, если удается найти более дешевый способ выполнения запроса. Разработчики подчеркивают, что инструмент не скрывает ошибки. При возникновении проблем с параметрами запроса, пользователь получает полный код ошибки и статус от провайдера, что упрощает отладку.

Что проверить

Пользователям предлагается самостоятельно протестировать FlexInference, чтобы оценить реальную экономию и надежность работы сервиса. Особое внимание стоит уделить проверке скорости ответа в различных сценариях и совместимости с используемыми LLM.

Источник: https://www.flexinference.com
Проверка: https://openai.com/news/