
На Hacker News появилась информация о запуске FlexInference — нового бесплатного инструмента, призванного оптимизировать расходы на использование больших языковых моделей (LLM). Разработчик утверждает, что сервис способен находить более дешевые варианты инференса для моделей от OpenAI, Anthropic и Google Gemini.
Суть предложения
FlexInference работает как роутер, который перенаправляет запросы к LLM через различные провайдеры. Основная идея заключается в поиске более выгодных предложений по инференсу в рамках заданного пользователем временного бюджета. Сервис не изменяет параметры запроса или модели, а лишь ищет оптимальные пути выполнения.
| Пункт | Деталь |
|---|---|
| Поддержка | OpenAI, Anthropic, Google Gemini (не Vertex AI) |
| Принцип работы | Поиск более дешевого инференса в заданное время |
| Безопасность | Ключи API шифруются и привязаны к организации пользователя |
| Стоимость | Базовый роутинг бесплатен, комиссия 20% от сэкономленной суммы |
Как это работает
При отправке запроса FlexInference сначала пытается использовать более дешевый “flex-tier”. Если инференс начинается вовремя, пользователь получает тот же результат, но дешевле. Если “flex-tier” не справляется, запрос выполняется через стандартный сервис. В случае, если “flex-tier” не успевает, ничего не списывается. Вся обработка происходит на edge-инфраструктуре Cloudflare Workers, добавляя минимальную задержку.
Ключевые особенности
FlexInference обещает сохранение всех настроек пользователя, включая конфигурацию модели, бюджет вывода и использование инструментов. Важным аспектом является безопасность: ключи API шифруются по стандарту AES-256-GCM и привязываются к конкретной организации пользователя, что исключает их использование где-либо еще. Пользователи приносят свои ключи, поэтому биллинг остается на стороне провайдера LLM.
Ценообразование и отладка
Сам роутинг бесплатен. FlexInference берет 20% от сэкономленной суммы, если удается найти более дешевый способ выполнения запроса. Разработчики подчеркивают, что инструмент не скрывает ошибки. При возникновении проблем с параметрами запроса, пользователь получает полный код ошибки и статус от провайдера, что упрощает отладку.
Что проверить
Пользователям предлагается самостоятельно протестировать FlexInference, чтобы оценить реальную экономию и надежность работы сервиса. Особое внимание стоит уделить проверке скорости ответа в различных сценариях и совместимости с используемыми LLM.
Источник: https://www.flexinference.com
Проверка: https://openai.com/news/
