
Cloudflare 30 сентября 2026 года объявила о запуске Auto Router в публичной бете AI Gateway. Новый компонент автоматически выбирает модель для каждого запроса, учитывая предполагаемую сложность задачи, стоимость токенов, доступность провайдеров и ограничения конкретного шлюза.
Для подключения разработчику нужно указать `cloudflare/auto` вместо конкретной модели. После этого решение о маршрутизации принимает AI Gateway. Cloudflare утверждает, что при внутреннем использовании Auto Router позволил сократить расходы до 30% по сравнению со сценарием, в котором запросы отправлялись только фронтирным моделям.
Это результат самой Cloudflare, а не независимый аудит. Компания также не утверждает, что экономия в 30% гарантирована для любой нагрузки: она зависит от доли простых запросов, набора подключённых моделей, их тарифов и того, насколько точно маршрутизатор оценивает задачу.
Как шлюз выбирает модель
Сначала AI Gateway составляет список моделей, которые технически могут обработать запрос. Система проверяет поддержку нужного формата и режима выполнения, параметры авторизации, биллинг, политики доступа и установленные лимиты расходов.
Недоступные модели и провайдеры временно исключаются из списка. После восстановления сервиса AI Gateway может вернуть их в пул. Таким образом, Auto Router работает не только как механизм экономии, но и как дополнительный уровень управления доступностью.
Затем маршрутизатор создаёт сокращённое представление диалога, отдавая приоритет последним сообщениям. Эти данные передаются классификационной модели, работающей через Workers AI на GPU в пограничной инфраструктуре Cloudflare.
По описанию компании, классификатор формирует два набора оценок:
- распределяет запрос между 14 категориями, включая программирование, планирование, исследование и анализ данных;
- оценивает сложность, неоднозначность, уровень риска и зависимость от предыдущего контекста по шкале от 1 до 5.
Полученные сигналы объединяются с результатами модельных тестов. Отдельная матрица скоринга оценивает, насколько хорошо каждый кандидат должен справиться с конкретной задачей. Cloudflare сообщает, что настраивала эту матрицу на примерах, для которых разработчики заранее определяли предпочтительные модели.
На последнем этапе система сопоставляет ожидаемое качество с ценой входных и выходных токенов. Для простых задач стоимость получает больший вес, поэтому запрос может уйти более дешёвой модели. При росте сложности ценовой штраф уменьшается, повышая вероятность выбора более мощной модели.
Это не обычная балансировка по цене за миллион токенов. Маршрутизатор пытается оценить полную стоимость выполнения задачи: недорогая модель может в итоге обойтись дороже, если генерирует больше токенов, чаще ошибается или требует повторных попыток.
Что показал внутренний тест Cloudflare
Компания сравнила `cloudflare/auto`, Anthropic Claude Opus 5.5 и OpenAI GPT-6 Sol на внутреннем наборе заданий для повседневной офисной работы. В тест вошли сценарии с электронной почтой, календарями, Slack, файлами, поездками и финансами. Модели должны были пользоваться имитированными рабочими инструментами и выдавать проверяемый ответ либо выполнять заданное действие.
Всего использовалось 97 задач. Каждую запускали по три раза на каждой конфигурации, то есть на одну модель пришлось 291 испытание.
| Конфигурация | Успешные попытки | Доля успеха | Общая стоимость | Стоимость одного успеха |
|---|---|---|---|---|
| `cloudflare/auto` | 252 из 291 | 86,6% | $2,10 | $0,0084 |
| Anthropic Claude Opus 5.5 | 281 из 291 | 96,6% | $5,91 | $0,0210 |
| OpenAI GPT-6 Sol | 245 из 291 | 84,2% | $2,64 | $0,0108 |
По этим данным Auto Router оказался дешевле обеих отдельных моделей: его общая стоимость составила около 80% стоимости GPT-6 Sol и 35% стоимости Claude Opus 5.5. При этом утверждать, что снижение расходов произошло совсем без потери качества, нельзя. Маршрутизатор превзошёл Sol по доле успешных попыток, но уступил Opus на 10 процентных пунктов.
Cloudflare приводит 95-процентные доверительные интервалы, рассчитанные с помощью 10 000 бутстрап-повторений на уровне задач. Однако полный набор заданий не опубликован, поэтому независимо воспроизвести сравнение по представленным данным невозможно. Неизвестно и то, насколько результаты перенесутся на другие языки, длинные диалоги, специализированный код или отраслевые документы.
Заявленные «до 30%» относятся к отдельным ранним результатам внутреннего использования через OpenCode, а не непосредственно к приведённой таблице. В табличном тесте разница в расходах зависела от выбранной модели сравнения.
Где маршрутизация может дать наибольшую экономию
Auto Router рассчитан на организации, в которых через один шлюз проходят неоднородные запросы: от краткого пересказа письма до анализа кода и многошаговой работы с инструментами. Если сотрудники вручную выбирают наиболее мощную модель для каждой операции, компания платит по максимальному тарифу даже там, где достаточно более дешёвого варианта.
Наиболее очевидный сценарий — корпоративные AI-ассистенты и агентные системы. Генерация названия задачи, форматирование текста или краткое резюме могут отправляться компактным моделям, тогда как сложная отладка, планирование или запрос с высоким риском ошибки — более производительным.
Экономия будет ниже, если почти все запросы действительно требуют сильнейшей доступной модели. Она также может исчезнуть, если классификатор часто недооценивает сложность и пользователям приходится повторять неудачные запросы. Поэтому стоимость одного успешного выполнения полезнее сравнивать, чем номинальную цену токена.
Маршрутизация добавляет и собственные накладные расходы: запрос необходимо сначала классифицировать, а уже затем передать выбранной модели. Независимый тест LiteLLM, опубликованный 18 сентября 2026 года, показывает, почему скорость и цена этого этапа имеют значение. В его синтетическом наборе классификатор JEV обработал запросы с медианной задержкой 126,81 мс против 688,40 мс у Claude Haiku, а расчётная стоимость классификации была ниже на 96,12%.
Этот тест не проверял Auto Router Cloudflare и не оценивал качество итоговых ответов. Он лишь подтверждает более общий инженерный компромисс: классификатор маршрутов должен быть достаточно быстрым и дешёвым, иначе его накладные расходы съедят часть ожидаемой выгоды.
Что проверить перед переводом рабочего трафика
Публичная бета подходит для ограниченного эксперимента, но не даёт оснований сразу направлять через автоматический выбор все критичные запросы. Cloudflare не раскрыла точное название используемой классификационной модели и не опубликовала её точность по 14 категориям. Также пока нет независимого сравнения Auto Router на открытом наборе задач.
Командам стоит начать с части трафика и параллельно сохранить контрольную группу с фиксированной моделью. В тесте следует измерять не только счёт за токены, но и:
- долю задач, выполненных без повторной отправки;
- стоимость одного успешного результата;
- задержку классификации и полное время ответа;
- частоту выбора каждой модели;
- качество на длинных и специализированных запросах;
- ошибки маршрутизации в юридических, финансовых, медицинских и других чувствительных сценариях.
Отдельно нужно проверить, не передаёт ли сокращение контекста классификатору недостаточно информации для правильной оценки задачи. Чем сильнее запрос зависит от ранних сообщений диалога, тем выше риск, что компактное представление не отразит его реальную сложность.
До появления открытого воспроизводимого теста показатель экономии до 30% следует воспринимать как результат Cloudflare на собственной нагрузке. Для разработчиков практическая ценность публичной беты состоит в возможности проверить ту же гипотезу на своих запросах: действительно ли автоматический выбор снижает стоимость одного успешного действия, а не только среднюю цену вызова модели.







