Запись архива

GitHub анонсировал HydraFusion — мультимодельную оркестрацию для Copilot с прицелом на снижение затрат

GitHub представил HydraFusion — исследовательский превью, в котором Copilot автоматически выбирает модель, workflow и цепочку вызовов под конкретную задачу разработчика. В бенчмарках решение сравнимо по качеству с Claude Opus 5, но при значительно меньшей стоимости.

Схема работы HydraFusion: мультимодельная оркестрация GitHub Copilot с выбором сценария Single, Cascade или Critique
Схема работы HydraFusion: мультимодельная оркестрация GitHub Copilot с выбором сценария Single, Cascade или Critique
Изображение из исходного материала

GitHub представил Project HydraFusion — исследовательское превью, которое автоматически управляет выбором модели и сценарием её применения для каждой задачи разработчика. Вместо ручного переключения между моделями Copilot сам определяет, достаточно ли одной модели, нужна ли каскадная эскалация к более мощной или требуется отдельный этап критики. В контролируемых офлайн-экспериментах HydraFusion показал качество, сопоставимое с Claude Opus 5, при снижении расчётной стоимости до 67%.

Новинка уже доступна пользователям всех планов GitHub Copilot через команду /experimental в Copilot CLI. Оплата идёт по стандартным тарифам используемых моделей.

Как устроена оркестрация HydraFusion

HydraFusion не просто выбирает модель, а строит полный план выполнения задачи. Система анализирует сигналы способностей модели: рассуждение, генерацию кода, отладку и использование инструментов. На основе этого она выбирает один из трёх сценариев:

  • Single — одна модель решает задачу напрямую. Самый быстрый и дешёвый вариант, когда модель справляется без дополнительных вызовов.
  • Cascade — первая попытка отдаётся эффективной модели, но если результат не проходит «ворота приёмки», задача эскалируется к более мощной модели.
  • Critique — после генерации решения независимая модель проверяет результат и предлагает исправления. Подходит для задач, где важна дополнительная проверка, а не просто повторная попытка.

GitHub подчёркивает, что HydraFusion развивает идею автоматического выбора модели (Auto model selection), запущенную ранее в этом году. Разработчик видит HydraFusion как обычную модель в списке и не управляет внутренней маршрутизацией.

Ключевые результаты бенчмарков

Показатель HydraFusion vs Opus 5 HydraFusion vs GPT-5.6 Sol
TerminalBench 2.1 (качество) +4.9 п.п.
TerminalBench 2.1 (стоимость) −67%
DeepSWE (качество) −1.5 п.п.
DeepSWE (стоимость) −36%
CheckpointBench (качество) −0.1 п.п.
CheckpointBench (стоимость) −65%

Оценки проводились на трёх бенчмарках: TerminalBench 2.1 (многошаговые задачи в терминале), DeepSWE (сложные задачи на уровне репозитория с кросс-файловыми зависимостями) и внутренний CheckpointBench, собранный из реальных сессий Copilot. Все модели оценивались на одинаковом уровне рассуждений (medium reasoning).

CheckpointBench заслуживает отдельного внимания: он построен на траекториях реальных сессий Copilot, привязан к конкретным публичным репозиториям и неизменяемым коммитам. Это делает бенчмарк максимально приближенным к продакшен-нагрузке. HydraFusion на нём показал почти идентичное Opus 5 качество при вдвое меньшей стоимости.

Пять принципов работы HydraFusion

GitHub формулирует пять операционных принципов, на которых построена система:

Выбор сценария как задача оптимизации, а не жёсткое правило.

Прозрачность исполнения: каждый вызов фиксируется с указанием роли, результата, стоимости, задержки и диагностики.
3. Единый ответ для разработчика: независимо от числа внутренних вызовов, пользователь получает один связный результат и один набор изменений, согласованный с разрешениями.
4. Адаптивность к новым моделям: по мере появления моделей в Copilot они могут включаться в пул HydraFusion без изменения архитектуры.
5. Контроль состояния репозитория: система управляет изменениями так, чтобы не нарушить целостность проекта.

Что это значит для разработчиков

HydraFusion решает практическую проблему: разработчики уже сегодня вручную координируют модели — используют одну для генерации, другую для ревью, третью для сложных случаев. HydraFusion автоматизирует этот процесс, выбирая оптимальный сценарий под каждую задачу.

Для команд, работающих с ограниченными бюджетами на API, снижение стоимости на 36–67% при сохранении качества — значимый аргумент. Особенно в задачах, где каждая эскалация к Opus 5 или GPT-5.6 Sol обходится дорого.

Однако важно учитывать, что результаты получены в контролируемых офлайн-условиях на фиксированных версиях бенчмарков. GitHub признаёт, что исследовательское превью нужно для валидации на реальных рабочих нагрузках, и обещает оптимизировать HydraFusion под продакшен по качеству, задержке, надёжности, кэшированию, стоимости и безопасности.

Как попробовать HydraFusion

HydraFusion доступен в Copilot CLI через команду /experimental. Для использования нужно установить или обновить GitHub CLI и выбрать HydraFusion как модель. Обратная связь принимается через GitHub Community.

Пока это исследовательская версия, и GitHub не раскрывает, какие именно модели участвуют в пуле HydraFusion и как часто система выбирает тот или иной сценарий. Эти детали, вероятно, появятся по мере продвижения к стабильному релизу.

Источник: GitHub Blog — Project HydraFusion: Frontier quality via multi-model orchestration