
GitHub представил Project HydraFusion — исследовательское превью, которое автоматически управляет выбором модели и сценарием её применения для каждой задачи разработчика. Вместо ручного переключения между моделями Copilot сам определяет, достаточно ли одной модели, нужна ли каскадная эскалация к более мощной или требуется отдельный этап критики. В контролируемых офлайн-экспериментах HydraFusion показал качество, сопоставимое с Claude Opus 5, при снижении расчётной стоимости до 67%.
Новинка уже доступна пользователям всех планов GitHub Copilot через команду /experimental в Copilot CLI. Оплата идёт по стандартным тарифам используемых моделей.
Как устроена оркестрация HydraFusion
HydraFusion не просто выбирает модель, а строит полный план выполнения задачи. Система анализирует сигналы способностей модели: рассуждение, генерацию кода, отладку и использование инструментов. На основе этого она выбирает один из трёх сценариев:
- Single — одна модель решает задачу напрямую. Самый быстрый и дешёвый вариант, когда модель справляется без дополнительных вызовов.
- Cascade — первая попытка отдаётся эффективной модели, но если результат не проходит «ворота приёмки», задача эскалируется к более мощной модели.
- Critique — после генерации решения независимая модель проверяет результат и предлагает исправления. Подходит для задач, где важна дополнительная проверка, а не просто повторная попытка.
GitHub подчёркивает, что HydraFusion развивает идею автоматического выбора модели (Auto model selection), запущенную ранее в этом году. Разработчик видит HydraFusion как обычную модель в списке и не управляет внутренней маршрутизацией.
Ключевые результаты бенчмарков
| Показатель | HydraFusion vs Opus 5 | HydraFusion vs GPT-5.6 Sol |
|---|---|---|
| TerminalBench 2.1 (качество) | +4.9 п.п. | — |
| TerminalBench 2.1 (стоимость) | −67% | — |
| DeepSWE (качество) | −1.5 п.п. | — |
| DeepSWE (стоимость) | −36% | — |
| CheckpointBench (качество) | −0.1 п.п. | — |
| CheckpointBench (стоимость) | −65% | — |
Оценки проводились на трёх бенчмарках: TerminalBench 2.1 (многошаговые задачи в терминале), DeepSWE (сложные задачи на уровне репозитория с кросс-файловыми зависимостями) и внутренний CheckpointBench, собранный из реальных сессий Copilot. Все модели оценивались на одинаковом уровне рассуждений (medium reasoning).
CheckpointBench заслуживает отдельного внимания: он построен на траекториях реальных сессий Copilot, привязан к конкретным публичным репозиториям и неизменяемым коммитам. Это делает бенчмарк максимально приближенным к продакшен-нагрузке. HydraFusion на нём показал почти идентичное Opus 5 качество при вдвое меньшей стоимости.
Пять принципов работы HydraFusion
GitHub формулирует пять операционных принципов, на которых построена система:
Выбор сценария как задача оптимизации, а не жёсткое правило.
Прозрачность исполнения: каждый вызов фиксируется с указанием роли, результата, стоимости, задержки и диагностики.
3. Единый ответ для разработчика: независимо от числа внутренних вызовов, пользователь получает один связный результат и один набор изменений, согласованный с разрешениями.
4. Адаптивность к новым моделям: по мере появления моделей в Copilot они могут включаться в пул HydraFusion без изменения архитектуры.
5. Контроль состояния репозитория: система управляет изменениями так, чтобы не нарушить целостность проекта.
Что это значит для разработчиков
HydraFusion решает практическую проблему: разработчики уже сегодня вручную координируют модели — используют одну для генерации, другую для ревью, третью для сложных случаев. HydraFusion автоматизирует этот процесс, выбирая оптимальный сценарий под каждую задачу.
Для команд, работающих с ограниченными бюджетами на API, снижение стоимости на 36–67% при сохранении качества — значимый аргумент. Особенно в задачах, где каждая эскалация к Opus 5 или GPT-5.6 Sol обходится дорого.
Однако важно учитывать, что результаты получены в контролируемых офлайн-условиях на фиксированных версиях бенчмарков. GitHub признаёт, что исследовательское превью нужно для валидации на реальных рабочих нагрузках, и обещает оптимизировать HydraFusion под продакшен по качеству, задержке, надёжности, кэшированию, стоимости и безопасности.
Как попробовать HydraFusion
HydraFusion доступен в Copilot CLI через команду /experimental. Для использования нужно установить или обновить GitHub CLI и выбрать HydraFusion как модель. Обратная связь принимается через GitHub Community.
Пока это исследовательская версия, и GitHub не раскрывает, какие именно модели участвуют в пуле HydraFusion и как часто система выбирает тот или иной сценарий. Эти детали, вероятно, появятся по мере продвижения к стабильному релизу.
