Что делает HydraFusion
Очевидно, что одной модели недостаточно для всех задач, поэтому маршрутизация моделей стала базовой функцией ИИ-систем. Компании на этом рынке теперь продают мультиагентную координацию как способ повысить качество, хотя опубликованные бенчмарки подтверждают такие заявления не во всех случаях.
Похожая картина наблюдается у GitHub, Nvidia и OpenRouter. В последнем выпуске GitHub описывает HydraFusion как систему с качеством уровня передовых моделей, однако собственные результаты компании подтверждают это только в одном из трёх тестов.
Название HydraFusion отсылает к HyDRA — гибридной архитектуре динамической маршрутизации, исследовательской работе о маршрутизации, которую специалисты Microsoft опубликовали ранее в этом году.
HydraFusion доступна в Copilot CLI как исследовательская версия. Она направляет каждый запрос по программированию между моделями в реальном времени, вместо того чтобы отправлять все задачи одной заранее выбранной модели. В лучшем бенчмарке система снизила расчётные расходы до 67% по сравнению с использованием только Claude Opus 5.
По словам Марио Родригеса, директора по продукту GitHub, обычная маршрутизация отвечает на вопрос, какая модель лучше справится с задачей. HydraFusion пытается определить, как именно эту задачу лучше решить: достаточно ли одной модели, стоит ли начать с быстрой и при необходимости перейти к более мощной или привлечь независимую модель для проверки и доработки результата.
Перед первым вызовом модели HydraFusion оценивает запрос и выбирает один из трёх сценариев выполнения.
Три сценария выполнения
Что показали бенчмарки
В оценках без подключения к интернету на трёх бенчмарках для программирования GitHub сравнила HydraFusion с Claude Opus 5 и GPT-5.6 Sol. Компания заявила, что исследовательская версия обеспечивает качество уровня передовых моделей, но её таблица подтверждает это только в одном из трёх тестов.
Расходы снизились во всех трёх тестах, но качество сравнялось с Opus 5 или превысило его только в одном.
Почему снижается стоимость
Согласно техническому разбору, опубликованному в интернете, такой результат объясняется распределением задач, а не ростом способности моделей. Разработчик Аван Фарз отметил в X, что дешёвая модель используется на каждом запросе, проходящем через каскад. Более дорогая модель запускается только для той части задач, которая не проходит проверку качества.
Не все комментаторы восприняли разрыв между качеством и стоимостью как оговорку. ИИ-комментатор Мартин Сзермент написал в X, что выбор модели перестал быть самостоятельным решением и превратился в деталь реализации. По его мнению, выпуск показывает: подбор модели для каждой задачи становится инфраструктурной функцией.
Чем HydraFusion отличается от Auto
Маршрутизация моделей для GitHub не нова: ранее в этом году компания уже запустила собственную функцию под названием Auto.
Родригес объяснил, что Auto и HydraFusion работают на разных уровнях. Auto определяет, какая одна модель лучше всего подходит для конкретной задачи. HydraFusion подбирает сочетание моделей и последовательность действий, которые должны дать лучший результат.
На практике Auto выбирает модель, а HydraFusion организует рабочий процесс. Система может решить, что одной модели достаточно, поручить одной модели подготовить черновик, другой — независимо проверить его или передать задачу более мощной модели, если первая попытка не достигла нужного уровня качества.
GitHub считает эти функции взаимодополняющими и изучает возможность объединить HydraFusion с Auto.
Другие маршрутизаторы
Разрыв между рекламными заявлениями о качестве и результатами бенчмарков заметен и у других инструментов маршрутизации.
Nvidia выпустила NeMo Switchyard в августе вместе с моделью Nemotron 3.5 Lightning. Компания заявляет, что система сохраняет точность уровня передовых моделей, снижая стоимость задачи примерно до трети расходов на один Claude Opus 4.8.
Однако самый подробный опубликованный Nvidia внешний бенчмарк подготовила LangChain. В тесте на 145 многоходовых задачах маршрутизация только 7% запросов к передовой модели снизила расходы на 74%, но одновременно привела к заметной потере точности по сравнению с использованием только передовой модели.
OpenRouter показывает похожий разрыв в собственных результатах. Новый маршрутизатор Auto, запущенный в августе, по заявлению компании превосходит предыдущую версию в широком диапазоне задач и уровней стоимости. Опубликованная таблица подтверждает это в трёх из пяти категорий тестов. В двух остальных новый маршрутизатор уступил старому:
Что это значит для команд
Для инженерных команд, которые выбирают агентов для программирования, HydraFusion показывает: управление расходами перемещается внутрь слоя моделей, а не остаётся отдельным инфраструктурным решением.
Пока HydraFusion работает только с задачами по программированию первого хода и одним запросом. Многоходовая координация, по данным GitHub, ещё разрабатывается. Поэтому компании, которые оценивают агентов только по качеству, уже не учитывают половину параметров, которые оптимизируют поставщики.
При оценке HydraFusion и других инструментов маршрутизации главным источником информации остаётся таблица бенчмарков. Собственные данные GitHub показывают снижение расходов во всех тестах, но сохранение качества — только в одном. Этот разрыв стоит учитывать, прежде чем принимать на веру рекламные формулировки.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram