Когда агенту нужен дирижёр: AOrchestra и динамическая оркестрация LLM через субагентов

LLM‑агенты не справляются, когда задача растягивается на десятки шагов — с проверками, возвратами, экспериментами, запуском команд и исправлением ошибок. Контекст раздувается, в нём накапливается шум, важные детали теряются, а сам агент тратит время не на работу, а на попытки вспомнить, что происходило раньше. В мультиагентных системах это пытаются решать координацией нескольких ролей, но там часто появляются другие расходы: много болтовни между агентами и сложная ручная настройка.
Авторы работы «AOrchestra: Automating Sub-Agent Creation for Agentic Orchestration» предлагают посмотреть на проблему иначе. Пусть главный агент не «делает всё сам», а управляет командой исполнителей — но не фиксированных «ролей», а субагентов, которые создаются под конкретную подзадачу прямо во время выполнения.

Агент как система из четырех компонент
Ключевой ход AOrchestra — унифицировать описание любого агента в виде понятного «рецепта» из четырёх компонентов: инструкция, контекст, инструменты и модель. По сути, это карточка исполнителя: что именно нужно сделать, какие факты ему дать, чем он может действовать и какой LLM лучше подходит по цене/качеству.
Это важно потому, что большинство систем либо изолируют контекст (чтобы не было «гниения» контекста), но тогда исполнители получаются слишком общими, либо заводят статические роли (типа «исследователь», «кодер», «ревьюер»), но они плохо покрывают неожиданные подзадачи и требуют ручной инженерии. Здесь же специализация получается «по запросу»: под конкретный шаг оркестратор собирает нужный набор параметров и запускает субагента как инструмент.
Оркестратор, который не работает руками
Любопытная деталь: оркестратор в AOrchestra сам не исполняет действия в среде — не запускает команды, не правит код, не ходит в веб. Он только решает, какой следующий шаг нужен, какой контекст передать и какого исполнителя создать. Исполнитель уже делает работу и возвращает наблюдения: что получилось, где ошибки, какие артефакты сохранены.
Такое разделение дисциплинирует систему. Во‑первых, контекст можно передавать «аккуратно отрезанным» — ровно то, что нужно этой подзадаче. Во‑вторых, инструменты тоже выдаются строго по делу: например, для Terminal‑Bench это будут shell‑команды, для SWE‑Bench — инструменты редактирования файлов и запуска тестов. В‑третьих, можно выбирать модель под задачу: где-то дешёвую и быструю, где-то более сильную — и этим управлять стоимостью.

Как это проверяли
Авторы тестируют подход на трёх популярных агентных бенчмарках:
- GAIA — задачи на поиск и рассуждение в открытом мире, где важно не утонуть в контексте и уметь проверять гипотезы.
- Terminal‑Bench 2.0 — сценарии в Linux‑терминале, где нужен многократный запуск команд.
- SWE‑Bench‑Verified — исправление багов в реальных репозиториях с обязательной проверкой тестами.
Идея «создаём субагента под шаг» должна проявиться именно здесь: когда задач многошаговая, среда меняется, а ошибки неизбежны.
Что получилось: выигрыш не только в точности, но и в управляемости
В связке с Gemini‑3‑Flash AOrchestra показывает заметный прирост относительно сильных бейзлайнов: в среднем авторы сообщают 16.28% относительного улучшения, а в таблицах по отдельным наборам видно, что разница может быть ещё более ощутимой. Например, на GAIA pass@1 у AOrchestra доходит до 80.00, а на Terminal‑Bench 2.0 — 52.86 pass@1, что существенно выше ряда популярных фреймворков в сравнении.

Отдельно авторы показывают, почему «просто передать весь контекст» — не панацея. Без контекста исполнитель может не знать критичных деталей, а с полным контекстом — утонуть в нерелевантном. Их вариант — курирование контекста оркестратором — даёт лучший результат на сэмпле GAIA.
Ещё один практичный момент: система остаётся модульной. Субагента можно заменить (например, на ReAct‑стиль или mini‑SWE‑стиль), и оркестрация всё равно приносит пользу — то есть улучшение не привязано к одному конкретному «исполнителю».
Цена вопроса: как приблизиться к балансу качество–стоимость
Авторы подчёркивают управляемость: оркестратор может выбирать более дешёвые модели там, где это безопасно, и усиливаться там, где риск ошибки высок. Они показывают, что такая маршрутизация помогает двигаться к Парето‑эффективности: улучшать точность без пропорционального роста стоимости, или снижать стоимость без сильной потери качества.

Главный вывод работы
AOrchestra «развязывает узел» long-horizon агентных сценариев: вместо тяжёлых статических ролей и бесконтрольного обмена контекстом появляется понятная система управления субагентами и центральный оркестратор, который на каждом шаге собирает исполнителя под задачу. Это снижает ручную инженерию, делает систему более переносимой между фреймворками и даёт рычаг для контроля бюджета.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram