i
ДАТАИСТ
Обзор · 2026-05-04

Для чего нужна рекурсивная мультиагентная система

Обложка: Для чего нужна рекурсивная мультиагентная система

У мультиагентных систем на базе LLM есть старая, почти бытовая проблема: они слишком много разговаривают. Один агент пишет план, второй его критикует, третий решает задачу, четвертый вызывает инструмент — и вся эта кооперация упирается в бесконечную генерацию текста, задержки и расход токенов. На бумаге выглядит как коллективный разум, на практике — как длинная переписка в рабочем чате.

Когда агенты перестают «болтать» и начинают думать вместе

Авторы статьи Recursive Multi-Agent Systems предлагают радикально иной ход: а что если агентам не обязательно обмениваться текстом? Что если систему из нескольких моделей можно превратить в единую рекурсивную вычислительную петлю, где обмен идет не словами, а внутренними представлениями? Так появляется RecursiveMAS — архитектура, которая переносит идею рекурсии из одной языковой модели на целую мультиагентную систему.

Звучит как чисто инженерная оптимизация, но по сути это заявка на новый способ масштабировать агентные системы. Не просто делать агентов больше, а заставлять их итеративно улучшать совместную работу.

В чем идея: не текст между агентами, а скрытые состояния

Главная мысль статьи проста: если одна модель может улучшать ответ, многократно прогоняя вычисления по своим скрытым состояниям, то почему бы не сделать то же самое для группы агентов? В таком случае каждый агент — это как будто отдельный функциональный блок в общей рекурсивной цепочке.

Вместо привычной схемы «агент сгенерировал текст → следующий агент прочитал текст → ответил текстом» авторы предлагают передавать между агентами скрытые состояния. То есть не промежуточный текст, а внутреннее представление смысла, которое модель уже вычислила, но еще не декодировала в слова.

Общая архитектура RecursiveMAS: каждый агент генерирует внутренние представления, передает их следующему агенту и замыкает цикл обратно к первому.

Это важно по двум причинам.

Во-первых, текст — дорогой интерфейс. Каждый промежуточный шаг требует декодирования в словарь, затем следующая модель заново кодирует этот текст в свои представления. Это медленно и прожорливо по токенам.

Во-вторых, текст плохо подходит для совместного обучения всей системы. Когда между агентами стоит текстовый «разрыв», полезный обучающий сигнал хуже проходит по цепочке. Авторы показывают теоретически, что при текстовом взаимодействии градиенты склонны затухать, а при передаче через специальные проекции в скрытом пространстве — остаются стабильнее.

Иными словами, скрытое взаимодействие — это не только быстрее, но и лучше подходит для обучения.

Как устроен RecursiveMAS

Сердце системы — модуль RecursiveLink. Это небольшая двухслойная остаточная проекция, которая связывает внутренние представления внутри агента и между агентами.

У него две роли.

Первая — внутренняя связь. Она помогает агенту не только читать исходный запрос, но и разворачивать собственную цепочку «внутренних мыслей» в скрытом пространстве. Модель делает шаг, получает последнее скрытое состояние, преобразует его через легкий модуль и подает обратно себе же как вход для следующего шага.

Вторая — внешняя связь. Она нужна, чтобы передавать представления от одного агента к другому, даже если это разные модели с разными размерами скрытых слоев. Тут модуль не просто сохраняет семантику, но и переводит ее между разными пространствами представлений.

Схема внутренней и внешней связей: одна поддерживает внутренние «мысли» агента, другая переносит смысл между разными моделями.

После этого система работает как цикл. Первый агент генерирует внутренние представления, передает их второму, тот — третьему, и так далее. Последний агент возвращает результат обратно первому, образуя рекурсивную петлю. Только на самом последнем раунде система декодирует итог в текст.

Это аккуратный, но важный сдвиг: текст становится не рабочей средой взаимодействия, а только финальной витриной результата.

Как это обучают: сначала разогрев, потом совместная оптимизация

Если взять готовые LLM и просто заставить их обмениваться скрытыми состояниями, ничего хорошего не выйдет. Поэтому авторы строят обучение в два этапа.

Сначала идет внутренний цикл: для каждого агента обучают внутреннюю связь так, чтобы его скрытые «мысли» были согласованы с тем, как модель обычно кодирует правильные ответы. Проще говоря, агент учится продолжать рассуждение не через текст, а напрямую в скрытом пространстве.

Затем запускается внешний цикл: теперь уже оптимизируются связи между агентами, а вся система разворачивается на несколько раундов рекурсии. После финального ответа ошибка распространяется назад через всю петлю, и связи между агентами подстраиваются под общий результат.

Двухэтапное обучение RecursiveMAS: сначала разогрев внутренних связей, затем совместная оптимизация внешних связей во всей системе.

Принципиальный момент: базовые параметры самих LLM не трогают. Замораживаются все большие модели, а обучаются только легкие соединительные модули. Это делает подход гораздо дешевле, чем полный файн-тюнинг каждого агента, и снижает риск развалить их исходные способности.

Получается интересный компромисс. Авторы не пытаются «переучить» каждого участника команды. Они учат саму командную динамику.

Почему это важно не только для скорости

Сегодня в агентных системах часто обсуждают роли, протоколы общения, вызовы инструментов, топологии из нескольких агентов. Но статья задает более фундаментальный вопрос: можно ли масштабировать не отдельную модель, а саму кооперацию?

Именно здесь работа выглядит сильнее обычной оптимизации инференса. Она предлагает новую ось масштабирования: не просто больше параметров, длиннее контекст или больше вычислений на один агент, а больше рекурсивной совместной обработки внутри всей системы.

Это меняет перспективу. Если раньше мультиагентная система напоминала группу моделей, пересылающих друг другу сообщения, то здесь она становится почти единой вычислительной машиной, разбитой на специализированные блоки.

Для индустрии это особенно интересно по трем причинам:

Во-первых, дорогостоящий текстовый обмен становится узким местом все чаще, особенно в сложных конвейерах с критиком, планировщиком, исполнителем и инструментами.

Во-вторых, если можно сохранять сильные стороны разных моделей и обучать только их «стыки», это открывает путь к более дешевым и гибким системам.

В-третьих, рекурсия здесь работает как дополнительная глубина рассуждения, но распределенная между агентами. Это потенциально важнее, чем просто сделать одну модель больше.

Что показали эксперименты

Авторы тестируют RecursiveMAS на девяти бенчмарках: математика, наука, медицина, поиск и генерация кода. Причем проверяют не одну фиксированную архитектуру, а четыре распространенных стиля кооперации:

последовательная цепочка из планировщика, критика и решателя;
смесь экспертов по областям;
связка «эксперт + ученик»;
сценарий с рефлексией и вызовом инструментов.

Главный результат: по сравнению с сильными одноагентными и мультиагентными базовыми системами метод дает в среднем плюс 8,3% по точности. При этом система ускоряется в 1,2–2,4 раза и снижает расход токенов на 34,6–75,6%.

Чем глубже рекурсия, тем лучше результаты; метод также переносится на разные схемы кооперации агентов.

Особенно интересно, что выигрыш растет с глубиной рекурсии. На трех раундах рекурсивной обработки преимущества становятся заметнее и по качеству, и по эффективности. Обычно мы ожидаем, что дополнительные итерации будут стоить дороже. Здесь они действительно стоят вычислений, но текстовый базовый вариант дорожает куда сильнее, потому что каждый шаг снова и снова платит за генерацию промежуточных ответов.

В сравнении с такими базами, как одиночные дообученные агенты, TextGrad, LoopLM и текстовая рекурсивная мультиагентная система, RecursiveMAS оказывается лучшим почти везде. Особенно заметен отрыв на задачах, где нужно глубокое рассуждение: олимпиадная математика, сложные научные вопросы, код.

Есть и другой важный вывод: подход не завязан на одну конкретную топологию агентов. Он работает как с линейной цепочкой, так и со смесью экспертов, и со связкой быстрого «ученика» и сильного «эксперта».

Откуда берется выигрыш в эффективности

Авторы отдельно анализируют скорость и токены. Здесь логика почти интуитивная: если не нужно на каждом раунде прогонять промежуточные состояния через огромный словарь и обратно, то система становится дешевле.

Сокращение числа токенов растет с глубиной рекурсии: скрытое взаимодействие оказывается заметно экономнее текстового.

При трех раундах рекурсии сокращение токенов доходит до 75,6% относительно текстовой версии. Это огромная разница для практических систем, где стоимость общения между агентами быстро становится больше стоимости самого финального ответа.

Есть и любопытный качественный эффект. Авторы визуализируют распределения финальных ответов по мере роста числа раундов и показывают, что они постепенно сближаются с распределением правильных ответов. Проще говоря, система не просто «думает дольше», а постепенно выправляет направление своих представлений.

Отдельный плюс — стоимость обучения. Поскольку большие модели заморожены, RecursiveMAS требует меньше обучаемых параметров, меньше памяти GPU и оказывается дешевле полного файн-тюнинга, при этом давая лучший средний результат.

Где могут быть ограничения

Работа выглядит сильной, но без оговорок не обойтись.

Во-первых, передача скрытых состояний между разными моделями — вещь капризная. Да, легкие проекции помогают согласовать пространства, но вопрос совместимости между еще более разнородными архитектурами остается открытым.

Во-вторых, скрытое взаимодействие хуже поддается интерпретации. В текстовом мультиагентном конвейере мы можем читать промежуточные рассуждения и видеть, где агент ошибся. Здесь значительная часть кооперации спрятана внутри векторов. Это хорошо для эффективности, но хуже для отладки и аудита.

В-третьих, статья тестирует до трех раундов рекурсии. Это уже достаточно, чтобы увидеть тренд, но еще не предел. Остается вопрос, как поведет себя система при более глубокой рекурсии и на более длинных задачах с активным использованием инструментов.

Наконец, подход очень зависит от того, насколько хорошо удается обучить сами «стыки» между агентами. Если эти проекции плохи, вся идея может быстро деградировать.

Главное

RecursiveMAS — это одна из тех работ, которые на первый взгляд выглядят как архитектурная хитрость, а на второй — как попытка переопределить саму механику мультиагентных систем.

Авторы предлагают перестать воспринимать агентов как собеседников, обменивающихся репликами, и начать смотреть на них как на части единого рекурсивного вычисления. Это позволяет одновременно поднять точность, ускорить инференс и резко уменьшить расход токенов. А главное — дает новый язык для разговора о масштабировании агентных систем.

Если коротко, тезис статьи можно сформулировать так: следующий шаг в развитии мультиагентных LLM-систем — не обязательно больше агентов и не обязательно больше текста между ними. Возможно, это меньше текста и больше общей внутренней работы.

И это уже не просто инженерный трюк, а вполне серьезная заявка на то, как могут выглядеть агентные системы следующего поколения.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram