В отличие от систем самоулучшения, которые меняют программное обеспечение и настройки агентов между запусками, метарассуждение управляет работой агента прямо во время выполнения задачи. Для корпоративных разработчиков это ещё один способ повысить результаты агентов без изменения или файн-тюнинга моделей.
Как агент выбирает следующий шаг
Представьте агента для программирования, который реализовал основную часть компонента и прошёл несколько тестов, но ещё не разобрался с редкими кейсами. Ему нужно решить, изучить ли ошибки, переписать часть кода, запустить дополнительные тесты, попробовать другой подход или остановиться. Каждый вариант требует ресурсов, а неверное решение может израсходовать оставшийся бюджет или повредить уже работающий код.
Исследователи называют эту задачу метакогнитивным управлением: оценкой собственного прогресса и использованием этой оценки, чтобы решить, что делать дальше.
Для ИИ-агента это означает выбирать, каким промежуточным результатам доверять, на какую предыдущую работу опираться и когда выделять дополнительные вычислительные ресурсы. Неудачное решение может заставить агента продолжать тратить ресурсы на ошибочный подход или отказаться от уже найденного верного решения.
Во многих существующих агентах выбор следующего действия совмещён с выполнением задачи: агент принимает решение за один шаг, опираясь на накапливающуюся историю действий и взаимодействий со средой. По мере работы важные сведения могут затеряться среди предыдущих попыток, ответов инструментов и ошибок.
У традиционных методов увеличения вычислений на этапе инференса есть свои ограничения. Например, генерация нескольких вариантов, циклы критики и доработки, а также заранее заданные деревья поиска обычно требуют определить структуру вычислений до начала работы. Число попыток, проверок и этапов доработки задаётся ещё до того, как становится ясно, какие вычисления окажутся полезнее.
Исследователи Meta считают, что решение о следующем вычислении само заслуживает отдельного процесса рассуждений. По их описанию, у такого процесса есть собственная структура: собрать воедино результаты текущего запуска, изучить возможные дальнейшие действия и оценить пользу каждого варианта.
Как устроены метарассуждения агента
Предложенный Meta фреймворк позволяет агенту рассуждать о собственном процессе инференса и управлять им.
Работа строится циклом: выполнить задачу, оценить результаты, определить перспективные следующие шаги и выделить на них дополнительные вычисления. Предыдущие находки сохраняются, поэтому агент может опираться на прежние попытки, не перечитывая каждый раз всю историю работы.
Исследователи реализовали этот подход в системе для инференса под названием Meta-рассуждение Agent. В ней разделены два компонента: «исполнители», которые выполняют задачу, и контроллер, который решает, какую работу поручить дальше.
Исполнителем может быть отдельный вызов большой языковой модели или агент для программирования с инструментами, позволяющими изучать файлы, менять код и запускать тесты. Контроллер проверяет результаты, сохраняет собственные выводы, запускает новых исполнителей с точными инструкциями и решает, когда остановиться.
Контроллер работает в четыре этапа:
На каждом этапе могут выполняться отдельные вызовы модели и операции с памятью. Благодаря этому контроллер способен собрать дополнительную информацию перед принятием решения.
Важная часть архитектуры — постоянная память артефактов. Результаты исполнителей и заметки контроллера сохраняются как артефакты с уникальными идентификаторами. Контроллер поддерживает краткую оценку состояния задачи и обращается к подробным записям только при необходимости.
Артефакты также образуют граф вычислений. Если контроллер передаёт прежний артефакт как контекст для новой работы, система фиксирует связь между ними. Например, отчёт о тестах может привести к целевому исправлению, которое затем проверит другой исполнитель.
Граф показывает, как агент изучает альтернативные подходы и использует предыдущие результаты. По нему также можно анализировать, продуктивно ли агент расходует вычисления или создаёт несвязанные между собой попытки.
Результаты на бенчмарках
Исследователи проверили фреймворк на четырёх бенчмарках: IMO ProofBench-Advanced для математических доказательств, ARC-AGI-2 для абстрактного визуального рассуждения, LongCoT-mini для длительных задач в нескольких областях и ProgramBench для восстановления программ по документации и исполняемым образцам.
В тестах участвовали три передовые модели: Gemini 3.1 Pro, GPT-5.5 и Opus 4.8. Основным базовым вариантом был Direct Control Agent — версия Meta-рассуждение Agent, которая принимает решения о ходе работы за один шаг на основе накопленной истории, без отдельного контроллера. Фреймворк также сравнили с исследовательскими системами и агентами для программирования, включая Codex, Claude Code и рекурсивные языковые модели (RLM).
При максимальных проверенных бюджетах метарассуждение показало более высокие результаты во всех 12 сопоставимых сравнениях.
Отдельно исследователи изучили, как агенты используют увеличение бюджета вычислений. Когда лимит на ProgramBench вырос с 400 до 1 200 вызовов модели, результат метарассуждения с GPT-5.5 поднялся с 64,1% до 71,5%. Direct Control Agent остался примерно на уровне 64% и при максимальном лимите использовал лишь около 18% доступных вызовов.
Графы артефактов помогают агенту эффективнее работать с увеличенным бюджетом. При метарассуждении появлялось больше промежуточных результатов и связей между ними. В одном примере на ARC-AGI-2 Direct Control Agent создал шесть независимых попыток и четыре коротких продолжения. Система с метарассуждением изучила больше вариантов и связала последующую работу с предыдущими результатами.
Как применить подход
В материалах исследования Meta не представила официальную готовую к запуску реализацию. При этом в работе подробно описаны промты контроллера, инструкции для исполнителей, интерфейсы памяти и инструменты.
Разработчики могут использовать эти описания для экспериментов: добавить отдельный цикл управления к существующей системе агентов, сохранять промежуточную работу и явно оценивать затраты и пользу предполагаемых действий.
Реализация для ProgramBench даёт несколько практических идей для агентов программирования. Исполнители фиксируют изменения в Git, а контроллер может проверять их заявления через интерфейс репозитория только для чтения. В своей текущей оценке он отдельно отмечает реализованную, сломанную, непроверенную и ещё не изученную функциональность. Кроме того, фреймворк ограничивает параллельные изменения кода в общей рабочей области, чтобы исполнители не затирали работу друг друга.
Метарассуждение добавляет накладные расходы и вызовы языковой модели в цикл управления. При небольших бюджетах система иногда уступала Direct Control Agent, но превосходила его, когда вычислений становилось больше.
Исследователи считают, что для корпоративных команд, работающих с ИИ, умение распоряжаться вычислениями следует отдельно учитывать при оценке и оптимизации агентов. Чем длиннее становятся рабочие процессы, тем важнее способность агента остановиться и определить, как лучше распределить доступные ресурсы.
Читайте также
Claude от Anthropic теперь может координировать до 1 000 ИИ-агентов одновременно с помощью динамических рабочих процессов
Anthropic запустила бесплатный ИИ-сканер для проектов с открытым кодом
Планирование GPU-кластеров с реальным эффектом
Оливия Мур из Andreessen Horowitz — о состоянии потребительского ИИ
Потерянное поколение: как ИИ угрожает будущим великим режиссёрам Британии
ИИ и климатический кризис несут экзистенциальные риски, но закон помогает их снизить
Даже «Закон и порядок» боится искусственного интеллекта
Мы слишком полагаемся на способность ИИ говорить «нет»
Claude Science от Anthropic составила первую полную карту неба в ультрафиолетовом диапазоне
Том Уотсон из Palantir: «власть толпы» не должна решать, кому достанутся госконтракты
OpenAI раскрыла российскую и иранскую операции влияния, размещавшие фальшивые новости в настоящих СМИ
Великобритания откроет восемь центров, чтобы ускорить внедрение робототехники
Выручка OpenAI, по сообщениям, на $20 млрд ниже прежних прогнозов
Популярная платформа Arena почти вдвое увеличила оценку за 10 месяцев — до $3,1 млрд
Firmus отозвала крупнейшее с 1997 года размещение акций в Австралии на фоне сомнений инвесторов в компании, строящей дата-центры для ИИ
Goodfire: новые «внутренние» мониторы ловят ИИ-агентов, вышедших из-под контроля, в разы дешевле
Китайская Manus привлекла более $500 млн в первом раунде финансирования после разрыва с Meta
Magnific запускает генератор изображений Magnific One: он избегает «вида ИИ» и сам соблюдает фирменный стиль компаний
Некоторые математики призвали бойкотировать OpenAI после нашествия созданных ИИ доказательств в их области
Не хотите проводить время с детьми? Обучите ИИ-модель своего голоса читать им сказки на ночь
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram