Современный ИИ-агент — это языковая модель, которую окружает так называемый «каркас»: фреймворк из промтов, рабочих процессов, инструментов, памяти и логики. Он определяет, что модель видит на каждом шаге.
От каркаса зависит, прочитает ли агент нужный файл перед изменениями, исправится ли после ошибки и аккуратно ли выдаст результат. Согласно новой научной работе, значительная часть недавнего прогресса ИИ-агентов связана именно с улучшением каркасов, а не с появлением новых моделей.
Раньше каркасы настраивали вручную: люди изучали неудачные запуски и вносили исправления. Более новые методы автоматизируют этот цикл: языковая модель снова и снова переписывает каркас, опираясь на результаты тестовых задач.
Исследователи называют это практической формой рекурсивного самоулучшения. Система использует обратную связь, чтобы оптимизировать каркас, а тот, в свою очередь, управляет поведением самой системы.
Почему агенты заучивают тесты
У самооптимизации есть побочный эффект: агент снова и снова решает один и тот же ограниченный набор тестовых задач и начинает их запоминать. Результаты на задачах, использованных для обучения, растут, а улучшения на новых, ранее не встречавшихся задачах сокращаются или исчезают.
По словам исследователей, это происходит по нескольким причинам: поиск запоминает закономерности, подходящие только для конкретного бенчмарка; выбирает варианты, которые набрали высокий балл случайно; и наращивает ненужную сложность, повышающую результат на тесте, но не улучшающую самого агента.
Другие методы в основном улучшают результаты на задачах, использованных для обучения, но эти улучшения почти не переносятся на неизвестные бенчмарки. RRSI повышает результаты в новых задачах во всех трёх областях, которые изучали авторы.
Ограничение правок и строгая проверка
Метод RRSI — «Регуляризованное рекурсивное самоулучшение каркасов агентов» — меняет обе стороны цикла оптимизации, оставляя каркас полностью редактируемым. При предложении изменений система ограничивает число независимых правок, которые можно объединить в одном варианте.
Со временем лимит уменьшается. На первых этапах разрешены крупные изменения, а позже — только небольшие правки, связь которых с результатом можно проследить. Система также сохраняет сведения о предыдущих попытках, чтобы не возвращаться к одним и тем же неудачным идеям. Если улучшения прекращаются, она целенаправленно проверяет ещё не затронутые части каркаса.
RRSI ограничивает самооптимизацию в двух местах: при предложении изменений и при выборе тех, что войдут в постоянную версию каркаса.
При отборе правок критик проверяет каждое предложение и отбрасывает изменения, которые жёстко прописывают названия задач, решения или другие приёмы, заточенные под конкретный бенчмарк. Дополнительное правило разрешает увеличить вычислительные затраты только при измеримом росте качества. Компоненты, которые больше не помогают, удаляются.
Меньше выигрыша на знакомых задачах — больше на новых
Исследователи проверили RRSI на восьми бенчмарках по программированию, офисной работе с ИИ-агентами и инженерному проектированию. Базовую модель Claude Opus 4.8 не меняли. RRSI сравнили с исходным каркасом без изменений и четырьмя недавно предложенными методами оптимизации.
Согласно работе, RRSI повышает результаты на задачах, использованных для обучения, максимум на 14,1 пункта, а на пяти незнакомых бенчмарках — максимум на 4,7 пункта. Во время работы он расходует примерно на 30% меньше токенов, чем версия без ограничений. Ни на одном из новых бенчмарков результат не оказался ниже базового — с каркасом, заучившим свои задачи, такое обычно случается.
Каркас RRSI улучшил результаты на всех задачах за пределами обучающего набора. Самый большой прирост — 4,7 пункта на JobBench.
Все методы показали хорошие результаты на знакомых задачах, но на новых картина изменилась: два метода даже уступили базовому каркасу. У RRSI прирост на обучающих задачах был самым скромным среди всех вариантов, зато только он значительно превзошёл базовый каркас на незнакомых задачах. Именно такого компромисса авторы добивались с помощью защитных ограничений.
Среди оптимизированных каркасов RRSI требует меньше всего токенов и шагов и лучше других справляется с новыми задачами. При этом исходный каркас без изменений всё равно экономнее.
Каркасы помогают и более слабым моделям
Каркас для программирования, настроенный с Gemini 3.5 Flash, повысил точность более слабой Gemini 3.1 Flash Lite с 11,2 до 14,6 пункта — без каких-либо изменений самой модели. Найденные системой механизмы не зависят от возможностей модели, с помощью которой их обнаружили.
Авторы отмечают, что исследование охватывает только каркасы вокруг неизменных моделей и не рассматривает случаи, когда меняются веса модели.
По их выводу, самоулучшение позволяет ИИ-агентам надёжно становиться способнее, только если повторяющаяся обратная связь приводит к устойчивым изменениям. Код опубликован на GitHub.
Ручная настройка каркасов часто не помогает на новых задачах — это показали испытания на ARC-AGI-3. С каркасом, специально созданным для знакомой среды, Opus 4.6 набрала 97,1% в ней и 0% в незнакомой.
Nvidia недавно представила похожий метод SoL-Pi: исследовательский агент автоматически перестраивает каркас агентов для программирования. Подход сокращает расход токенов максимум на 49% без заметного ухудшения результатов.
Незадолго до этого Google предложила агентам «видеть сны» о прошлых поисковых запусках, чтобы улучшить стратегию поиска. В той работе модель тоже оставалась неизменной.
Читайте также
ИИ-индустрия на подъёме, но женщины в ней остаются позади
Открытая модель NASA и IBM превращает 17 лет данных лунных орбитальных аппаратов в основу для науки о Луне
Кредитное рейтинговое агентство: экономику вот-вот разнесёт в клочья
Сельские дата-центры получат крупные федеральные налоговые льготы
Китайские ИИ-модели повторяют официальную позицию или отказываются отвечать на щекотливые вопросы
Новые тарифы Gemini оставляют бесплатных пользователей с самой слабой моделью, а подписчиков за $5 в месяц — без Pro
Студенты Queen’s University отправляются в США на конкурс робототехники NASA
Похоже, OpenAI больше не пытается создать «магический разум в небесах»
Amazon отвечает на критику дата-центров: компания больше не использует соглашения о неразглашении
Nvidia Shield TV уже 7 лет — и только что подорожала на $100
Сотрудник OpenAI, отвечавший за безопасность, уволился, заявив, что культура компании «сломана»
Google обновила правила и будет наказывать сайты за фальшивые подписи авторов и созданные ИИ портреты журналистов
Агрессивное внедрение ИИ в школы оборачивается катастрофой для технологической отрасли
Глупее создания «камеры пыток для ИИ» может быть только истерика защитников благополучия ИИ из-за неё
Новые законы Калифорнии направлены против главного страха работников — ИИ лишит их работы
Новая система Mods позволяет разработчикам менять Claude Code изнутри
ИИ пишет код, в котором не могут разобраться даже люди
Исследователи DeepMind предлагают «искусственный симбиотический интеллект» как альтернативу сингулярности
Meta использует огромные ИИ-центры обработки данных, чтобы не платить миллиарды долларов налогов
Открытый инструмент BootLoops помогает ИИ-моделям выполнять точные научные расчёты
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram