Команды тратят десятки тысяч токенов и вызовов агентов на улучшение циклов поиска. По мнению исследователей Google, значительная часть этих расходов приходится на направления, которые уже показали плохой результат. Dream-RSI предлагает «проживать во сне» такие циклы: агент изучает предыдущие попытки и использует их, чтобы направлять будущие поиски.
Система построена на лёгком слое оркестрации. Он управляет ветвлением, параллельным исследованием и решением об остановке, не меняя лежащего в основе агента для программирования. Исследование остаётся «явным и программируемым»: система оценивает и улучшает стратегии, не запуская каждый раз дорогие проверки в реальной среде.
В нескольких областях Dream-RSI сохранила или повысила качество поиска, одновременно заметно снизив вычислительные расходы. Все результаты выполнения уже записаны в дереве, поэтому для проверки новой стратегии достаточно прочитать прошлые записи — повторно запускать поискового агента и оценщик не требуется.
Исследование вышло через несколько дней после эссе Дарио Амодеи «We Must Pace the Frontier», опубликованного 12 сентября. Сооснователь Anthropic назвал рекурсивное самоулучшение, или RSI, одним из двух событий, изменивших его мнение о необходимости замедлить развитие ИИ: по его оценке, оно может привести к появлению слишком мощного для человеческого контроля ИИ.
Однако эксперимент Dream-RSI основан на результатах бенчмарков и показывает разрыв между угрозой существованию человечества, о которой предупреждают Амодеи и другие специалисты, и более узким практическим применением циклов, где агенты самостоятельно исследуют пространство поиска.
Исторические деревья поиска
RSI требует эффективно управлять исследованием: решать, где и когда создавать новые ветви, какие направления запускать параллельно и когда прекращать отдельную линию. По мере роста циклов до тысяч повторений это становится сложнее. Исследовательские стратегии по-прежнему пишут вручную и фиксируют заранее, поэтому они не учатся на накопленном опыте, а разработчики снова платят за направления, которые уже провалились.
Плохая организация поиска расходует вычислительные ресурсы и время, ограничивая эффективность и масштабируемость RSI. Исследователи называют узким местом обратную связь на уровне стратегии: она приходит с задержкой, дорого обходится и во многих случаях не нужна, потому что разработчики фактически заново получают сведения, за которые уже заплатили.
Команда из 17 исследователей Google, Google DeepMind, Университета Мэриленда и Университета Виргинии предлагает представлять поиск как структурированное «историческое дерево». В нём сохраняются каждое решение агента и каждый полученный результат. Благодаря этому модель может выбрать следующее направление, не выполняя уже пройденные шаги заново.
Система проходит по тому же записанному дереву в другом порядке, а каждый запрошенный результат уже хранится на диске. Она может просматривать тысячи прошлых находок без дополнительных запусков, выбрать лучший вариант для развёртывания и тем самым превратить накопленную историю поиска в «симулятор воспроизведения».
При этом заданная человеком стратегия исследования по-прежнему определяет:
Dream-RSI работает в три этапа:
Агент исследует пространство, при необходимости дополняет дерево поиска, переписывает стратегию и оценивает каждую её версию. После этого лучшая версия разворачивается заново. Каждый такой цикл добавляет новый «мир»: выбранная стратегия возвращается в онлайн-режим и создаёт новое дерево поиска.
Исследователи отмечают, что накопленная история всегда была доступна, но раньше её использовали иначе — как статический текстовый контекст для промта или как обучающие данные для настройки весов. В Dream-RSI история становится средой для «сновидений»: уже построенное агентом дерево точно описывает достигнутое пространство поиска.
Модель улучшает стратегию во время такого моделирования и проверяет новый вариант, «представляя», что произошло бы при его использовании, вместо того чтобы снова проходить весь цикл в реальности. Симулятором исследователи называют любую систему, способную ответить на вопрос «что произошло бы, если…» без запуска самой среды.
Результаты на ключевых бенчмарках
Исследователи проверили Dream-RSI на алгоритмических задачах, задачах разработки ядер для GPU и математической оптимизации. В последовательных раундах поиска обученная стратегия распределяла вычислительные ресурсы так, чтобы получать более сильные результаты с меньшим числом вызовов агента, чем существующие подходы.
В тестах Lasso агенту дают задачу, объединяющую программирование и оптимизацию. Dream-RSI обеспечила более выгодное соотношение качества результата и вычислительных затрат, чем Recursive Fixed Exploration — подход, при котором агент исследует пространство с помощью фиксированного оркестратора, не адаптирующегося со временем.
С Gemini-3.1-Pro среднее время выполнения на шести наборах данных сократилось с 3 587,1 до 2 931,0 миллисекунды, а число вызовов агента поиска — с 550 до 317.
С Gemini-3.7-Flash среднее время уменьшилось с 2 516,7 до 2 350,6 миллисекунды, а число вызовов — с 3 200 до 1 879.
SimpleTES, на результатах которого основана цифра в 162 раза, использовал другую модель — gpt-oss-120b — и выполнил 51 200 генераций.
Затем Dream-RSI проверили на разработке ядер для GPU. В этих задачах агент должен находить высокопроизводительные реализации ядер, сохраняя численную корректность. Ему приходится одновременно рассуждать о доступе к памяти, параллелизации, алгоритмах и оптимизации под конкретное оборудование. Поэтому такой бенчмарк позволяет проверить, выходит ли Dream-RSI за пределы чисто математического поиска.
В задаче ConvDiv оценивается, насколько эффективно задачи машинного обучения на уровне оборудования выполняются на видеокарте. Dream-RSI постепенно улучшала результат: сначала число проверенных попыток сократилось со 110 до 50, после чего система снова увеличила расходы примерно до 90 попыток, когда прогресс остановился.
На задачах программирования GPU VGG16 и LayerNorm Dream-RSI достигла сопоставимого результата, использовав соответственно в 2,43 и 1,79 раза меньше генераций.
На ConvDiv и ConvMax система получила соответственно в 2,09 и 1,44 раза более высокую производительность при сопоставимых вычислительных бюджетах.
Исследователи считают, что «сновидения» внутри симулятора воспроизведения, собранного из исторических деревьев поиска, дают дешёвую обратную связь вне исходной стратегии для оценки и улучшения новых стратегий. Для команд, которые расходуют большое количество вызовов агентов, экономия достигается за счёт записей, однажды созданных и уже оплаченных. Исходный код системы опубликован.
Читайте также
Ответы на ваши вопросы об ИИ-апокалипсисе: «Могут ли такие люди, как я, хоть что-то сделать?»
ИИ сокращает цикл разработки чипов до нескольких недель
OpenAI против Anthropic: разрыв между платформами ИИ-агентов
ИИ: максимизация или оптимизация человеческой когнитивной осознанности
Почему инженеры внедрения вдруг оказались так востребованы
ИИ может сократить ваши затраты — и всё равно оставить вас позади
Google теперь просит пользователей записывать видео-селфи для подтверждения личности
Новая ИИ-кормушка Petlibro меняет правила игры в домах с несколькими кошками
Unity выпустила плагины для Claude Code и OpenAI Codex, чтобы ИИ-агенты не брали устаревшие уроки
Директор Microsoft признал: ИИ крадёт контент СМИ, создавая «петлю гибели» и делая себя бесполезным
Разговоры о безопасности ИИ становятся всё более неправдоподобными
Qwen3.8-Omni-Flash дешевле Google Gemini Flash, но не уступает в мультимодальных тестах
Политики обеих партий боятся выступить против ИИ, хотя подавляющее большинство их электората этого хочет
GPT-6 Astra и Claude Fable превращают роборуки в комичных роботов-убийц на новом тесте безопасности
FAA с понедельника потратит почти $1 млрд, чтобы сделать ИИ «мозгом» диспетчерских вышек
Vals при поддержке Andreessen Horowitz метит в золотой стандарт тестирования ИИ моделей
Отчёт MIT: ИИ ведёт студентов к «когнитивной капитуляции»
Dream-RSI от Google DeepMind помогает ИИ-агентам совершенствоваться во сне о прошлых попытках
ИИ-«актриса» Тилли Норвуд сбилась на интервью и начала бессвязно говорить по-китайски
Домашние дата-центры: как вычислительная мощность может обогреть ваш дом
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram