Как ИИ-агенты учатся помнить через окружающий мир
В AI мы привыкли думать о памяти как о чём-то, что находится внутри агента: в скрытом состоянии RNN, в параметрах сети, в буфере опыта, в KV-cache, наконец. Но что, если часть памяти можно буквально вынести наружу — в саму среду? Не в метафорическом смысле, а вполне формально: так, что агенту действительно нужно меньше внутренней памяти, если мир оставляет полезные следы о прошлом.
Когда память живёт не в модели, а в мире вокруг
Статья Artifacts as Memory Beyond the Agent Boundary как раз про это. Авторы берут старую идею из когнитивистики — что разум опирается не только на мозг, но и на внешние опоры вроде заметок, закладок и следов, — и переводят её в задачу обучения с подкреплением. Получается любопытный тезис: окружение может выполнять функцию памяти, а некоторые наблюдения в среде позволяют агенту “вспоминать” прошлое, не храня его целиком внутри себя.
Это звучит философски, но работа на удивление практическая. В ней есть и формализм, и теорема, и аккуратные эксперименты с Q-learning и DQN. А главное — важный для ML вывод: иногда повышать качество можно не только наращиванием параметров, но и правильной организацией среды, в которой агент учится.
О чём вообще речь: что такое “артефакты” как память
Представьте, что агент идёт по лабиринту и оставляет за собой дорожку — как хлебные крошки. Позже, увидев эту дорожку, он получает информацию о том, где уже был. То есть часть истории взаимодействия теперь закодирована не во внутреннем состоянии агента, а во внешнем мире.
Авторы называют такие наблюдения артефактами. В их формальном определении артефакт — это текущее наблюдение, которое с полной определённостью сообщает о том, что в прошлом происходило другое наблюдение.
Для объяснения они приводят почти бытовой пример с книгой: человек не запоминает номер страницы, а загибает уголок. Загнутый уголок и есть артефакт — физический след в среде, который заменяет внутреннее запоминание.
Ключевая идея статьи в том, что это не просто красивая аналогия. Авторы показывают математически: если в истории есть такие артефакты, то для предсказания будущего может понадобиться меньше информации о прошлом.
Почему это важно для обучения с подкреплением
Во-первых, авторы говорят, что часть сложности задачи можно снять не с агента, а со среды. Если окружение предоставляет полезные следы прошлого, агенту не обязательно держать столько памяти внутри.
Во-вторых, это важно для воплощенного ИИ для роботов. Реальный мир полон внешних опор: метки, карты, следы, состояние объектов, интерфейсы, даже расположение вещей на столе. Если агент умеет использовать такие сигналы как память, это может быть дешевле и надёжнее, чем всегда строить всё, используя внутреннюю память.
В-третьих, работа помогает по-новому смотреть на “память” в обучении с подкреплением. Обычно под ней понимают рекуррентные состояния или просто число параметров. Здесь память трактуется функционально: сколько внутренней ёмкости нужно, чтобы добиться данного уровня поведения. Если при наличии артефактов этот порог снижается, значит часть памяти действительно вынесена во внешний мир.
Главная теоретическая идея
Теоретическое ядро статьи — так называемая Artifact Reduction Theorem. В переводе на человеческий язык она говорит примерно следующее: если в истории взаимодействия есть наблюдение-артефакт, которое уже кодирует информацию о каком-то прошлом событии, то эту часть прошлого можно убрать из представления истории без потери релевантной информации.
Авторы формулируют это через взаимную информацию: существует сокращённая история, в которой на одно наблюдение меньше, но она содержит столько же информации о следующем наблюдении, сколько и полная история. Иначе говоря, артефакт работает как компактная внешняя запись о прошлом.
Дальше авторы вводят определение externalized memory. Агент считается выносящим память в среду, если в мире с артефактами он достигает той же или лучшей производительности при меньшей внутренней ёмкости, чем аналогичный агент в такой же, но “очищенной” от артефактов среде.
Это важный момент: память здесь измеряется не интроспекцией в скрытые состояния, а операционально — через необходимую capacity, то есть число обучаемых параметров.
Как исследователи это проверяли
Экспериментальная часть устроена довольно элегантно. Есть навигационная задача на сетке 13×13: агент должен находить цель, получая награду — +1 при достижении цели и ноль в остальных шагах. Наблюдение — это не координаты, а картинка 24×24, представляющая локальный фрагмент пространства вокруг агента. То есть задача не тривиальная, а частично завязанная на восприятие.
Сравниваются две группы агентов:
Базовый сценарий — No Path, где никаких полезных следов нет. Против него ставят варианты, где в среде видна некая пространственная структура: кратчайший путь до цели, случайный путь, субоптимальный путь, вводящая в заблуждение дорожка или набор геометрических ориентиров.
Важно, что авторы не дают агенту отдельной цели “используй путь как память”. Агент просто учится с подкреплением.
Когда видимый путь заменяет внутреннюю память
Самый сильный результат — эксперимент с кратчайшим путём. Если в среде видна дорожка к цели, агентам нужно меньше внутренней мощности, чтобы научиться хорошей политике.
И для линейного Q-learning, и для DQN наличие видимого пути почти всегда улучшает итоговую награду. Причём в ряде случаев маленький агент с путём оказывается лучше, чем более ёмкий агент без пути. Это и есть доказательства работы внешней памяти: среда компенсирует дефицит внутренних ресурсов.
Ещё интереснее динамика обучения.
Без пути маломощные линейные агенты фактически не справляются: чтобы стабильно достигать цели, им нужна существенно большая ёмкость. С путём — уже нет. У DQN эффект тоже почти везде положительный.
Почему так происходит? Авторы предлагают простое объяснение: если кратчайший путь присутствует в наблюдении, агенту не нужно восстанавливать длинную историю перемещений или строить сложное внутреннее представление пространства. Достаточно научиться реагировать на локальные визуальные признаки пути. Среда сама подсказывает, где агент находится по отношению к цели.
Не только идеальные подсказки: случайные пути и ориентиры тоже работают
Чтобы исключить то, что агент просто идёт по правильному пути, авторы проводят второй набор экспериментов с другими типами артефактов: случайным путём, субоптимальным путём, вводящей в заблуждение дорожкой и набором геометрических ориентиров.
Если бы эффект объяснялся только тем, что агенту нарисовали почти готовое решение, то плохие или нерелевантные траектории не должны были бы особенно помогать. Но они помогают — хотя и не одинаково.
Линейные агенты демонстрируют признаки внешней памяти для всех четырёх типов артефактов. У DQN эффект устойчиво наблюдается для субоптимального пути, случайного пути и ориентиров, но не для вводящей в заблуждение. Это логично: не всякая внешняя структура одинаково полезна. Однако сам факт, что даже метки без явной “поведенческой” подсказки помогают, довольно показателен.
Это означает, что агент, вероятно, использует не только готовую инструкцию типа “иди сюда”, но и любые стабильные элементы среды как опоры для локализации и восстановления контекста. Иными словами, внешняя память может быть не буквальным следом поведения, а просто структурой, которая уменьшает неопределённость о прошлом.
Самый интересный эксперимент: агент оставляет следы сам
Третий эксперимент делает шаг к более реалистичной картине. Здесь путь не нарисован заранее. Он возникает по ходу движения самого агента: посещённые клетки оставляют шумную дорожку, которая потом постепенно исчезает.
Это уже почти стигмергия в миниатюре: агент действует, меняет среду, а затем воспринимает результат собственных прошлых действий как сигнал для будущего поведения.
Исследователи показывают, что даже без специального механизма записи во внешнюю память агент может непреднамеренно её создавать и затем использовать. То есть память возникает не как вручную спроектированный модуль, а как эффект взаимодействия политики и среды.
Выводы
Исследователи не просто говорят, что “среда важна”, а показывают, что среда может функционально играть роль памяти, уменьшая объём внутренней, необходимой агенту для успешного поведения.
Если в окружении есть устойчивые следы прошлого — маршруты, ориентиры, отметки, изменяющиеся объекты, — агент может использовать их как внешнюю память, причём даже без специального механизма записи. Это меняет подход к проектированию интеллектуальных систем. Иногда путь к более умному агенту лежит не через ещё один миллиард параметров, а через среду, которая помогает помнить.
Для обучения с подкреплением это особенно важно. Мы много говорим о масштабировании моделей, но, возможно, недооцениваем масштабирование среды — того, как она структурирует задачу, поддерживает память и подталкивает к эффективному поведению.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram