Когда проблема не в «мозгах», а в памяти
У ИИ-агентов есть старая и очень земная проблема: они быстро забывают. Не в смысле «контекстное окно закончилось» — это и так все знают. Хуже другое: даже если дать модели внешнюю память, она часто пользуется ей как плохим студенческим конспектом. Записывает лишнее. Ищет не там. Дублирует очевидное. А потом блуждает по карте, повторяет бесполезные действия и умирает в первой же сложной игре.
Статья Stanford под названием AutoMem предлагает посмотреть на это иначе. Авторы говорят: память для LLM — это не просто модуль или хранилище. Это отдельный навык, который можно целенаправленно улучшать. То есть модель можно учить не только действовать, но и правильно помнить: что записывать, когда искать, как организовывать заметки и как не засорять себе же голову.
И это не философия ради философии. В экспериментах один только апгрейд памяти дал прирост примерно в 2–4 раза на длинных игровых задачах. Причем без изменения основной модели, которая принимает игровые действия. Звучит почти как чит-код: не растим модель, не добавляем магию в архитектуру, а просто учим ее лучше вести свои записи.
Что именно сделали
Главная идея AutoMem очень проста и поэтому сильна. Авторы превращают операции с файлами в полноценные действия агента. Не вспомогательную механику где-то «под капотом», а часть поведения наравне с движением, атакой или крафтом.
Агент может:
Иными словами, память здесь — это обычная файловая система. У агента есть папка с файлами, и он сам решает, как с ней работать. Например, вести карту, записывать инвентарь, хранить цели, заметки о стратегии и наблюдения о мире.
Звучит почти примитивно. Но в этом и плюс. Файловая память легко наблюдаема: каждое решение модели видно в трассе. Можно буквально посмотреть, где агент записал мусор, где забыл важный факт, а где искал что-то в пустоте.
Схема AutoMem: один контур улучшает структуру памяти, второй — обучает модель лучше этой памятью пользоваться.
Дальше начинается самое интересное. AutoMem улучшает память по двум направлениям.
Первое — структура. То есть как устроена сама память: какие есть файлы, в каком формате хранится карта, какие подсказки получает агент, какие операции ему доступны.
Второе — навык обращения с памятью. То есть насколько хорошо сама модель умеет решать, когда записывать, когда сначала поискать, как не плодить дубликаты и как доставать нужное в нужный момент.
И вот эти два направления авторы автоматизируют двумя внешними циклами.
Два контура улучшения: сначала чинят «полки», потом учат пользоваться библиотекой
Первый контур можно описать так: сильная LLM читает полные журналы эпизода и переписывает устройство памяти агента. Она видит весь путь на тысячи шагов и пытается понять, где проблемы были не в «интеллекте», а в организации памяти.
Это важно, потому что ошибка памяти часто всплывает не сразу. Агент мог на 50-м шаге плохо записать координату, а страдать начнет только на 800-м, когда снова придет в то же место и не поймет, что уже там был. По финальной награде такой сбой не найти. Нужно читать длинную трассу целиком.
Второй контур делает другое: собирает хорошие решения по памяти из множества эпизодов и использует их для файн-тюнинга. Но обучают не всю модель подряд. Авторы выделяют отдельного «специалиста по памяти», который отвечает именно за операции с файлами. А модель, которая делает игровые ходы, остается замороженной.
Это аккуратный инженерный ход. Так можно улучшать память, не рискуя испортить то, что базовая модель уже умеет делать в самой среде.
Где проверяли и почему это хороший тест
Память проверяли не на вопросах-ответах и не на игрушечных задачах, а на трех длинных играх:
Это хороший выбор. Такие среды процедурно генерируются, поэтому модель не может просто опереться на знания из предобучения. Каждый эпизод новый. Нужно реально строить карту, следить за ресурсами, помнить, где уже был, и не терять цель.
Три игровые среды для проверки памяти: от выживания и крафта до крайне длинных и сложных подземелий NetHack.
Именно тут память становится не украшением, а условием выживания. В короткой задаче можно проскочить на импровизации. В NetHack — нет.
Результаты: память оказалась рычагом сильнее, чем размер модели
Самый сильный результат статьи звучит почти провокационно: правильная организация памяти дала больше, чем переход к более крупной модели.
Базой был Qwen2.5-32B-Instruct. Если просто дать ему файловую память в начальном виде, результаты умеренные. Но после автоматической оптимизации структуры памяти качество резко растет:
После дополнительного обучения «специалиста по памяти» стало еще лучше:
Прирост качества по мере улучшения памяти: сначала за счет структуры, затем за счет обучения навыка работы с памятью.
На первый взгляд числа в NetHack выглядят скромно. Но это обманчиво. NetHack — одна из самых тяжелых сред такого типа. Там даже небольшой прирост — это уже заметное изменение поведения. И авторы показывают, что их 32B-модель с хорошей памятью становится сопоставима с заметно более сильными закрытыми системами вроде Claude Opus 4.5 и Gemini 3.1 Pro.
Здесь особенно важен практический вывод: на длинных задачах узкое место часто не в том, насколько модель «умна», а в том, насколько хорошо она умеет хранить и извлекать информацию.
Что именно менялось в памяти
Самая наглядная часть статьи — не просто таблицы, а конкретные примеры того, как менялась память агента.
Например, в NetHack исходный агент вел файл карты как бесконечный журнал: увидел клетку — дописал строку. Потом снова увидел ту же клетку — снова дописал. И так тысячи раз. В итоге полезная информация тонула в дублях.
После оптимизации схема стала другой: каждая координата карты получила свой ключ, и новые наблюдения обновляли запись, а не плодили копии. Плюс появились автоматически синхронизируемые файлы инвентаря и статуса. То есть модели уже не нужно было каждый раз самой разбирать и согласовывать эти данные.
Как изменилась память в NetHack: вместо бесконечного журнала карты — обновляемые записи без дублей, плюс отдельные файлы состояния и инвентаря.
Это кажется мелочью, но эффект огромный. Авторы пишут, что рост памяти на шаг в этом случае упал со 138 символов до 6. То есть примерно на 95%. Меньше мусора в памяти — меньше контекст, меньше пустых чтений, меньше шансов потеряться в собственных заметках.
По всем трем средам после оптимизации:
Это важный момент. Авторы не просто «подняли метрику». Они показали, за счет какого поведения это произошло. Агент стал меньше топтаться на месте, меньше писать мусор и точнее искать нужное.
Чему научился «специалист по памяти»
Когда структура памяти уже стала разумной, авторы дообучили отдельную модель именно на память. И здесь всплыл интересный поведенческий сдвиг.
После обучения агент стал чаще следовать принципу: сначала посмотри, потом записывай.
То есть он реже слепо добавлял новые записи и чаще сначала искал, нет ли этой информации уже в файлах. Это очень человеческий паттерн. Хороший секретарь не переписывает один и тот же факт десять раз, а сначала проверяет архив.
В статье это измеряют через отношение числа записей к числу поисков. После обучения оно заметно падает во всех средах. Значит, модель реально усваивает более дисциплинированный стиль работы с памятью, а не просто подгоняется под метрику.
Почему это важно за пределами игр
Самый ценный вывод статьи — довольно широкий. Память можно рассматривать как отдельную способность ИИ-агента, а не как второстепенный интерфейс.
Это меняет оптику. Обычно, когда агент плохо справляется с длинной задачей, первое желание — взять модель побольше, добавить более сложное планирование, прикрутить еще один поисковый слой или новый инструмент. AutoMem показывает, что иногда полезнее спросить: а умеет ли агент вообще нормально вести свои записи?
Для реальных систем это особенно актуально. Агент для программирования, исследовательский помощник, операционный ИИ-агент, система для робототехники — все они живут в длинных сценариях. Им нужно помнить промежуточные решения, статусы, карты зависимостей, предыдущие попытки, ошибки, ограничения среды. Если память устроена плохо, модель будет не просто «забывать». Она будет сама себе мешать.
Еще один сильный сигнал — это польза автоматического анализа длинных трасс. Людям тяжело вручную читать эпизоды на десятки тысяч шагов. А сильная LLM в роли внешнего ревьюера с этим уже справляется достаточно хорошо, чтобы улучшать систему итеративно. Это очень практичная идея: использовать модель не только как исполнителя, но и как инспектора поведения другого агента.
Что смущает и где границы
У работы есть и ограничения. Во-первых, память здесь эпизодическая: она очищается в начале каждого нового запуска. То есть это еще не долговременная память в полном смысле.
Во-вторых, авторы настраивали отдельные варианты под каждую игровую среду. Пока непонятно, насколько легко один и тот же «специалист по памяти» перенесется между очень разными задачами.
В-третьих, игры — это все же игры. Да, они хороши для теста длинного горизонта, но перенос в реальные рабочие сценарии еще нужно показать.
И все же эти ограничения не обесценивают результат. Скорее наоборот: если даже в такой узкой постановке память дает настолько большой выигрыш, то в прикладных системах эффект может оказаться еще интереснее.
Вывод
AutoMem — это работа не про очередную «магическую архитектуру», а про здравый смысл, доведенный до хорошей инженерии. Авторы берут простую мысль — умение помнить тоже надо учить — и превращают ее в работающую систему.
Главный итог тут такой: на длинных задачах память — это не придаток к модели, а один из главных рычагов качества. Причем рычаг очень выгодный. Иногда дешевле и полезнее научить 32B-модель правильно вести файлы, чем просто брать 72B и надеяться на чудо.
Для индустрии это важный сигнал. Следующий скачок в ИИ-агентах может прийти не только от более мощных моделей, но и от более взрослого обращения с памятью: аккуратного, обучаемого и наблюдаемого. AutoMem убедительно показывает, что это уже не абстрактная идея, а вполне рабочий путь.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram