Двунаправленная память
как основа эволюции агентов, которые помнят прошлые шаги
Сегодняшние «глубокие» AI-агенты умеют не только продолжать текст, но и ходить в поиск, вызывать инструменты, собирать факты из разных источников и шаг за шагом решать сложные вопросы.
Когда памяти мало, даже умные агенты тупят
Сегодняшние «глубокие» ИИ-агенты умеют использовать поиск, вызывать инструменты, собирать факты из разных источников и шаг за шагом решать сложные вопросы. Но на практике такой агент работает, как очень умный стажёр, который каждый раз забывает, что делал вчера.
Именно про это статья MIA — Memory Intelligence Agent. Авторы предлагают не просто «прикрутить память» к LLM-агенту, а перестроить саму логику того, как агент учится на опыте и меняет своё поведение во время работы. И, судя по результатам, идея работает: модель не только улучшает флагманские закрытые LLM, но и позволяет относительно малой 7B-модели обгонять более крупные.
Это важно не только для исследовательских бенчмарков. Если мы правда хотим агентов, которые могут неделями работать над задачами, искать информацию, не повторять одни и те же ошибки и адаптироваться на лету, без внятной памяти это просто не взлетит.
В чём проблема обычной «памяти» для агентов
В агентных системах память часто сводится к простому алегоритму: сохранить старые траектории — запросы, промежуточные шаги, найденные документы, ответы — и потом по похожести подтягивать их в контекст новой задачи. Звучит разумно. Но у такого подхода быстро начинаются побочные эффекты.
Во-первых, длинный контекст — не равно умная память. Чем больше старых следов мы скармливаем модели, тем выше шанс, что полезные сигналы утонут в шуме. Во-вторых, по мере роста архива дорожают хранение и поиск. В-третьих, агенту часто нужен не просто факт из прошлого, а процедурная память: что сработало, что не сработало, какой маршрут поиска оказался полезным, где он зашёл в тупик.
Авторы формулируют это довольно жёстко: многие существующие системы — это слабый планировщик, который достаёт не лучшую память из раздутого архива и с её помощью пытается направить не слишком подготовленного исполнителя. В результате память вроде есть, а серьёзного прироста нет.
Что такое MIA: память как отдельная когнитивная система
Вместо одной модели с большим контекстом MIA разделяет обязанности между тремя компонентами: Менеджер, Планировщик и Исполнитель.
Идея такая:
Менеджер памяти — это непараметрическая память. Он хранит не сырые длинные логи, а сжатые структурированные «рабочие процессы» из прошлых попыток. Если задача мультимодальная, изображения сначала переводятся в текстовые описания, чтобы всё легло в единый формат хранения.
Планировщик — параметрическая память. Это отдельный агент, который на основе текущего вопроса и извлечённого опыта строит план поиска и рассуждения: куда идти, какие подзадачи решать, в каком порядке.
Исполнитель — он уже по плану вызывает инструменты, делает поисковые шаги, читает результаты и формирует ответ.
В MIA память не идет напрямую в голову исполнителю. Она сначала влияет на стратегию, а уже стратегия управляет действий. Для сложных многошаговых задач это куда ближе к тому, как работает человеческое решение проблем: сначала прикинуть маршрут, потом действовать.
Как MIA ищет и запоминает опыт
Ключевая идея MIA — она хранит не только «хорошие» примеры, но и отрицательный опыт. То есть система может достать не только удачную траекторию, но и неудачную — как предупреждение, чего лучше не делать.
У каждого воспоминания есть три сигнала:
Дальше планировщик получает этот набор и генерирует пошаговый план. Исполнитель пытается его выполнить в ReAct-режиме: подумал, вызвал инструмент, посмотрел результат, пошёл дальше. Если упёрся в стену, Планировщик может один раз включить механизм Reflect-Replan — переосмыслить ситуацию и выдать новый маршрут.
После завершения траектория снова отправляется в Менеджера, где длинный лог сжимается в компактный воркфлоу Так получается двусторонняя связь: память помогает строить план, а новые планы и траектории обновляют память.
Почему здесь вообще понадобилось обучение с подкреплением
Одна из сильных сторон статьи — авторы не ограничились архитектурой, а отдельно обучили её части кооперироваться. Для этого используется двухэтапное попеременное RL-обучение на базе GRPO.
Сначала тренируют исполнителя. Задача — научить его действительно следовать плану, корректно использовать инструменты и понимать, когда нужен пересмотр стратегии. То есть исполнитель не должен быть просто «LLM с поиском», он должен стать агентом, который умеет работать по указаниям.
Затем исполнитель замораживают и обучают планировщика Теперь уже планировщик учится строить более качественные планы с опорой на память и лучше решать, когда нужна рефлексия и перепланирование.
Вместо надежды, что две модели «как-нибудь договорятся», авторы обучают их синхронно, но по очереди. Один учится быть хорошим руками, второй — хорошей головой.
Самая амбициозная часть: обучение во время тестирования
Самая интересная часть работы — test-time learning. Во многих системах инференс и обучение жёстко разделены: сначала натренировали, потом используем. MIA предлагает более живую схему: во время решения новых задач планировщик продолжает обновляться на основе свежего опыта.
Важно, что обновляется только планировщик, а исполнитель остаётся замороженным. Это снижает риск «разболтать» всю систему и сохраняет стабильность исполнения. Одновременно происходят два процесса:
То есть агент не просто складывает опыт на полку, а внутренне переваривает его. Это и есть та самая эволюция, которой часто не хватает memory-системам: память перестаёт быть архивом и становится механизмом развития.
Результаты: память, которая действительно помогает
На мультимодальных бенчмарках MIA показывает лучший средний результат среди open-source систем. Особенно показательно, что многие стандартные memory-подходы вроде RAG, Mem0 и A-Mem часто оказываются хуже, чем вариант вообще без памяти. Это сильный и неприятный для индустрии вывод: плохая память может быть вреднее отсутствия памяти.
MIA на этом фоне выделяется именно тем, что память работает через планирование, а не как бесконтрольная свалка контекста. На семи мультимодальных датасетах система стабильно обходит предыдущие memory-бейзлайны. На текстовых задачах картина та же: заметный отрыв на HotpotQA, 2Wiki и особенно GAIA.
Ещё один эффект, который выглядит почти провокационно: Qwen2.5-VL-7B в составе MIA обгоняет Qwen2.5-VL-32B без такой memory-архитектуры. Это важный сигнал для рынка. Часто мы пытаемся купить качество простым увеличением модели. Эта работа показывает, что грамотная организация памяти и планирования иногда даёт больше, чем дополнительные миллиарды параметров.
MIA улучшает даже закрытые топ-модели
Авторы отдельно проверили, переносится ли подход на сильные закрытые модели — GPT-5.4, Gemini-3-Flash и Claude Sonnet 4.6. Ответ: да.
Это, пожалуй, один из самых практически значимых результатов статьи. Даже очень сильной модели полезно иметь отдельный слой памяти, планирования и переосмысления действий.
Особенно интересно, что прирост у более сильных моделей обычно меньше, чем у слабых, но он остаётся стабильным. Это логично: чем лучше базовый исполнитель, тем меньше у него запас простых улучшений. Но сама устойчивость эффекта говорит о том, что архитектура действительно закрывает системную проблему.
Что показывает анализ обучения и инструментов
Авторы не ограничились финальными метриками и посмотрели на динамику обучения. RL постепенно поднимает вознаграждение и меняет стиль поведения планировщика и исполнителя. Причём длина ответов тоже адаптируется под датасет: где-то планировщик начинает отвечать короче, где-то длиннее. Это косвенно показывает, что модель не просто запоминает шаблоны, а настраивает стратегию под тип задач.
Полезен и анализ вызова инструментов. Он показывает, что системы без памяти и с бедным использованием инструментов имеют худшую точность. Но ещё важнее другое: длинноконтекстная память плохо сочетается с многоходовым использованием инструментов. Когда агенту нужно не один раз что-то найти, а вести целую цепочку поисков и проверок, простое запихивание истории в контекст быстро ломается.
MIA здесь выигрывает потому, что разделяет роли: память подсказывает стратегию, а не забивает эфир исполнителю.
А если нет правильных ответов? Неожиданно сильная часть статьи
Ещё одна сильная идея — unsupervised self-evolution. В реальном мире у агента часто нет лучших ответов, чтобы понять, справился он или нет. Авторы предлагают для этого многоагентный «peer review»: несколько специализированных LLM-ревьюеров оценивают логичность, достоверность источников и полноту результата, а отдельный агент выносит итоговое решение.
Это умный ход. Вместо одного LLM-as-a-judge, который легко спутает красивый текст с правильным ответом, авторы раскладывают оценку по независимым измерениям. В результате unsupervised-версия MIA оказывается не просто жизнеспособной, а местами почти догоняет supervised-вариант и превосходит многие fully supervised бейзлайны. Более того, при повторных проходах по данным она постепенно улучшается.
Если этот результат воспроизводим широко, то перед нами очень важный шаг к агентам, которые умеют становиться лучше без ручной разметки после каждого эпизода.
Что в этой работе особенно важно
Главная ценность статьи не в том, что авторы придумали ещё один memory-блок. Таких работ сейчас много. Ценность в другом: они довольно чётко показывают, какой именно должна быть память для deep research agents.
Не архив фактов. Не просто retrieval по похожести.
А система, которая:
Это уже похоже не на «LLM с модулем памяти», а на зачаток более автономной когнитивной архитектуры.
Выводы
MIA — одна из тех работ, где за громким названием стоит вполне содержательная инженерная идея. Авторы берут наболевшую проблему агентной памяти и показывают, что её нельзя решать одним лишь увеличением контекста. Нужны разделение ролей, сжатие опыта, обучаемое планирование и способность к самообновлению.
Результаты выглядят убедительно: система улучшает и open-source, и закрытые модели, особенно хорошо работает на сложных многошаговых задачах и не разваливается в unsupervised-режиме. При этом главный вывод, пожалуй, ещё шире самой статьи: в эпоху агентных систем следующая гонка может идти не только за размер модели, но и за то, как именно модель помнит, планирует и учится на собственном опыте.
И если это так, то MIA — не просто удачный фреймворк, а хороший намёк на то, куда будет двигаться весь класс deep research agents дальше.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram