i
Исследования
Обзор · 2026-09-26

Как ИИ-агент подбирает прошлый опыт под новую задачу

Обложка: Как ИИ-агент подбирает прошлый опыт под новую задачу

Память, которая ждёт вопроса

Представьте, что ИИ-агент однажды научился находить нужный предмет в доме. Позже ему поручают разогреть еду. В прошлой истории могли пригодиться и маршрут до предмета, и последовательность действий, и способ изменить его состояние. Но если агент заранее сжал опыт в одну короткую заметку, часть деталей уже потеряна. А какую именно стоило оставить, стало понятно лишь после появления новой задачи.

Авторы предлагают изменить порядок: сохранять подробный опыт, а превращать его в краткую инструкцию только тогда, когда известна текущая задача. Так устроена система JitMem. Она ищет подходящие прошлые попытки и поручает отдельной модели-куратору выбрать из них то, что поможет именно сейчас.

Авторы проверили подход на задачах в виртуальном доме, интернет-магазине и службе поддержки. Во всех трёх случаях система превзошла методы, которые заранее превращают опыт в готовые заметки и навыки.

Почему важно, когда обрабатывается память

Большинство систем памяти для ИИ-агентов решают, что сохранить, сразу после выполнения задачи. Агент может записать рассуждение о неудаче, полезное правило или готовую последовательность действий. Позже подходящую заметку находят поиском по сходству с новой задачей.

У такого подхода есть ограничение: заметка создаётся до того, как известно, для чего она понадобится. Одна и та же история может подсказать разные вещи. В одном случае важен порядок действий, в другом — способ переместить предмет или изменить его состояние. Универсальная заметка рискует оказаться слишком общей, а подробная — перегруженной.

JitMem откладывает выбор до момента, когда появляется новая задача. Система хранит полные записи прошлых попыток: описание задачи, наблюдения агента и его действия. Затем находит несколько похожих записей, а куратор составляет из них короткую инструкцию с учётом текущего запроса.

JitMem сначала находит прошлые попытки, затем составляет инструкцию под текущую задачу и передаёт её агенту.

Например, одну и ту же историю о работе с предметами в доме можно использовать по-разному. Для задачи «положить горячую картофелину в холодильник» куратор выделит действия, связанные с нагревом и охлаждением. Для задачи «положить газету на диван» — способ найти нужное место и проверить результат. Сам опыт тот же, но инструкция меняется.

Это решает и другую проблему — обучение самой системы памяти. Если заметка создаётся заранее, становится ясно, насколько она полезна, только когда спустя время появляется подходящая задача. Награда запаздывает, а связь между решением сохранить конкретную деталь и будущим успехом трудно установить.

В JitMem куратор готовит инструкцию для текущей задачи, и агент сразу пробует её использовать. Если задача решена, это и есть сигнал для обучения. Авторы применяют обучение с подкреплением и обновляют куратора по результату попытки. Так системе не нужно угадывать, какие задачи следует объединить в группу, чтобы позже оценить качество сохранённой заметки.

Что такое JitMem

В системе четыре части: хранилище прошлых попыток, поиск, куратор памяти и исполнитель — замороженная языковая модель, которая решает задачи. Обучают только куратора. Поиск устроен просто: он сопоставляет описание текущей задачи с описаниями прошлых задач и возвращает три наиболее похожих случая.

Куратор читает текущий запрос и найденные записи, затем пишет короткую инструкцию. Исполнитель получает её вместе с задачей и действует в среде. После выполнения система оценивает результат. В хранилище добавляют только успешные попытки, а составленная для текущей задачи инструкция туда не попадает: сохраняется исходная история действий.

Обучение куратора устроено так: для одной задачи он создаёт несколько вариантов инструкции. Замороженный исполнитель пробует решить задачу с каждым вариантом. Удачные варианты получают более высокую оценку, и куратор учится составлять похожие инструкции. Исполнитель при этом не меняется.

Такое разделение даёт практическое преимущество: обученного куратора можно подключать к другим исполнительным моделям без повторного обучения. В испытаниях куратор, обученный вместе с Qwen3-8B, почти сравнялся с вариантом, обученным с GPT-5.4: разница на одном из тестов составила 1,4 процентного пункта.

Что показали испытания

Авторы проверили JitMem на трёх бенчмарках. В ALFWorld агент выполняет бытовые задачи в текстовой среде. В WebShop выбирает товары в интернет-магазине. В τ²-bench ведёт разговоры с клиентами и пользуется инструментами для решения запросов в авиакомпаниях, розничной торговле и связи.

В основной серии испытаний обученная JitMem с исполнителем Qwen3-8B достигла доли успешных задач 77,4% в ALFWorld и 32,8% в WebShop. Лучший метод, который сохраняет готовые навыки при выполнении прошлых задач, показал 61,2% и 16,5% соответственно. Разница составила 16,2 и 16,3 процентного пункта. На τ²-bench система улучшила результат лучшего сравниваемого метода на 3,9 пункта.

Без важных частей JitMem работает хуже: куратору нужны текущая задача, полные записи прошлых попыток и отбор успешных случаев.

Интересно, что выигрыш появляется ещё до обучения с подкреплением. Необученная JitMem в ряде сравнений обходит методы с заранее подготовленными заметками. Например, в WebShop с исполнителем Gemini-2.5-Pro доля успеха составила 61% против 41% у SkillOS, когда для обоих вариантов куратором и исполнителем служила одна и та же модель Gemini. Значит, часть улучшения связана с самим принципом: подбирать содержание памяти под задачу, а не только с более сильной моделью.

Обучение добавляет ещё один выигрыш. Когда куратор перестаёт видеть текущую задачу, качество заметно падает. На WebShop падение достигает 10,4 процентного пункта. Если же убрать из памяти прошлые записи и оставить только знания самой модели, результат обученной системы также снижается. Это показывает, что куратор учится извлекать пользу именно из опыта, а не просто выдаёт общие советы из своих прежних знаний.

Во время обучения доля успешных задач растёт, а число ходов исполнителя постепенно снижается.

Проверка компонентов объясняет, откуда берётся улучшение. Если записывать не только успешные попытки, но и неудачные, качество снижается. Если вместо полных историй хранить готовые краткие заметки, результаты тоже ухудшаются — особенно в WebShop, где падение достигает 8,2 пункта. При подготовке краткой заметки заранее некоторые детали оказываются потеряны навсегда.

JitMem также помогает сократить объём контекста и число действий. В отдельном тесте с GPT-5.4 система тратила на 50–56% меньше входных токенов, чем методы с заметками и навыками, и требовала на 28–31% меньше шагов исполнителя. Более короткая инструкция здесь не означает меньше пользы: куратор оставляет детали, связанные с текущей задачей.

Где подход пока ограничен

Система добавляет отдельный вызов языковой модели для подготовки инструкции. Это увеличивает расходы и время ответа. Кроме того, поиск основан на сопоставлении слов в описаниях задач. Такой метод прост, но может хуже работать, когда память разрастается и задачи становятся разнообразнее.

Есть и вопросы к переносу результатов в реальные условия. Испытания проводились в трёх заданных средах, а не на широком потоке повседневных задач. В τ²-bench авторы проверили необученную версию: для обучения не было готового стандартного набора задач. Поэтому пока неясно, насколько уверенно обученный куратор перенесёт подход на более открытые и меняющиеся сценарии.

Наконец, формат инструкции задаётся отдельно для каждой среды. Для бытовых задач, покупок и поддержки клиентов куратор получает разные системные промты. Авторы также отмечают, что улучшение поиска и выбор формата инструкции остаются открытыми направлениями.

Вывод

Память ИИ-агента можно хранить подробно, а нужную часть опыта выбирать уже после того, как стала известна новая задача. В этом состоит основной подход JitMem. Он сокращает потери при сохранении опыта и позволяет обучать куратора на немедленном результате, а не ждать, пока через много задач выяснится, была ли полезна старая заметка.

Пока результаты относятся к конкретным бенчмаркам и требуют дополнительной проверки на новых задачах. Но принцип применим шире: одну прошлую попытку можно использовать по-разному — в зависимости от того, что агенту нужно сделать сейчас.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram