Когда дело не в модели, а в «обвязке»
В разговорах про ИИ-агентов почти всё внимание обычно уходит в модели. Какая LLM сильнее, у кого лучше код, кто выше в таблице. Но на практике часто решает не только сама модель, а то, как именно она упакована в агента: какой у неё контекст, какие инструменты доступны, как устроены шаги работы, что хранится в памяти, как проверяется ответ.
Авторы статьи MemoHarness: Agent Harnesses That Learn from Experience как раз бьют в эту точку. Они предлагают не просто подправлять промпт или менять конвейер, а учить саму «обвязку» агента на опыте прошлых запусков. И не в среднем по больнице, а с адаптацией под конкретную задачу в момент запуска.
Это важный сдвиг. Потому что сегодня многие ИИ-агенты живут с одной глобальной настройкой на все случаи жизни. Один шаблон. Один способ вызывать инструменты. Одна схема шагов. А задачи-то разные: где-то нужен короткий точный ответ, где-то — длинная работа в терминале, где-то — осторожная работа с форматом, где-то — поиск и проверка. Одна и та же конфигурация неизбежно кому-то подходит, а кому-то мешает.
MemoHarness пытается решить именно эту проблему.
Что такое «обвязка» агента и почему это вообще важно
Если говорить совсем просто, обвязка агента — это внешний слой управления вокруг LLM. Он решает:
Это звучит как технические детали, но именно такие детали часто меняют итоговый успех на десятки процентных пунктов. Та же модель может работать заметно лучше или хуже просто из-за того, как ей собрали вход, когда дали доступ к поиску, как ограничили длину ответа или как проверили финальный вывод.
Авторы справедливо замечают: в индустрии уже есть куча методов, которые автоматически улучшают промпты, инструкции или рабочие цепочки. Но почти никто не оптимизирует всю систему управления агентом целиком. Ещё реже кто-то делает так, чтобы эта система менялась под конкретный тестовый пример без новой разметки и без отдельного поиска на лету.
Именно это MemoHarness и пытается делать.
Как устроен MemoHarness
Сердце работы — идея, что обвязку не надо считать одним монолитным объектом. Её можно разложить на шесть управляемых измерений.
Схема MemoHarness: поиск хорошей глобальной обвязки на обучении и её адаптация под конкретный тестовый случай.
Вот эти шесть частей:
Это хороший инженерный ход. Вместо того чтобы «магически улучшать агента», система может точечно понимать, где именно был сбой. Не хватило контекста? Неправильно использовался инструмент? Был нужен многошаговый сценарий, а не один вызов? Ответ сломался на финальном форматировании?
Дальше появляется второй важный элемент: банк опыта. Он двухслойный.
Это уже похоже не просто на журнал запусков, а на память системы о собственных удачах и провалах.
Как идёт обучение: не градиенты, а управляемый поиск
MemoHarness не дообучает модель в привычном смысле. Он запускает поиск по пространству вариантов обвязки.
Сначала берётся очень простая базовая конфигурация: без демонстраций, без памяти, без инструментов, без сложной оркестровки. Потом система шаг за шагом предлагает новые варианты. Каждый вариант прогоняют по размеченным задачам, оценивают по качеству и сохраняют следы выполнения в банк опыта.
Тут есть важная деталь: отбор идёт по принципу «сначала правильность, потом цена». То есть главный критерий — решить задачу верно. Токены и стоимость используются только как дополнительный критерий, если по качеству варианты одинаковы.
Это звучит почти очевидно, но на фоне моды на «дёшево и быстро» акцент полезный. Авторы явно не хотят, чтобы система уходила в дешёвые, но неправильные конфигурации.
После нескольких раундов выбирается не лучший случайный пик на тесте, а финальная глобальная обвязка, отобранная по валидации. Это тоже здоровый ход: меньше риска подогнаться под конкретный маленький набор задач.
Что происходит в момент запуска на новой задаче
Самое интересное начинается на тесте. MemoHarness не использует одну и ту же финальную обвязку для всех задач подряд. Вместо этого он берёт глобально найденный вариант и слегка подстраивает его под конкретный вход.
Как именно:
Важно, что это делается без обратной связи на тесте. Система не знает правильный ответ, не получает награду и не запускает новый цикл поиска. Она просто использует уже накопленный опыт. Это делает подход реалистичнее для боевого применения.
По сути, статья предлагает смотреть на агента не как на фиксированный продукт, а как на систему, которая умеет вспоминать: «На похожих задачах у меня обычно ломалась память» или «В таких случаях лучше включать многошаговую схему и строже проверять формат ответа».
Что показали эксперименты
Авторы проверяли MemoHarness на трёх очень разных типах задач:
Главный результат: на Terminal-Bench система показала 0,806 среднего успеха против 0,722 у сильнейшего базового варианта. Для такого сценария это заметный прирост.
Сравнение с базовыми системами на Terminal-Bench: MemoHarness показывает лучший средний результат.
Особенно важно, что сравнение здесь не с заведомо слабым соперником. Лучший базовый вариант — уже специализированная система для работы в терминале. То есть прирост не взят на «соломе», а получен в достаточно жёсткой постановке.
Ещё интереснее динамика по ходу поиска. На всех трёх бенчмарках финальная версия оказалась лучше стартовой, но характер улучшений был разный.
Качество обвязки на разных этапах поиска: итог лучше базы на всех трёх бенчмарках.
На FinanceAgent рост был самым большим: примерно с 0,600 до 0,767. На LiveCodeBench улучшение тоже есть, но меньше — потому что базовая модель там и так была близка к потолку. Это очень показательная деталь. MemoHarness сильнее помогает там, где задача длиннее, сложнее и требует больше управления процессом. Там, где модель и так хорошо решает задачу «в один выстрел», запас меньше.
Это подтверждает и график по итерациям.
На FinanceAgent дополнительные итерации поиска продолжают помогать, а на LiveCodeBench прирост быстро насыщается.
На FinanceAgent дополнительные раунды поиска продолжали приносить пользу почти до конца. На LiveCodeBench всё быстро вышло на плато. Вывод простой: чем больше в задаче многошаговости, инструментов и риска сбиться по пути, тем важнее хорошая обвязка.
Переносится ли это на другие наборы задач и модели
Один из самых полезных вопросов: не выучила ли система локальные трюки под один набор задач?
Авторы проверили это в двух режимах.
Во-первых, перенос на другие наборы задач. Тут картина не «магическая», а нормальная и правдоподобная: перенос есть, но избирательный. Обвязка, найденная на Terminal-Bench, дала прирост на нескольких внешних наборах, включая задачи на понимание, отказ от опасных запросов и программную инженерию. Но не везде. На насыщенных наборах, где базовый уровень уже почти максимален, движения почти не было.
Это хороший знак. Универсального заклинания статья не обещает. Зато показывает, что часть найденных решений действительно живёт дольше одного конкретного бенчмарка.
Во-вторых, перенос на другие модели. И это, пожалуй, один из самых интересных результатов. Обвязку искали на GPT-5.3-Codex, а потом без нового поиска запускали на шести других моделях. Все они получили улучшение. Средний прирост — около +0,098.
Особенно заметен скачок у GLM-5: с 0,500 до 0,733. У GPT-4.1 прирост был скромнее, но тоже положительный. Это намекает, что MemoHarness учит не только «фокусы под одну модель», а более переносимые правила организации работы агента.
Конечно, это ещё не окончательное доказательство универсальности. Но как практический сигнал — очень сильный.
А что по цене
У такой схемы есть очевидный риск: если постоянно тянуть в контекст прошлый опыт, всё может стать дорогим.
Авторы это проверили на Terminal-Bench. MemoHarness действительно использует больше входных токенов. Но большая часть этого контекста кэшируется, поэтому итоговая денежная стоимость остаётся конкурентной. В их расчёте система оказалась дешевле некоторых сильных коммерческих базовых вариантов при более высоком качестве.
Здесь есть оговорка: всё сильно зависит от того, насколько хорошо кэшируется извлечённый опыт. Если в реальной эксплуатации кэш использовать хуже, экономика может измениться. Авторы это честно признают.
И это вообще одна из сильных черт работы: в ней нет попытки продать результат как абсолютную истину. Есть ясная инженерная идея, заметный прирост и аккуратные ограничения.
Что в этой работе по-настоящему важно
Главная ценность статьи не только в конкретных цифрах. Она в том, что MemoHarness предлагает другой взгляд на развитие ИИ-агентов.
Сегодня прогресс часто сводят к трём рычагам:
Здесь появляется четвёртый рычаг: накапливать опыт исполнения и превращать его в адаптивную систему управления агентом.
Это похоже на взросление всей области. Вместо вопроса «какой у нас лучший промпт?» появляется вопрос «как агент учится работать лучше на основе своих прошлых действий?». И это уже ближе к настоящей инженерии сложных систем, чем к подбору удачной магической фразы.
Выводы
У ИИ-агента можно улучшать не только модель и не только промпт, а весь внешний слой управления.
Подход особенно полезен для сложных задач, где нужно много шагов, инструменты, память и контроль формата. Именно там адаптивная обвязка даёт наибольший выигрыш. На простых задачах с близким к потолку качеством эффект меньше — и это тоже ожидаемо.
Важно и то, что система учится не вслепую. Она хранит опыт успешных и неуспешных запусков, выделяет повторяющиеся закономерности и использует их для подстройки под новый случай без обратной связи на тесте.
Из этого следует довольно практичный вывод: следующий заметный скачок в ИИ-агентах может прийти не только от более крупных моделей, но и от систем, которые лучше помнят, диагностируют и меняют собственную обвязку. Не одна настройка на все случаи, а живая конфигурация, которая умеет подстраиваться под задачу. Для агентных систем это, похоже, один из самых перспективных путей на ближайшее время.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram