Когда агенту мало улучшать только себя
С ИИ-агентами есть старая проблема: их часто учат становиться лучше в почти неподвижном мире. Задачи фиксированы. Проверка фиксирована. Соперник, если он вообще есть, тоже фиксирован. В такой схеме агент может расти, но быстро упирается в потолок.
Авторы предлагают смотреть шире: по-настоящему долгий прогресс начинается там, где меняется не один агент, а сразу несколько частей системы. Агент подстраивается под другого агента. Среда подстраивается под агента. А потом, в пределе, начинает меняться даже сам механизм улучшения.
Это и есть коэволюция в агентных системах. Не просто взаимодействие. Не просто мультиагентность. Это ситуация, где несколько частей системы постоянно меняют друг другу условия жизни.
Сегодня все хотят ИИ-агентов, которые улучшаются после запуска: в вебе, в программировании, в робототехнике, в работе с инструментами. Но если вокруг агента ничего не меняется, его самоулучшение быстро становится локальным. Он учится проходить знакомые повороты. А не осваивать новое.
Один агент, который улучшает только себя, быстро упирается в фиксированные ограничения; при коэволюции ограничения тоже начинают меняться.
Что авторы называют коэволюцией
Здесь важна аккуратная граница. Если два агента просто обмениваются сообщениями, это еще не коэволюция. Если агент ходит по среде и получает ответ, этого тоже недостаточно. Коэволюция начинается тогда, когда:
🟠 меняются как минимум две части системы
🟣 эти изменения сохраняются, а не исчезают после одного прогона
🟠 каждая часть создает давление на другую и меняет ее дальнейшее развитие
Это похоже на эволюцию в природе. Хищник становится быстрее — жертва учится лучше убегать. Жертва лучше прячется — хищник учится искать. Если меняется только одна сторона, процесс быстро замедляется.
Авторы раскладывают поле на три уровня. Это главный каркас текста.
Три стадии коэволюции: от адаптации между агентами к адаптации между агентами и средой, а затем к изменению самого механизма эволюции.
Три стадии коэволюции
Первая стадия — агент–агент. Среда еще в целом фиксирована, но сами агенты меняются друг под друга. Это может быть атака и защита, сотрудничество или перестройка ролей в команде.
Вторая стадия — агент–среда. Меняются уже не только агенты, но и задачи, обратная связь, правила мира, инструменты, сценарии. Агент становится лучше — среда поднимает планку или перестраивается так, чтобы открывать новые слабые места.
Третья стадия — мета-коэволюция. Здесь меняется уже механизм изменений. Система начинает пересматривать, что именно улучшать, когда это делать, как это делать и как вообще измерять прогресс.
Это движение от простого к более автономному:
🟠 сначала меняются участники
🟣 потом меняются участники и условия
🟠 потом меняются еще и правила самого улучшения
Многие разговоры о «самоулучшающихся агентах» пока застревают на первой ступени. Агент крутится внутри заранее заданного человеком пайплайна. Следующая граница — дать изменяться не только агенту, но и тому, с чем он сталкивается.
Коэволюция между агентами
Самая понятная часть — соревнование. Это случаи, где один агент атакует, а другой защищается. Классический дальний предок тут — состязательное обучение, где генератор и дискриминатор улучшают друг друга. В новой волне работ это видно в безопасности LLM: один агент ищет обходы защиты, другой учится их отражать.
Такие схемы уже ушли дальше простого «сгенерируй вредный промт». Есть многоходовые игры, где атакующий агент ищет уязвимости в серии шагов. Есть схемы, где защита тренируется не на одном типе атак, а на целой популяции атакующих. Есть даже системы, где к атакующему и защитнику добавляют третьего участника — оценщика.
Здесь идея простая: если соперник умнеет вместе с вами, у вас меньше шансов переобучиться на вчерашние угрозы.
Но коэволюция между агентами — это не только борьба. Есть и сотрудничество. Несколько агентов решают одну задачу и меняются по ходу совместной работы. Один лучше планирует, другой лучше проверяет, третий лучше пишет код, четвертый лучше подводит итог. Если один из них улучшается, остальные тоже вынуждены перестраиваться: по темпу, роли, распределению работы.
Отсюда появляется интересный сдвиг. Исследователи начинают улучшать не только отдельных агентов, но и организацию между ними: кто за что отвечает, как устроена коммуникация, когда надо менять роли, когда дробить команду, когда собирать ее заново.
Коротко по первой стадии:
🟣 соревнование создает давление и поднимает сложность
🟣 сотрудничество помогает на длинных задачах, где одному агенту тесно
🟣 перестройка ролей делает систему гибче, чем фиксированная команда
Коэволюция между агентом и средой
Здесь начинается самое интересное. Авторы показывают: агент может упереться не только в слабого соперника, но и в бедную среду. Если задачи, проверка и пространство действий почти не меняются, прогресс снова тормозит.
Поэтому среду тоже делают адаптивной. Причем среда в тексте понимается широко. Это может быть:
🟠 набор задач
🟠 способ давать обратную связь
🟠 сам мир, в котором агент действует
Среда как генератор задач
Один класс методов не создает новые задачи с нуля, а умно выбирает, что дать агенту дальше. Если агент уже уверенно проходит легкие сценарии, ему чаще показывают то, где он пока ошибается. Это похоже на учебную программу, которая подстраивается под ученика.
Другой класс идет дальше и генерирует новые задачи. Например, агент для работы с инструментами сам проваливает какой-то сценарий, а система превращает этот провал в новый учебный пример. В задачах по программированию и работе с интерфейсом это особенно полезно: не надо вручную собирать весь учебный набор, он частично рождается из реальных ошибок.
В агентных системах главный дефицит часто не модель, а хорошие траектории обучения. Коэволюция с задачами помогает строить такие траектории на лету.
Среда как оценщик
Вторая ветка — меняется сама обратная связь. Не только задача, но и то, как система понимает, что ответ хороший.
В простом варианте есть модель награды, которая учится по предпочтениям: какие траектории лучше, какие хуже. Но если агент меняется, старая модель награды быстро устаревает. Значит, оценщик тоже должен обновляться.
Отсюда работы, где агент и оценщик учатся вместе. Или где система меняет модуль проверки, если старый пропускает ошибки. Для агентов для программирования это особенно наглядно: агент пишет код, тесты ловят ошибки, но потом и сами тесты доучиваются находить более тонкие сбои.
Это разговор о том, меняет ли оценка дальнейшее обучение и не превращается ли в узкое горлышко.
Среда как мир
Третья ветка — меняется сам исполняемый мир. Это может быть игровой уровень, симуляция для робототехники, веб-среда, компьютерный интерфейс или модель мира.
Идея та же: если агент научился жить в текущем мире, нужно сгенерировать такой мир, где старых навыков уже мало. Так развиваются методы, которые строят новые уровни, 3D-сцены, комбинации инструментов, правила взаимодействия или синтетические сайты для веб-агентов.
Отдельно выделяется линия с моделью мира. Вместо дорогих реальных запусков агент учится вместе с моделью среды, которая предсказывает последствия действий. Агент становится лучше — модель мира видит больше данных и тоже становится лучше. Модель мира становится лучше — агент может точнее планировать и пробовать больше вариантов.
Ландшафт работ по коэволюции: больше всего исследований пока сосредоточено на связках «агент–агент» и «агент–среда», а мета-уровень только формируется.
Короткая выжимка по второй стадии:
🟣 задачи перестают быть статичным набором
🟣 обратная связь тоже должна обновляться
🟣 модель мира может стать частью коэволюции, а не просто фоном
Что показывают результаты по всему полю
Это не экспериментальная работа с одной новой моделью. Это обзор, который собирает десятки работ и пытается увидеть общую картину. Здесь важна попытка посмотреть на эффекты коэволюции поперек разных направлений.
Авторы показывают, что в работах первой и второй стадии коэволюция обычно дает прирост по сравнению со статичной второй стороной. Если соперник, оценщик, задачи или среда продолжают меняться, агент чаще улучшается стабильнее. Но есть важная оговорка: рост не бесконечен. На многих траекториях виден выход на плато.
Это подводит к третьей стадии.
Сводные данные из разных работ: коэволюция обычно помогает, но со временем прирост часто замедляется и выходит на плато.
Мета-коэволюция
Если вы хотите бесконечно долго улучшать систему, мало менять агентов и среду. В какой-то момент надо менять и сам способ улучшения.
Авторы предлагают думать о механизме эволюции как о наборе решений:
🟠 что улучшать
🟠 когда запускать улучшение
🟠 как порождать новые варианты
🟠 где это делать — в какой среде и области
🟠 как оценивать результат
Сегодня эти решения в основном зашиты людьми. Мы заранее задаем пайплайн: вот так генерируем задачи, вот так считаем награду, вот так обновляем агента. Мета-коэволюция начинается там, где и этот слой перестает быть фиксированным.
Пока таких работ мало. Авторы честно это признают. Есть предшественники, где система меняет собственные промты, память или схему самоизменения. Но это еще не всегда коэволюция в строгом смысле. Для нее нужен нижний уровень, где уже есть несколько взаимно меняющихся частей, и мета-уровень должен менять именно этот совместный процесс.
Именно здесь текст связывает тему с более широкой идеей «открытого» развития: система не просто доходит до заранее понятной цели, а продолжает открывать новые направления улучшения.
Почему это важно на практике
Для инженеров ИИ-агентов здесь три прямых вывода.
🟣 Если вы учите агента в фиксированном наборе задач, вы почти наверняка получите локальный максимум
🟣 Если ваш оценщик не обновляется, агент начнет подстраиваться под устаревшую проверку
🟣 Если роли в мультиагентной системе заданы раз и навсегда, вы теряете часть возможного роста
Есть и обратная сторона. Коэволюция усложняет контроль. Агент может переобучиться под конкретного партнера. Может научиться использовать слабости оценщика. Может уйти в однообразие, когда все участники системы сходятся к узкому набору стратегий. Может выработать схемы общения, которые человеку уже трудно понять.
Поэтому авторы отдельно говорят про оценку и безопасность. Старые бенчмарки измеряют в основном финальный навык: решил задачу или нет. Для коэволюции этого мало. Нужно проверять:
🟠 улучшаются ли все меняющиеся части системы
🟠 переносятся ли результаты на новых партнеров и новые среды
🟠 не появился ли скрытый обход проверки
🟠 не схлопнулось ли разнообразие стратегий
Вывод
Коэволюция — следующий шаг после самоулучшающегося агента. Один агент, который меняет только себя, почти всегда живет в чужих фиксированных рамках. Долгий прогресс начинается там, где меняются и другие части системы: соперники, союзники, задачи, оценщики, миры и в пределе сам механизм улучшения.
Из этого следует простая вещь. Будущее агентных систем зависит не только от более сильных LLM, но и от того, сумеем ли мы построить среды, партнеров и пайплайны, которые меняются вместе с агентом. И не потеряем ли при этом управляемость.
Ближайшая практическая граница выглядит так: меньше статичных тренировочных схем, больше адаптивных экосистем. Дальняя граница — системы, которые сами решают, как именно им продолжать улучшаться.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram