Коллективное поведение ИИ-агентов в социальных дилеммах: почему умные агенты разрушают общее благо

Пока автономные LLM-агенты берут на себя задачи людей — от переговоров с сервисами до управления ресурсами в компаниях, — мы привыкли оценивать их по одиночным тестам. Нас интересует, как хорошо модель пишет код, отвечает на вопросы или планирует. Но в реальном мире они сталкиваются друг с другом, конкурируют за ограниченные ресурсы и иногда невольно создают ненужную конкуренцию. Работа Evaluating Collective Behaviour of Hundreds of LLM Agents как раз про это: что будет, если рядом окажутся не два и не десять, а сотни агентов, действующих каждый «в интересах своего пользователя».

Не просто ход за ходом, а стратегия как алгоритм
Авторы берут классические социальные дилеммы из теории игр — ситуации, где индивидуальная выгода конфликтует с общей. Например, «общественное благо» (выгодно всем вкладываться, но каждому хочется сэкономить), «коллективный риск» (катастрофа предотвращается, если вкладов достаточно) и «общий ресурс» (вроде рыбалки: переборщишь сейчас — всем будет хуже потом).
Ключевой ход методологии — не заставлять LLM выбирать действие в каждом раунде. Такой режим часто подводит: модель может не заметить простые паттерны поведения других игроков и «забывать» контекст. Вместо этого модели просят один раз придумать стратегию целиком и описать ее словами так, чтобы затем ее можно было превратить в исполняемый алгоритм. Получается важный бонус: стратегию можно инспектировать до деплоя и быстро прогонять в огромном числе симуляций. Это и позволяет масштаб — вплоть до популяций в 256 агентов, что для таких исследований редкость.
Еще одна деталь, похожая на реальный мир: авторам не хочется задавать модели подробный «устав». Они дают высокоуровневую установку — условно просоциальную или более эгоистичную — и смотрят, как разные LLM интерпретируют ее сами. На каждую установку для каждой модели генерируют сотни стратегий, проверяют их на безопасную исполнимость и дальше сравнивают поведение.
Как измеряют «характер» стратегий
Чтобы не утонуть в тысячах алгоритмов, авторы переводят поведение каждой стратегии в большой числовой «отпечаток»: как часто она выбирает кооперацию при разных историях игры. Затем применяют PCA, чтобы увидеть, насколько стратегии разнообразны и насколько хорошо модель различает установку «коллективно» и «эксплуатативно».

Из этого анализа всплывает несколько любопытных черт. Например, у одних моделей установки разделяются очень четко: просоциальные стратегии действительно ведут себя иначе, чем эгоистичные. А у других различия почти стираются — как будто промт мало влияет на реальное поведение. В игре с общим ресурсом «настроить» модель оказывается особенно трудно: даже сильные модели хуже отделяют кооперативные намерения от индивидуалистичных.
Самоигра: что будет, если выпустить их «в толпу»
Дальше начинается самое прикладное. Авторы берут популяцию заданного размера и смешивают в ней доли стратегий двух типов — более просоциальных и более эгоистичных — и измеряют среднее общественное благосостояние. Причем делают это для разных масштабов: от 4 до 256 агентов.
Картина получается не утешительная и при этом неоднородная. В некоторых играх отдельные модели остаются относительно «устойчивыми»: даже если большинство просит эгоистичную установку, система не всегда проваливается в тотальную дефекцию. Но в других случаях рост размера группы ухудшает результат: вклад одного агента становится менее заметным, и соблазн «срезать угол» сильнее. Самая жесткая проверка — общий ресурс: там ранняя дефекция может необратимо истощить запас, и даже если позже все «одумаются», исправить уже сложно.
Особенно интересно наблюдение авторов: более новые reasoning-модели нередко дают худшие общественные исходы. Не потому что они «плохие» — а потому что они лучше находят способы выиграть лично, если среда допускает паразитирование на кооперации других.
Культурная эволюция: почему рынок может выбрать худшее
Чтобы приблизиться к реальности, авторы добавляют еще один уровень — имитацию пользовательского выбора. Представим, что люди выбирают себе агента (модель + установка) и со временем переключаются на тех, кто приносит больше выгоды. Это похоже на культурную эволюцию: успешные стратегии копируются, неуспешные исчезают.
В симуляциях часто происходит то, чего многие интуитивно опасаются: «побеждают» эгоистичные установки. Они приносят пользователю чуть больше в конкурентной среде — и этого достаточно, чтобы постепенно вытеснить просоциальные варианты. В больших популяциях риск схождения к плохому равновесию заметно выше. Получается неприятная логика: даже если всем было бы лучше сотрудничать, индивидуальный отбор по краткосрочной выгоде может вести систему к деградации.

Что это меняет на практике
Главный вывод работы звучит просто: оценка LLM-агентов должна включать не только индивидуальные навыки, но и коллективное поведение в социальных дилеммах. Если мы развернем мультиагентные системы без «институтов» — ограничений, стимулов, правил взаимодействия, — рынок и конкуренция могут естественно подтолкнуть к доминированию эксплуатативных стратегий, даже когда это разрушает общее благосостояние.
Ценность подхода еще и в инженерной приземленности. Фиксированные стратегии-алгоритмы удобно проверять до деплоя, сравнивать между моделями и масштабировать до сотен агентов. Да, метод намеренно исключает коммуникацию между агентами — и это ограничение. Но в больших системах коммуникация может быть дорогой или непрактичной, а значит такой «безразговорный» стресс‑тест вполне реалистичен.
В сухом остатке работа оставляет важное предупреждение: повышение уровня интеллекта агента не гарантирует улучшения общественного результата. Иногда происходит наоборот — просто потому, что умный агент эффективнее находит лазейки в правилах.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram