i
ДАТАИСТ
Обзор · 2025-12-27

Когда цифр недостаточно: язык как скрытый сигнал в экономических ИИ-моделях

Когда цифр недостаточно: язык как скрытый сигнал в экономических ИИ-моделях

В учебниках экономики всё понятно: цены, налоги, ставки, полезность. Но в реальной жизни решения людей и государства постоянно «подкручиваются» словами — новостями, разговорами, ожиданиями, слухами и публичными заявлениями. Один и тот же набор чисел может читаться по‑разному, если вокруг звучит «надвигается кризис» или «всё под контролем». Именно этот слой реальности долго оставался неудобным для обучения с подкреплением и особенно для мультиагентных систем: классическое обучение с подкерплением любит чёткие сигналы, а язык полон намёков, неоднозначностей и стратегического поведения.

Авторы работы Think, Speak, Decide: Language-Augmented Multi-Agent Policy Learning in Economic Environments предлагают фреймворк LAMP, который аккуратно «встраивает» язык в обучение политик в экономических симуляторах. Идея не в том, чтобы заменить обучение с подкреплением LLM-ответами, а в том, чтобы научить систему использовать текст как ещё один источник информации и координации — как это делают люди.

Сравнение предыдущих исследований и цели: неструктурированные языковые сигналы наряду со структурированными числовыми данными критически важны для принятия экономических решений.

Если взять стандартный MARL (multi-agent reinforcement learning), он неплохо учится на численных наблюдениях: зарплатах, налоговых шкалах, показателях неравенства. Но как только в среду добавляются текстовые новости и сообщения других участников рынка, начинается проблема: модели сложно понять, что в тексте важно, как соотнести это с экономикой, и можно ли доверять источнику.

С другой стороны, подход «пусть LLM решает задачу напрямую» тоже не спасает. LLM хорошо пишет и рассуждает, но без системной оптимизации политики она часто работает нестабильно: может объяснить шаг, но не обязательно найти работающую стратегию решения.

LAMP задуман как компромисс, который берёт сильные стороны обоих подходов: у RL — оптимизацию поведения, у LLM — интерпретацию и коммуникацию.

Think–Speak–Decide: как устроен LAMP

Фреймворк складывается в понятный человеческий цикл.

Сначала Think. В симуляторе есть глобальные экономические показатели, и LLM выступает как «новостная служба»: превращает численные изменения в короткие тексты про краткосрочные шоки и долгосрочные тренды. Важно, что система не просто генерирует рассуждение и забывает. Она сохраняет удачные «траектории рассуждений» в пул опыта и позже умеет доставать похожие примеры через поиск (FAISS) — по семантической близости ситуаций. Это похоже на то, как экономист вспоминает прошлые кризисы и сравнивает их с текущим.

Затем Speak. Агент формулирует короткое публичное сообщение о своей позиции или намерениях (не одно, а несколько вариантов), а оценщик выбирает, что именно отправить. Остальные агенты читают это сообщение через LLM и обновляют свои убеждения: кто перед ними, насколько можно доверять, какой у «оппонента» уровень благосостояния и что он, вероятно, сделает дальше. Получается модель социальных ожиданий — не идеальная, но рабочая.

Наконец Decide. На этом шаге решения принимает уже RL-политика (в статье — MADDPG в режиме CTDE). Тексты не подаются «сырым» языком: они кодируются в эмбеддинги, нормируются и добавляются к численным признакам. Иными словами, язык становится компактным управленческим сигналом, который помогает действовать, а не только красиво объяснять.

Рабочий процесс LAMP: (a) модуль Think с двумя путями извлекает долгосрочные тренды и краткосрочные шоки в компактные эмбеддинги рассуждения; (b) модуль Speak применяет self-attention, чтобы выбрать и распространить одно сообщение, и выполняет шаг рефлексии для обновления убеждений; (c) сеть политики модуля Decide объединяет числовые наблюдения с языковыми и рефлексивными эмбеддингами для выбора действий.

Что получилось в итоге

Эксперименты провели в среде TaxAI — это экономический симулятор с гетерогенными домохозяйствами и правительством, где нужно балансировать рост, налоги, труд, потребление и общественное благосостояние. Авторы проверяют три режима: стабильная экономика, замедление и кризисный шок.

На стабильном сценарии LAMP заметно обгоняет чистый MARL и «LLM-only» подходы по суммарной награде и устойчивости, а также выигрывает у продвинутых текстовых бейзлайнов вроде ReAct и Reflection. Интересно, что улучшение метрик достигается не «в лоб», а через тонкую оптимизацию: благосостояние и награда растут, а потребление и труд могут даже снижаться — что в рамках полезности домохозяйств иногда логично (переработка не всегда благо).

Визуально это хорошо видно на графиках сравнения: LAMP в среднем даёт выше общественное благосостояние и более устойчивое поведение в разных средах, чем альтернативы без языка, которые полагаются на LLM без строгой оптимизации политики.

Сравнение LAMP с другими агентами (Only-LLM, CoT, ReAct, Reflection) по одинаковым метрикам в трёх экономических средах. LAMP превосходит все эти базовые LLM-методы, обеспечивая более высокое общественное благосостояние и потребление и, как правило, меньшую вариативность благосостояния в каждой среде.

Если убрать долгосрочный модуль (long-term новости и их использование), качество резко падает. Если отключить пул опыта с извлечением прошлых удачных рассуждений, проседает благосостояние и сокращается «продолжительность жизни» экономики до коллапса.

Кривые обучения за первые 80 эпох для семи методов

Что это нам даёт

Главный вывод работы в том, что язык в экономике — это полноценный поток данных для экономических моделей и инструмент стратегического взаимодействия. LAMP показывает, как можно превратить этот поток в часть обучаемой политики так, чтобы система не разваливалась на длинных сценариях.

Одновременно это шаг к более интерпретируемым агентам. Когда система хранит и переиспользует цепочки рассуждений, исследователю проще понять, почему была выбрана та или иная стратегия: не только по весам сети, но и по текстовым следам решений.

💾 Код

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram