GameTalk: как научить LLM выигрывать в переговорах

LLM умеют поддерживать диалог, но стоит перенести их в мультиагентную систему, где нужно договариваться, давить, уступать, обманывать и помнить цель на протяжении всей беседы, — сразу начинаются проблемы. Одна из главных проблем в том, что большинство способов дообучения оценивают ответы локально: хороший ли конкретный фрагмент текста, вежлив ли он, логичен ли. А в переговорах важен не отдельный ход, а итог: удалось ли скоординироваться, заработать больше, склонить оппонента к нужному решению.
Авторы работы GameTalk: Training LLMs for Strategic Conversation предлагают смотреть на диалог как на игру с длинной траекторией, где вознаграждение приходит в конце. И учить модель вести разговор так, чтобы системно выигрывать.

Игры вместо абстрактных тестов
Вместо размытых «диалоговых» бенчмарков авторы берут контролируемые игры, где успех измеряется числом: победил/проиграл, получил прибыль, выторговал лучший контракт. Это три сценария возрастающей сложности.
Во-первых, «камень‑ножницы‑бумага», но с хитрым ограничением: обучаемой модели запрещают играть бумагой, чтобы она была вынуждена выигрывать через разговор и влияние на выбор соперника. Во-вторых, конкуренция Бертрана — дуополия, где игроки назначают цены: можно попытаться договориться о высокой цене (выгодно обоим), но всегда есть соблазн чуть сбить цену и забрать рынок. В-третьих, торг, где нужно согласовать одновременно количество и цену, перебрасываясь предложениями и контрпредложениями.
Учат так: один разговор — одна награда
Ключевая идея GameTalk простая по формулировке и сложная по реализации: оптимизировать глобальную награду за весь диалог. Модель генерирует приватные рассуждения, затем либо пишет реплику, либо делает игровой ход. Эпизод завершается — и только тогда считается полезность (например, прибыль или результат партии). Именно этот финальный сигнал используется для дообучения.
Дальше авторы адаптируют известные методы посттрейнинга под многоходовые диалоги: GRPO, DPO и STaR. Важная инженерная деталь: для GRPO и DPO они делают «развилку» внутри беседы — копируют текущую историю в несколько параллельных веток, получают разные продолжения, доигрывают их до конца и учат модель предпочитать те ответы, которые привели к лучшему исходу.

Три критерия оценки стратегического разговора
Чтобы понять, почему модель выигрывает или проигрывает, авторы вводят три сигнала, которые раскладывают стратегичность на отдельных компоненты.
Первый отражает, насколько точно модель представляет стратегию оппонента. Второй — насколько хорошо она действует, исходя из своих убеждений об оппоненте. Третий — умеет ли она через разговор менять ситуацию так, чтобы у неё появлялись «рычаги влияния». Практически это измеряют, запрашивая у моделей вероятности действий из текущего состояния диалога и сравнивая приближения истинной политики и «внутренней версии» в голове агента.

Почему без настройки награды разговор получается странным
В экспериментах обнаруживается типичная боль обучения по редкой награде: если платить только за финальную победу, модель учится, но не всегда тем способом, который нам понравится. Особенно показательно, что вознаграждение за «рычаг влияния» даёт сильный рост побед, но речь становится неестественной: короткие, механические реплики, лишь бы подтолкнуть соперника.
Поэтому авторы добавляют ещё награду за естественность диалога (её оценивает отдельная LLM как судья). Получается компромисс: эффективность почти сохраняется, а разговор меньше напоминает телеграфный протокол.

Что получилось: DPO — самый надёжный переговорщик
На трёх играх все дообученные агенты заметно сильнее необученных, но характер улучшений разный. В «камень‑ножницы‑бумага» лучше всего выстреливает GRPO (очень высокий win rate), DPO близко, STaR слабее. А вот в более «человеческих» задачах — ценовая дуополия и торг — DPO оказывается самым стабильным и сильным. Похоже, что обучение на предпочтениях (сравнение хороших и плохих веток) даёт более богатый сигнал.
Любопытная деталь: модель может научиться эффективно убеждать и выигрывать, не демонстрируя столь же сильного роста в точности моделирования оппонента. То есть разговорная стратегия иногда работает как набор приёмов влияния без глубокой модели мира и без точной реконструкции намерений второй стороны.

Что это меняет
GameTalk показывает: если мы хотим LLM, которые умеют вести целенаправленные переговоры, нужно учить их на длинной дистанции, где ценится итог всей беседы, и при этом следить, чтобы оптимизация не превращала речь в нечеловеческий набор триггеров. Работа также честно подсвечивает, что не было проверок на людях, и остаётся разрыв между реальным выигрышем и тем, насколько хорошо модель понимает собеседника.
Тем не менее, как общий рецепт для обучения стратегическому разговору в мультиагентных системах GameTalk выглядит важным шагом: он соединяет RL-подходы и диалог так, чтобы цель диалога была привязана к конкретному результату.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram