i
ДАТАИСТ
Обзор · 2026-01-24

Общество мыслей: как LLM становятся сильнее, когда спорят сами с собой

Общество мыслей: как LLM становятся сильнее, когда спорят сами с собой

Мы привыкли думать, что reasoning-модели сильнее просто потому, что они пишут более длинные рассуждения и тратят больше вычислений перед ответом. В работе Reasoning Models Generate Societies of Thought авторы предлагают более любопытное объяснение: такие модели не только «думают дольше», они начинают думать иначе — как будто внутри них возникает маленькое собрание голосов, которые задают друг другу вопросы, спорят, меняют позицию и затем приходят к общему решению. Это и называют society of thought — общество мыслей.

Проблема, которую поднимает статья, понятная: LLM могут решать сложные задачи, но почему одни версии (DeepSeek‑R1, QwQ‑32B и др.) рассуждают заметно надёжнее, чем обычные instruction‑tuned модели, до конца не ясно. Если секрет только в длине цепочки рассуждений, то достаточно печатать больше текста — но в реальности это не всегда даёт выигрыш.

Разговорные паттерны в рассуждениях: вопросы и ответы, смена перспективы, конфликт и примирение, а также эмоциональные роли по Бейлзу.

Рассуждение как внутренняя беседа

Авторы берут 8 262 задачи из популярных наборов (BigBench Hard, GPQA, MATH Hard, MMLU‑Pro и др.) и смотрят не только на финальную точность, но и на сами traces рассуждений. Дальше начинается самое нетривиальное: текстовые цепочки анализируют как диалог. Специальная разметка (через LLM‑судью, с проверками согласованности с людьми и другими моделями) ищет четыре «разговорных поведения»: постановку вопросов и ответы, смену перспективы, конфликт взглядов и примирение.

И вот что обнаруживается: у reasoning‑моделей эти паттерны встречаются гораздо чаще, чем у базовых и instruction‑tuned версий — даже если контролировать длину рассуждения. То есть дело в том, что структура текста становится похожей на обмен репликами внутри команды: один голос предлагает ход, другой сомневается, третий проверяет, затем решение собирается воедино.

Авторы идут дальше и добавляют слой «социальной психологии»: классифицируют социо‑эмоциональные роли по методике Бейлза — от поддержки и согласия до напряжения и несогласия. И снова reasoning‑модели оказываются более «социальными»: у них чаще появляется баланс ролей — не только дружелюбное поддакивание, но и нормальный рабочий конфликт, который в человеческих группах нередко помогает находить ошибки.

Можно ли доказать, что это не просто стиль?

Один из сильных моментов статьи — попытка показать причинность. Авторы используют sparse autoencoders (SAE), чтобы выделить в activation space модели разреженные «признаки». Среди них находят feature 30939 — маркер, который часто активируется в местах, похожих на смену реплики или внезапное «осознание» в диалоге (вроде “Oh!”).

Затем делают steering: на каждом шаге генерации слегка «подталкивают» модель в сторону этого признака. В задаче Countdown (многошаговая арифметика) точность при steering +10 прыгает с 27,1% до 54,8%, а при steering −10 падает до 23,8%. Параллельно растут и сами разговорные поведения: больше вопросов‑ответов, больше конфликтов перспектив, больше примирения. Это выглядит так, будто включение «диалогового режима» действительно помогает модели искать решение, перепроверять и откатываться, а не просто украшает текст.

Steering разговорного признака в activation space: усиление маркера «диалоговой смены реплики» заметно повышает точность и увеличивает проверку и backtracking.

Разные «персоны» как рабочий инструмент

Другая линия доказательств — поиск неявных перспектив. LLM‑судья пытается выделить, сколько «голосов» звучит в одном trace, и приписывает им примерные черты личности (по BFI‑10) и тип экспертизы. Получается, что reasoning‑модели чаще демонстрируют разнообразие: как будто один внутренний голос более рискованный и креативный, другой более критичный, третий «тянет» задачу в сторону своей экспертизы. Авторы отдельно измеряют разнообразие «личностей» и «экспертиз» и показывают, что оно у reasoning‑моделей статистически выше.

Важно, что это не подаётся как мистификация про «сознание». Скорее, как полезная вычислительная организация: чтобы обойти пространство решений, модели выгодно порождать конкурирующие гипотезы, сталкивать их и затем выбирать устойчивую.

Разнообразие неявных «персон»: reasoning‑модели показывают больший разброс по чертам личности и по экспертным ролям.

Социальность появляется даже без прямой команды

Наконец, авторы проверяют, возникает ли такое поведение само при RL, если награждать модель только за правильный ответ. На маленькой базовой Qwen‑2.5‑3B они запускают PPO‑обучение и видят любопытную динамику: по мере роста точности в traces всё чаще появляются вопросы‑ответы и конфликт перспектив. То есть «социальная организация мысли» может быть тем, что RL находит как эффективную стратегию.

А если перед RL слегка подготовить модель — дообучить на примерах, где решение оформлено как мини‑обсуждение нескольких ролей, — прогресс ускоряется заметнее, чем если дообучать на монологическом chain‑of‑thought. Это важный практический вывод: не только данные «правильных ответов» решают, но и форма, в которой модель учится думать.

При RL «социальные» паттерны появляются сами; предварительное дообучение на диалоговом каркасе ускоряет рост точности.

Что это меняет в нашем взгляде на reasoning-модели

Reasoning-модели сильнее не просто из‑за длины рассуждений. Они, похоже, систематически переходят к внутренней «мультиагентной» организации в одном потоке текста — без явного запуска мультиагентной системы из нескольких моделей. А спор, проверка, смена позиции и даже немного «эмоциональных ролей» оказываются способом улучшить поиск решения и снизить вероятность промаха.

Практически это намекает на новый рычаг управления качеством: можно проектировать промт, обучение и тест‑тайм вычисления так, чтобы модель легче входила в режим внутреннего обсуждения. А в исследованиях interpretability появляется более конкретная цель: искать не абстрактные «нейроны логики», а механизмы, которые включают и координируют разные перспективы.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram