i
ДАТАИСТ
Новости · 2026-09-12

Шаги рассуждений ИИ-моделей соответствуют разным внутренним паттернам — исследование

@neuronium_ai @neuronium_ai

Исследователи KAIST и Naver ИИ Lab выяснили, что отдельные шаги рассуждений, которые языковая модель показывает в тексте, различимы и в её внутренних числовых представлениях. Команда выделила восемь повторяющихся операций — среди них извлечение данных, разбиение задачи, воспоминание формулы, дедукция и вычисление — и проверила их на Qwen2.5-7B, Qwen3-8B и Gemma4-31B. Сигнал оказался наиболее заметным в средних слоях моделей и сохранялся даже при ошибочных решениях. Авторы также подтвердили результат на Llama-3-8B и дополнительных математических наборах, но пока неясно, поможет ли этот подход находить ошибки или направлять модель во время генерации.

Обложка: Шаги рассуждений ИИ-моделей соответствуют разным внутренним паттернам — исследование

Новое исследование проверило, можно ли обнаружить во внутренних состояниях языковой модели те же отдельные шаги, которые видны в её письменном рассуждении.

Когда модель рассуждений решает задачу поэтапно, она последовательно выполняет разные операции: читает данные, разбивает проблему, вспоминает формулу и проводит вычисление. Исследователи из южнокорейских KAIST и Naver ИИ Lab выяснили, можно ли разделить эти этапы внутри числовых представлений модели. Да, можно: сильнее всего соответствующий сигнал проявляется в средних слоях.

Команда выделила восемь повторяющихся операций рассуждения. Среди них — извлечение данных, декомпозиция задачи, воспоминание формулы, дедукция и вычисление. Три модели — Qwen2.5-7B, Qwen3-8B и Gemma4-31B — решали математические задачи, после чего исследователи разделили их решения на фрагменты. Затем GPT-5 присвоил каждому фрагменту одну из этих операций.

Один и тот же ответ создаёт различный паттерн активации в зависимости от того, какая операция рассуждения исследуется. Сегменты группируются вдоль соответствующего направления на диаграмме рассеяния

Один и тот же ответ создаёт различный паттерн активации в зависимости от того, какая операция рассуждения исследуется. Сегменты группируются вдоль соответствующего направления на диаграмме рассеяния

Источник: the-decoder.com

Шаги рассуждений разделяются внутри модели

Разные операции рассуждения можно надёжно различить по внутренним представлениям всех трёх проверенных моделей. Максимальным это разделение становится в средних слоях.

Исследователи проверили, не объясняется ли результат простым выбором слов. Классификатор, который анализировал только использованные токены, работал хуже классификатора, изучавшего внутренние представления. Положение фрагмента в цепочке решения тоже не объясняло эффект. Значит, внутренние состояния содержат сведения о типе операции рассуждения, которые не сводятся к поверхностной формулировке.

Одни слова получают разные представления

Служебные слова вроде «a», «is» или «the» встречаются в самых разных операциях рассуждения. На ранних слоях их представления ещё смешаны, но на средних и поздних слоях начинают разделяться в зависимости от окружающей операции. Одно и то же слово получает разное внутреннее представление в зависимости от того, к какому шагу рассуждения оно относится.

Исследователи также проверили, формируется ли операция рассуждения независимо от предыдущего контекста. В ходе целевого вмешательства они закрыли модели доступ к предыдущим 30 токенам. Сигнал, связанный с этой операцией, ослаб. Это указывает, что шаги рассуждения строятся на предшествующем контексте, а не возникают изолированно.

Одни и те же слова перекрываются на ранних слоях и разделяются в зависимости от окружающей операции на средних и поздних слоях

Одни и те же слова перекрываются на ранних слоях и разделяются в зависимости от окружающей операции на средних и поздних слоях

Источник: the-decoder.com

Даже в неверно решённых задачах удавалось определить, какую операцию выполняла модель: вычисляла, вспоминала формулу или проводила дедукцию. Ошибочный этап вычисления всё равно выглядел во внутреннем состоянии как вычисление, хотя результат оказывался неправильным.

Результат подтвердили и дополнительные проверки:

он воспроизвёлся на Llama-3-8B;
для Qwen3-8B обученные классификаторы успешно перенеслись на наборы GPQA-Diamond и MATH-500.

При этом эксперименты ограничены математическими задачами и небольшим числом моделей. Открытым остаётся вопрос, можно ли использовать такие результаты для обнаружения ошибок или управления моделью прямо во время генерации.

Связь между текстовым ответом и внутренними вычислениями важна для безопасности ИИ. По данным OpenAI, чтение цепочки рассуждений — один из немногих доступных инструментов контроля. Однако Anthropic показала, что модели раскрывают использованные ими подсказки только в 25–39% случаев.

Метод перевода внутренних векторов модели в понятный текст показал, что Claude Opus 4.6 обрабатывает больше информации, чем попадает в его рассуждение на выходе. А у модели Astra от OpenAI техника Recurrent Depth переносит часть рассуждений во внутренние числовые представления — именно это пространство изучает команда KAIST.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram