i
ДАТАИСТ
Обзор · 2026-05-06

Почему агенты хуже учатся на длинных задачах

Обложка: Почему агенты хуже учатся на длинных задачах

Вокруг LLM-агентов сегодня много шума: мы учим модели пользоваться инструментами, ходить по сайтам, чинить код, решать многошаговые задачи. Кажется, что главный вопрос — в качестве самой модели, размере контекста или хитрости алгоритма обучения. Но авторы работы «Об обучении больших языковых моделей для задач с длинным горизонтом» предлагают куда более приземлённое и при этом важное объяснение: иногда агент проваливается не потому, что не умеет рассуждать, а потому что до цели слишком далеко.

Агент «ломается» не потому, что глуп, а потому что путь слишком длинный

Это тонкое, но принципиальное различие. Если модель знает правила судоку и способна решить головоломку «в один присест», это ещё не значит, что она стабильно решит ту же задачу через 25–30 последовательных шагов взаимодействия со средой. По дороге накапливаются ошибки, сигнал награды размывается, а обучение с подкреплением начинает вести себя всё менее предсказуемо.

Именно это исследование аккуратно, почти хирургически, отделяет сложность рассуждения от длины пути до цели — и показывает, что сам по себе длинный горизонт уже является серьёзным узким местом. Для индустрии агентных систем это очень важный вывод: прежде чем изобретать всё более сложные рецепты RL, возможно, стоит сначала сократить число шагов, которые агент обязан пройти.

Что именно исследовали

Главная идея статьи проста: понять, как длина горизонта влияет на обучение LLM-агентов, если всё остальное по возможности удерживать постоянным.

Под «горизонтом» авторы имеют в виду не просто лимит шагов, а фактическую длину цепочки действий, необходимую для достижения цели. Исследователи различают несколько вещей:

минимальное число элементарных действий до цели;
максимальный бюджет взаимодействия, разрешённый средой;
фактическое число шагов, которое делает стратегия.

Ключевой ход работы — построить такие задачи, где правила и структура рассуждения одинаковы, а меняется в основном только длина решения.

Для этого авторы выбрали два удобных текстовых мира:

судоку, где можно контролировать длину решения через число пустых клеток;
Rush Hour, головоломку с машинками, где длина решения измеряется минимальным числом ходов.

Важно, что в случае судоку авторы специально отфильтровали задачи так, чтобы они требовали только базовых техник решения. Это нужно, чтобы не перепутать две причины провала: «модель не знает, как решать» и «модель знает, но не удерживает длинную последовательность действий».

Схема главной идеи работы: длина горизонта — самостоятельное узкое место, а сокращение горизонта стабилизирует обучение и улучшает перенос на более длинные задачи.

Ещё один сильный методологический приём: авторы проверяли, может ли модель решить ту же задачу в «сжатом» формате короткого горизонта. Например, вместо пошагового судоку — выдать сразу всю готовую доску. Если модель справляется в таком режиме, значит базовая способность к решению у неё есть, а дальнейшие трудности уже можно связывать именно с длиной взаимодействия.

Главный результат: длинный горизонт сам по себе рушит RL

Самая важная находка статьи звучит почти как диагноз: если увеличить только длину решения, обучение с подкреплением становится нестабильным и может полностью схлопнуться.

Авторы обучали модель Qwen3-1.7B, сначала проводя SFT на траекториях экспертов, а затем дообучая через RL. На коротких задачах всё выглядит привычно: RL помогает, качество растёт. Но как только расстояние до цели увеличивается, картина резко меняется — возникают сильные колебания, а затем и провал качества.

Динамика обучения при разной длине пути до цели: на коротких задачах RL стабилен, на длинных быстро становится неустойчивым.

Это особенно ценно потому, что авторы не просто показывают «на длинных задачах хуже». Они пытаются изолировать причину. И их вывод: дело не обязательно в том, что задача стала интеллектуально сложнее. Даже когда рассуждение по сути то же самое, увеличение числа шагов уже само по себе делает обучение гораздо более хрупким.

Почему так происходит? В статье выделены два механизма.

Во-первых, исследование пространства действий. Чем длиннее цепочка, тем меньше шанс случайно или полуосознанно попасть в успешную траекторию. Ошибка в начале отравляет всё продолжение.

Во-вторых, назначение заслуг. Если награда приходит редко и в конце, то при неудаче вся цепочка получает плохой сигнал — включая промежуточные шаги, которые могли быть правильными. Для языковой модели это особенно неприятно: отрицательный сигнал не аккуратно подталкивает к верному ответу, а распыляет вероятность по огромному словарю, усиливая шум.

Это наблюдение хорошо ложится на реальный мир. Агент для программирования может знать, как исправить отдельную ошибку, но если до успешного завершения нужно пройти двадцать зависимых шагов — от чтения журналов событий до правки файла, запуска тестов, исправления побочных ошибок и повторной проверки, — обучение становится куда менее надёжным.

Сокращение горизонта как неожиданно простой рецепт

Самый практический вывод работы: бороться с длинным горизонтом можно не обязательно более хитрым RL, а структурным сокращением числа шагов.

Авторы называют это принципом сокращения горизонта и предлагают два основных способа:

использовать макродействия, когда за один ход агент делает сразу несколько элементарных действий;
разбивать цель на подцели, чтобы длинная задача превращалась в цепочку коротких проверяемых отрезков.

И вот здесь статья становится особенно убедительной: идея вроде бы очевидная, но экспериментально она даёт очень сильный эффект.

Сравнение элементарных действий и макродействий в судоку и Rush Hour: сокращение горизонта заметно повышает стабильность и итоговое качество на длинных задачах.

В судоку агенту разрешали за один шаг заполнять не одну клетку, а несколько. В Rush Hour — делать более крупные перемещения. Результат: обучение идёт стабильнее, сходится быстрее и, главное, не разваливается на длинных сценариях, где базовый вариант с элементарными действиями терпит крах.

Авторы отдельно проверили, не является ли этот выигрыш побочным эффектом «более сильной стратегии». Для этого они провели красивую абляцию: стратегию, обученную с макродействиями, заставляли исполнять среду так, будто доступны только одиночные элементарные шаги. И стабильность снова ухудшалась. Значит, ключевой фактор действительно в уменьшении эффективного горизонта, а не просто в том, что модель стала умнее.

Отдельно интересно, что не любые макродействия одинаково полезны. Жёстко фиксированные пачки шагов работают хуже, чем гибкие макродействия, длину которых выбирает сама стратегия. Это похоже на здравый инженерный принцип: слишком грубая агрегация может быть так же вредна, как и её отсутствие.

Подцели тоже работают — и это хороший сигнал для реальных агентов

Второй путь — декомпозиция на подцели. В судоку авторы использовали промежуточные, проверяемые цели вроде корректного завершения отдельных блоков. Это превращает один длинный эпизод с редкой наградой в последовательность более коротких отрезков с плотным сигналом.

Разбиение задачи на подцели помогает RL на длинных задачах судоку, где базовая схема с редкой наградой почти не прогрессирует.

Это важный результат не только для головоломок. В реальных системах мы и так часто интуитивно строим агентов через промежуточные контрольные точки: сначала найти релевантный файл, потом локализовать ошибку, потом предложить исправление, потом прогнать тесты. Работа даёт этому не просто инженерное, а эмпирическое обоснование: подцели уменьшают эффективный горизонт и тем самым облегчают обучение.

По сути, статья аккуратно подводит к мысли, что многие удачные агентные архитектуры работают не потому, что у них особенно изящное планирование, а потому что они незаметно сокращают горизонт — через иерархию действий, вызовы API, код как высокоуровневое действие, промежуточные проверки и плотную обратную связь.

Самое интересное: сокращение горизонта помогает даже на более длинных задачах, которых модель не видела

Одна из самых приятных частей работы — наблюдение, которое авторы называют обобщением по горизонту. Модель, обученная на задачах умеренной длины, может неплохо переноситься на ещё более длинные варианты, если сложность рассуждения остаётся той же.

Обобщение по горизонту: стратегии, обученные на ограниченной длине задач, переносятся на более длинные сценарии, причём варианты с сокращением горизонта делают это заметно лучше.

Это важный и, честно говоря, немного противоинтуитивный результат. Казалось бы, если агент не тренировался на очень длинных эпизодах, ему там должно быть совсем плохо. Но оказывается, если обучение было стабильным и точность на каждом шаге достаточно хороша, модель может тянуться дальше, чем видела во время обучения.

Причём варианты с макродействиями показывают лучший перенос. Причина двойная:

они повышают точность на каждом шаге;
они уменьшают число точек, где ошибка может накопиться.

Для практики это означает вот что: возможно, не всегда нужно сразу учить агента на самых длинных и дорогих сценариях. Иногда разумнее сначала научить его уверенно проходить более короткие траектории, а затем использовать перенос и учебную программу по длине задач.

Авторы проверяют и эту идею. В Rush Hour они сравнивают прямое обучение на длинных задачах с режимом, где сначала идёт обучение на коротких, а потом переход на длинные. Учебная программа выигрывает. Это ещё один аргумент в пользу того, что компетентность на коротком горизонте — не приятный бонус, а фундамент для дальнейшего роста.

Почему эта статья важна за пределами судоку

На первый взгляд работа может показаться «ещё одной статьёй про RL на игрушечных средах». Но это было бы слишком поверхностное чтение.

Её настоящая ценность в том, что она предлагает простую ось анализа агентных систем: прежде чем обсуждать размер модели, хитрость оптимизатора и качество запроса, спросите — а каков здесь эффективный горизонт?

Это полезный вопрос для множества прикладных сценариев:

агент для программирования, который может за один шаг сгенерировать и выполнить скрипт, часто будет устойчивее агента, делающего десятки мелких вызовов;
веб-агент с высокоуровневыми действиями через API может обучаться лучше, чем агент, который имитирует каждое нажатие;
системы с проверяемыми промежуточными результатами получают не просто «более удобный интерфейс», а структурное снижение сложности обучения.

Авторы также показывают, что эффект не ограничен одной задачей, одной моделью или одним оптимизатором. Похожие закономерности проявляются в WebShop, на более крупной модели и при другом стиле оптимизации. Это усиливает главный тезис: длина горизонта — не частная ошибка конкретной реализации, а поперечное ограничение всего класса агентных LLM-систем.

Есть и важное ограничение. Работа честно показывает, что обобщение по горизонту не означает обобщения по техникам рассуждения. Если судоку начинает требовать принципиально более сложных приёмов, перенос ломается. И это трезвый вывод: RL хорошо помогает растянуть уже имеющиеся способности на более длинные траектории, но не обязан порождать новые качественно иные навыки.

Вывод

Эта статья ценна не громкими цифрами, а тем, что очень точно называет проблему. Для LLM-агентов узким местом часто является не само рассуждение, а длина пути до цели. И если это так, то лучший следующий шаг — не обязательно усложнять RL, а сокращать эффективный горизонт.

Из этого следует почти инженерный манифест:

проектируйте действия на более высоком уровне;
разбивайте задачи на проверяемые подцели;
стройте учебные программы от коротких горизонтов к длинным;
оценивайте не только «умеет ли модель решить задачу», но и «сколько зависимых шагов ей нужно пройти».

Для всех, кто делает агентные системы — от веб-автоматизации до инструментов для разработки, — это очень практичный урок. Иногда путь к более сильному агенту лежит не через более сложный мозг, а через более короткую дорогу.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram