i
ДАТАИСТ
Обзор · 2026-06-30

Почему даже лучшие ИИ-агенты сильно отстают от людей

Обложка: Почему даже лучшие ИИ-агенты сильно отстают от людей

Когда ИИ надо не просто отвечать, а жить в мире

Сегодня мы много говорим о том, как LLM умеют писать код, решать задачи и поддерживать диалог. Но почти все эти проверки устроены одинаково: модели дают задачу, она отвечает, на этом всё. Реальный ИИ-агент работает не так. Ему нужно действовать шаг за шагом, запоминать, учиться на ходу, возвращаться к старым предметам и планам, не забывать, где что лежит, и не зацикливаться на одной и той же ошибке.

Именно в эту болезненную точку бьёт новая работа про AgentOdyssey. Авторы предлагают не просто очередной бенчмарк, а целую игровую среду для проверки того, умеют ли ИИ-агенты учиться во время использования, а не только красиво проходить статические тесты. И результаты, честно говоря, отрезвляют: даже лучшие агенты сильно отстают от человека.

Что такое AgentOdyssey и зачем он нужен

AgentOdyssey — это генератор открытых текстовых игр. Агент видит мир в виде текста: где он находится, какие рядом объекты, какие есть персонажи, что у него в руках, сколько здоровья, который час. После этого он выбирает действие: пойти в другую зону, подобрать предмет, поговорить с персонажем, создать вещь, атаковать, подождать и так далее.

На первый взгляд это напоминает старые текстовые квесты. Но суть глубже. Здесь мир устроен так, чтобы проверять пять базовых способностей, без которых долго живущий ИИ-агент далеко не уедет:

исследование;
эпизодическая память;
получение знаний о мире;
освоение навыков;
долгосрочное планирование.

То есть агенту мало просто “сообразить” следующий ход. Ему нужно понять, как устроен мир, заметить скрытые закономерности, запомнить события сотни шагов назад и увязать всё это в один план.

Пример длинной траектории в игре: агент исследует мир, запоминает события, учится правилам и связывает всё это в длинную цепочку действий.

Почему это важно? Потому что большинство привычных тестов для LLM предполагают, что во время проверки модель не учится. Она уже обучена, ей просто дают вход и смотрят на ответ. В жизни всё иначе. Если ИИ-агент работает в открытой среде — в программе, на сайте, в игре, в роботе, — он должен постоянно подстраиваться. И вот тут нынешние системы оказываются гораздо слабее, чем кажется по громким демо.

Как устроен этот мир

Сильная сторона AgentOdyssey — не только в самой игре, но и в том, как она создаётся. Авторы строят мир из сущностей: локаций, объектов, персонажей и правил. Есть граф мира, есть действия агента, а есть независимая динамика среды. Например, ночью враги могут становиться опаснее, некоторые события могут происходить случайно, а нужный предмет, оставленный когда-то раньше, может внезапно понадобиться через сотню шагов.

Это важно. Во многих игровых средах мир меняется только в ответ на действия агента. Здесь же он живёт сам по себе. Значит, агенту приходится не просто реагировать, а строить внутреннюю картину мира.

Схема AgentOdyssey: агент получает текстовое наблюдение, выбирает действие, мир обновляется по правилам, а новые игры автоматически генерируются с помощью LLM.

Игры генерируются процедурно. За основу берётся базовая игра, а затем LLM помогают создавать новые объекты, правила и квесты. Но авторы не ограничились генерацией “на авось”: они добавили автоматическую проверку корректности игры и исправление ошибок через синтез программ. Это снижает риск того, что среда окажется сломанной или неиграбельной.

Ещё одна хорошая идея — многоуровневая оценка. Обычно в игровых задачах считают только прогресс: дошёл до цели или нет. Здесь этого мало. Авторы отдельно измеряют:

как далеко агент продвинулся по основному квесту;
сколько побочных задач решил;
насколько хорошо исследовал объекты и действия;
что узнал о мире;
что помнит о собственной траектории;
насколько разнообразны его действия;
сколько токенов он потратил.

Последний пункт особенно полезен. Многие агентные схемы выглядят мощно только пока не посчитаешь цену.

Какие агенты сравнивали

В работе протестировали несколько популярных классов ИИ-агентов.

Во-первых, агенты с длинным контекстом. Они просто добавляют в подсказку всю историю: наблюдения, рассуждения, действия. Это лобовой, но часто сильный подход.

Во-вторых, агенты с памятью фиксированного размера. У них есть только скользящее окно недавних шагов или ограниченный буфер памяти.

В-третьих, агенты с поиском по памяти, где прошлый опыт хранится отдельно, а затем в нужный момент извлекаются релевантные фрагменты.

В-четвёртых, агенты с файн-тюнингом во время работы, когда опыт кодируется не только в тексте контекста, но и в весах модели через обновление параметров.

Авторы также пробовали дополнительные механизмы — краткосрочную память, рефлексию, суммаризацию.

Таксономия агентов: разные подходы к памяти и обучению во время работы, от длинного контекста до агентов с обновлением параметров.

Это хорошая постановка эксперимента. Она позволяет увидеть не “какая модель лучше вообще”, а какой тип памяти и адаптации лучше держится на длинной дистанции.

Главный результат: лучшие агенты всё ещё слабы

Самый яркий вывод работы очень простой: да, более сильные модели и более ёмкая память помогают, но до человека всё равно далеко.

В первом большом эксперименте лучшим оказался агент с длинным контекстом на базе GPT-5. Он лучше остальных запоминал прошлое, лучше усваивал знания о мире и лучше продвигался по основному квесту. Но даже он заметно отстал от человека.

Результаты первого эксперимента: агент с длинным контекстом лидирует, но всё равно сильно уступает человеку; диагностические метрики хорошо совпадают с реальным прогрессом в игре.

Это важный момент. Мы часто видим, как LLM хорошо справляются с короткими задачами и делаем вывод, что следующий шаг — просто “дать им побольше инструментов”. AgentOdyssey показывает: узкое место не только в инструментах, а в устойчивом поведении на длинном горизонте.

Авторы подробно разбирают типичные провалы.

Первый — слабое исследование. Агенты не любят собирать “неочевидно полезные” предметы и неохотно пробуют весь набор действий. Из-за этого они не добывают ресурсы, которые понадобятся позже.

Второй — проблемы с эпизодической памятью. Агент может много раз получить сообщение “это действие здесь не работает”, но всё равно повторять ту же ошибку. Или забыть, где уже видел нужный объект.

Третий — галлюцинации в знаниях о мире. Особенно у более слабых моделей: они пытаются создавать несуществующие предметы, путают рецепты и неверно понимают динамику среды.

Четвёртый — слабое освоение навыков. Даже если враг действует по повторяющемуся шаблону, большинство агентов не выучивают эффективную тактику.

Пятый — плохое удержание целей. Агент может неплохо решить локальную подзадачу, но потом не вернуться к главной линии и потерять нить плана.

И это, пожалуй, самая полезная часть статьи: она показывает не просто итоговый балл, а где именно ломается агентное поведение.

Память помогает. Но есть нюанс

Один из самых интересных выводов касается краткосрочной памяти. Авторы обнаружили, что она стабильно помогает разным типам агентов. Причём не только тем, кто работает через контекст, но и агентам с файн-тюнингом.

Логика тут житейская. Даже в длинной игре агенту нужен не только “архив всего прошлого”, но и рабочая память: что я сейчас собираю, сколько предметов уже нашёл, зачем пришёл в эту зону, какой подшаг выполняю прямо сейчас.

Во втором эксперименте, на более простой игре, лучший результат показал как раз агент с файн-тюнингом, усиленный краткосрочной памятью.

Во втором эксперименте лучший результат дал агент с файн-тюнингом и краткосрочной памятью; короткая рабочая память заметно улучшает обучение во время работы.

Это тонкий, но важный результат. Он говорит, что обучение “в весах” само по себе не решает проблему. Агенту всё равно нужна удобная оперативная память для ближайших целей. Иначе он может учиться в долгую, но путаться в текущем шаге.

При этом у обновления параметров в файлах нашлась и неприятная сторона: признаки катастрофического забывания. После обучения некоторые агенты хуже отвечали на вопросы о мире, чем до него. То есть они что-то усваивали, но параллельно теряли часть общих способностей. Для практических систем это серьёзное предупреждение.

Длинный контекст — сильный, но очень дорогой

На бумаге агент с длинным контекстом выглядит лучше всех. Но у него есть почти комический недостаток: цена.

Если на каждом шаге агент тащит за собой всю историю, число токенов растёт очень быстро. В работе авторы прямо показывают, что стоимость такого подхода становится квадратичной по мере роста траектории. То есть чем дольше живёт агент, тем больнее это бьёт по бюджету и задержкам.

И это не абстрактная проблема. Можно построить очень умного агента, который хорошо играет 200 шагов. Но если на 500-м шаге он становится слишком дорогим или не помещается в контекст, его “осмысленный горизонт” заканчивается.

В этом смысле AgentOdyssey полезен ещё и как противоядие от самообмана. Он показывает, что качество без учёта стоимости — неполная картина.

Почему эта работа важна шире, чем просто для игр

Легко отмахнуться: мол, это всего лишь текстовые квесты. Но в этом и сила работы. Авторы специально убрали зрение, управление мышью, шум сенсоров и прочие внешние сложности, чтобы изолировать главное: память, обучение на ходу, удержание целей и длинные причинно-следственные цепочки.

Если агент не может надёжно справиться с этим в контролируемом текстовом мире, ждать чудес в браузере, операционной системе или роботе рано.

Кроме того, работа аккуратно подталкивает сообщество к более честной постановке вопроса. Не “умеет ли модель рассуждать?”, а “умеет ли агент месяц жить в мире, накапливать знания, не разваливаться и не банкротить вас по токенам?”. Вот это уже взрослый вопрос.

Выводы

AgentOdyssey — одна из тех работ, которые не обещают магию, а делают что-то полезнее: дают хорошую линейку. С её помощью можно измерять не только красивые финальные результаты, но и реальные слабые места ИИ-агентов.

Главные выводы такие:

сильные базовые модели помогают;
большая память помогает ещё больше;
краткосрочная память особенно важна;
длинный контекст пока остаётся самым сильным, но слишком дорогим;
даже лучшие агенты всё ещё сильно уступают человеку;
обучение во время работы может приводить к забыванию.

Если совсем коротко, статья показывает неприятную, но важную истину: сегодняшние ИИ-агенты ещё плохо умеют жить длинную жизнь. Они могут блеснуть на отдельном шаге, но на сотнях шагов начинают забывать, зацикливаться, путать факты и терять план.

А значит, следующий большой прогресс в агентных системах, скорее всего, придёт не только от ещё более мощных LLM, но и от новых архитектур памяти, более бережного обучения во время работы и более экономного рассуждения. И в этом смысле AgentOdyssey — очень своевременная работа. Она не решает проблему, но отлично показывает, где именно её надо решать.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram