i
ДАТАИСТ
Обзор · 2026-04-28

Модели мира для агентов нового поколения

Обложка: Модели мира для агентов нового поколения

У генеративного ИИ есть удобная иллюзия компетентности: модель пишет, рисует, иногда даже «планирует», и кажется, что у нее внутри есть нечто вроде картины мира. Но как только систему просят не просто продолжить текст, а долго и целенаправленно действовать — управлять роботом, ходить по сайтам, договариваться с людьми или ставить научные эксперименты, — вскрывается неприятный факт. Главный дефицит здесь не в красоте ответов, а в способности моделировать динамику среды: что произойдет после действия, где система ошибется и как ей переписать собственные представления, если мир не совпал с прогнозом.

Когда ИИ перестает «угадывать следующий токен» и начинает понимать мир

Именно об этом большой обзор Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond. Это не очередной список моделей и бенчмарков, а попытка навести порядок в хаосе термина модель мира, который в RL, компьютерном зрении, LLM-агентах и ИИ для науки означает очень разные вещи. Авторы предлагают простой подход: смотреть на модель мира по двум осям — уровень способностей и тип законов мира, с которыми работает система.

Как этот обзор позиционирует себя относительно агентов и моделей мира: в центре — единая таксономия по способностям и типам миров.

Почему это важно? Потому что сегодня одна команда называет моделью мира видеогенератор, если он красиво предсказывает кадры, а другая — модель динамики для планирования в RL. Формально все правы, на практике — сравнивать такие системы почти бессмысленно. Новый обзор предлагает общий язык, который может связать разрозненные сообщества и наконец ответить на вопрос: какая модель действительно помогает агенту принимать решения, а какая просто имитирует правдоподобие.

Не одна модель мира, а три уровня зрелости

Главная идея статьи — разделить модель мира на три уровня.

L1: Предиктор — это локальный предсказатель. Он умеет прогнозировать следующий шаг: следующее скрытое состояние, кадр, токен, наблюдение. Сюда попадают классические модели латентной динамики, часть видеомоделей и вообще все, что хорошо работает на коротком горизонте. Такие модели полезны, но у них есть фундаментальная слабость: качество одного шага не гарантирует, что при многократной прокрутке модель не «уплывет» в фантазию.

L2: Симулятор — это уже симулятор в рабочем смысле слова. Он должен поддерживать многошаговые разворачивания, зависящие от действий, которые пригодны для выбора действий. Здесь авторы вводят три строгих критерия перехода от L1 к L2: долгосрочная согласованность, чувствительность к вмешательствам и соблюдение ограничений домена. Иначе говоря, если модель красиво дорисовывает будущее, но не реагирует на изменение действия или ломает законы мира, это еще не полноценный симулятор.

L3: Эволвер — самый амбициозный уровень. Такая система не только симулирует среду, но и пересматривает собственную модель мира, когда сталкивается с систематической ошибкой. Это уже не «планирование внутри фиксированной модели», а цикл вроде научного метода: спроектировать действие или эксперимент, выполнить, наблюдать, диагностировать сбой, обновить модель и проверить, что обновление действительно улучшило поведение.

Иерархия моделей мира: от локального предсказания к симуляции и далее к пересмотру модели по новым данным.

Эта лестница выглядит почти очевидной, но в ней и состоит ценность обзора. Авторы не спорят о философии «понимает ли модель мир», а дают практический критерий: на что она способна в принятии решений. Один шаг? Несколько шагов под действием? Или еще и исправление самой себя?

Миры бывают разными: физический, цифровой, социальный, научный

Вторая ось таксономии — тип «законов», которым должна подчиняться модель. И здесь статья особенно полезна: она напоминает, что модель мира для робота, браузерного агента и лабораторного ИИ — это не просто разные приложения одной и той же техники. У них разные источники истины и разные типы ошибок.

Четыре режима законов: физический, цифровой, социальный и научный миры.

Физический мир — это механика, геометрия, контакт, устойчивость. Если робот предсказывает, что чашка пройдет сквозь стол, проблема очевидна.

Цифровой мир — это интерфейсы, API, файловые системы, код, состояния интерфейса. Здесь мир часто детерминированнее физики, но полон ветвлений, исключений и редких случаев. Ошибка проверяема: несуществующий API-вызов или сломанный DOM не «почти правильный», а просто неверный.

Социальный мир — совсем другой зверь. Тут важны убеждения, цели, нормы, обещания, роли, ожидания. Система может грамматически идеально вести диалог и при этом проваливать социальную динамику: забывать обязательства, игнорировать репутацию, путать намерения участников.

Научный мир — особый режим, где законы часто известны не полностью. Здесь модель нужно проверять не только на формальную корректность, а на согласие с экспериментом. Это мир суррогатных моделей для климата, молекул, материалов, клеток и автоматизированных лабораторий.

Эта четырехчастная схема помогает объяснить, почему одна и та же метрика «качества генерации» так мало говорит о полезности модели. Для видео модель мира может выглядеть впечатляюще, но если она не сохраняет контактную динамику или причинные связи, планирование на ней будет опасным. Для веб-агента наоборот: попиксельное предсказание менее важно, чем верная модель переходов между состояниями интерфейса.

Методология обзора: 400+ работ

Это масштабный обзор: авторы синтезируют более 400 работ и сводят свыше 100 репрезентативных систем из model-based RL, генерации видео, веб- и GUI-агентов, мультиагентного социального моделирования и ИИ для науки. Но ценность не только в количестве.

Вместо привычной разбивки «по модальности» — компьютерное зрение отдельно, язык отдельно, роботы отдельно — авторы сознательно режут поле поперек. Они спрашивают: какую способность демонстрирует система и по каким законам она живет?

Хронология моделей мира с 2018 по 2026 год, разложенная по уровням L1/L2/L3 и типам миров.

Такой взгляд сразу проясняет несколько вещей.

Во-первых, многие «модели мира» на деле остаются L1-системами: они сильны в краткосрочном предсказании, но ломаются на разворачиваниях. Во-вторых, L2 — это не просто «генерировать длиннее», а удерживать три свойства сразу: согласованность, чувствительность к вмешательствам и согласованность ограничений. В-третьих, L3 пока встречается редко и фрагментарно: чаще всего не как полноценная end-to-end-система, а как отдельные петли самопроверки или автоматизированного эксперимента.

Авторы предлагают и важный сдвиг в оценке качества: переход от метрик, ориентированных на предсказание, к метрикам, ориентированным на решение. То есть оценивать не только визуальную похожесть, а то, меняет ли хорошая модель мира реальные решения агента к лучшему.

Главные находки: где мы реально находимся

Если сжать выводы статьи до нескольких тезисов, картина будет такой.

Первое: область моделей мира фрагментирована. RL-сообщество давно работает с моделями динамики как с инструментом планирования. Сообщество компьютерного зрения часто обсуждает модель мира через генерацию видео и 3D-сцен. LLM-агенты приходят к тем же проблемам через использование браузера, инструментов или социальной симуляции. ИИ для науки — через суррогаты и автономные лаборатории. До сих пор эти ветки слабо разговаривали друг с другом.

Второе: большая часть шума вокруг моделей мира связана с путаницей между правдоподобием и полезностью. Хороший видеогенератор не равен хорошему симулятору. Красивые разворачивания без чувствительности к действиям и ограничений домена — это по сути анимированная галлюцинация.

Третье: L3 — это отдельная качественная ступень, а не просто «еще более длинное разворачивание». Когда система начинает активно собирать данные, искать причины ошибок, добавлять новые правила, тесты или гипотезы и валидировать обновление, это уже другой класс способностей. Здесь особенно выделяются научные системы и некоторые эволюционные циклы.

Четвертое: разные миры требуют разной валидации разворачиваний. В физике можно проверять столкновения и устойчивость, в цифровом мире — исполняемость и контракты, в социальном — согласованность норм и обязательств, в науке — цепочку «гипотеза-эксперимент-измерение». Один универсальный бенчмарк здесь вряд ли возможен.

Пятое: статья тонко, но настойчиво подводит к еще более глубокому тезису: для настоящего L3, возможно, нужны не только латентные представления, но и более явные, частично символические структуры. Пока нейросети отлично впитывают закономерности, но плохо умеют прозрачно пересматривать «законы» как объекты. Это особенно заметно в научных задачах, где человеческие модели мира исторически имели символическую форму — уравнения, принципы, инварианты.

Что это значит для агентного ИИ уже сейчас

Если смотреть на рынок и исследовательскую повестку, статья попадает точно в нерв момента. Мы переходим от эпохи «LLM как интерфейс» к эпохе «агент как исполнитель задач». А значит, узкое место смещается: больше недостаточно уметь говорить правдоподобно. Нужно надежно отвечать на вопрос «что будет, если я сделаю X?».

Для роботов это означает мир между восприятием и контролем. Для агентов для программирования и веб-агентов — переход от реактивных цепочек к моделям среды, где можно безопасно проигрывать действия до исполнения. Для мультиагентных систем — способность не только генерировать диалог, но и удерживать скрытые состояния социальных взаимодействий. Для научного ИИ — замыкать цикл открытия, а не просто предсказывать по готовым данным.

Особенно полезна мысль авторов о том, что замкнутый цикл планирования и L3-эволюция — не одно и то же. Агент может действовать в замкнутом цикле, не меняя свою модель мира. И наоборот, система может иметь механизм ревизии модели, не будучи полноценным воплощенным агентом. Это разведение понятий поможет трезвее оценивать многочисленные заявления о «самоулучшающихся» системах.

Выводы

Этот обзор хорош не тем, что обещает скорый AGI, а тем, что снимает романтический туман с темы моделей мира. Он предлагает рабочую рамку, в которой можно честно спросить о любой системе: она у нас просто предсказывает следующий шаг, умеет симулировать варианты действий или уже способна переписывать себя по результатам столкновения с реальностью?

Для Data/AI-аудитории здесь главное вот что. Будущее агентных систем, скорее всего, не в бесконечном наращивании размера универсального предсказателя. Оно в сочетании трех вещей: модели динамики, учета законов конкретного мира и механизма управляемого пересмотра собственных гипотез. Именно на этом стыке рождается переход к «системе, которая умеет ориентироваться в мире и улучшать свое понимание».

Пожалуй, самое ценное в статье — она превращает расплывчатое словосочетание модель мира в инженерный объект с проверяемыми границами. А это уже редкость в нашей индустрии.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram