Code2Worlds: LLM как движок мира — как ИИ начинает симулировать реальность

Генеративные модели научились рисовать впечатляющие ролики, но у такого видео есть слабое место: оно не обязано подчиняться законам физики. Объект может «плыть» в воздухе, частицы — игнорировать гравитацию, а твёрдые тела — проходить друг сквозь друга. Для задач пространственного интеллекта этого мало: нужна модель мира, которая не просто выглядит правдоподобно, а ведёт себя правдоподобно, потому что внутри работает симуляция.
Авторы работы Code2Worlds: Empowering Coding LLMs for 4D World Generation предлагают смотреть на создание 4D-сцен (то есть 3D плюс время) как на задачу генерации кода для симулятора. Идея в том, чтобы LLM не «фантазировала» движение на глаз, а писала исполняемый сценарий, который затем проверяется рендером и итеративно исправляется.

Две проблемы на пути к живым сценам
Первый барьер авторы называют запутанностью контекста разных масштабов. Когда модель генерирует сцену «монолитно», ей трудно одновременно удерживать крупную структуру окружения (рельеф, свет, плотность растительности) и мелкую геометрию важного объекта (например, лист с жилками или форму чашки). Обычно выигрывает общий план, а детали упрощаются — и потом плохо анимируются.
Вторая проблема — разрыв между смыслом и исполнением. Текст вроде «листья дрожат на ветру» нужно перевести в конкретные параметры: где закрепить объект, как задать турбулентность, какие ограничения коллизий включить. В open-loop режиме LLM пишет код вслепую, и появляются физические «галлюцинации».
Как устроен Code2Worlds: два потока и замкнутый цикл
Архитектура делит работу на две независимые части.
Первая — Object Stream, где создаётся главный объект с высокой детализацией. Вместо генерации «из ничего» система опирается на retrieval-augmented подход: извлекает из библиотек шаблоны параметров и эталонный код, после чего подбирает значения параметров под текст. Это похоже на работу дизайнера с хорошими заготовками: меньше синтаксических ошибок, больше контроля и повторяемости.
Вторая — Scene Stream, которая собирает окружение. Здесь важен иерархический подход: сначала план (какая погода, сезон, рельеф, плотность объектов), затем перевод качественных слов в числа, затем генерация исполняемого кода. Такая «лестница» снижает риск того, что LLM смешает смысловые уровни и выдаст красивый, но непоследовательный скрипт.
А дальше включается самое интересное — closed-loop. Сначала сцена оживляется специальным агентом PostProcess: он добавляет динамику и физические настройки. Затем видео с симуляцией смотрит VLM-Motion Critic и выдаёт обратную связь: что не совпало с текстом, где нарушена физика, какие параметры стоит подкрутить. После этого код правится и симуляция запускается снова, пока результат не станет приемлемым.

Что получилось на практике
Авторы ввели бенчмарк Code4D и сравнили подход с рядом code-centric решений и с video diffusion. По их данным, Code2Worlds заметно выигрывает по метрикам смысловой согласованности и насыщенности сцены: +41% SGS и +49% Richness относительно базовых решений. Отдельно подчёркивается снижение частоты физических провалов: Failure Rate 10% против существенно более высоких значений у ряда видео-диффузионных моделей (в таблицах у них встречаются 50–70%).
На качественных примерах видно, ради чего всё затевалось: система делает не просто «эффект движения», а симулируемые события — ветер, падение листьев, взаимодействие с водой, движение медузы в среде, огонь.

Чтобы почувствовать разнообразие, полезно посмотреть на ключевые кадры конкретных сцен: ветер, дождливый лес или катящаяся бутылка хорошо демонстрируют, как меняется поведение объектов во времени.



Почему это важно и куда смотреть дальше
Code2Worlds продвигает практичную мысль: для 4D-мира важна не только генерация, но и проверка исполнения. Код даёт управляемость, симулятор — причинность, а замкнутый цикл с критиком помогает регулярно «приземлять» фантазию LLM до работающей физики. Плюс, разделение на объект и окружение выглядит удачным способом сохранить детали там, где они действительно важны.
Ограничения тоже читаются между строк: такой подход требует инфраструктуры (рендер, симуляция, итерации), а качество всё ещё зависит от того, насколько богаты библиотеки параметров и референсного кода. Но как направление для построения моделей мира через язык и код это выглядит убедительно.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram