i
ДАТАИСТ
Обзор · 2026-02-03

Open-source наносит ответный удар: Управляемая симуляция мира, которая работает в реальном времени

Open-source наносит ответный удар: Управляемая симуляция мира, которая работает в реальном времени

Ещё недавно модели научились генерировать видео по тексту с несколькими секундами связного движения. Но стоит попросить такую систему пройти вперёд, оглянуться и вернуться к знакомому объекту — чуда не происходит. Объекты меняются местами, детали «плывут», а причинно‑следственная логика уступает статистическим совпадениям. Именно этот разрыв между красивой картинкой и настоящей симуляцией мира авторы работы называют одной из главных проблем на пути к полноценным моделям мира.

LingBot-World — попытка сделать шаг от text-to-video к интерактивному text-to-world: системе, которая не просто генерирует ролик, а поддерживает управляемое, устойчивое и достаточно правдоподобное «проживание» в сцене. Причём важная часть замысла — открытость: и код, и веса опубликованы, чтобы сократить дистанцию между open-source и закрытыми решениями.

Данные: где взять «опыт» для интерактивного мира

Самая болезненная часть любой интерактивной модели — данные. Красивых видео в интернете много, но в них почти никогда нет связки «действие → реакция мира», а без этого сложно научить модель действовать в среде. Авторы решают задачу гибридно: собирают обычные реальные видео, добавляют игровые записи, где известно, какие клавиши нажимались и как двигалась камера, и расширяют всё синтетикой из Unreal Engine. В синтетике особенно ценны точные параметры камеры и возможность генерировать нужные траектории: например, развороты на 360 градусов или возвращение к объектам, чтобы проверять пространственную память.

Дальше идёт «доводка» данных: фильтрация, нарезка на клипы, семантическая оценка качества и движения, а также приближённая геометрическая разметка для обычных видео, где параметры камеры неизвестны. Наконец, поверх этого строится иерархическая текстовая разметка: отдельные подписи для общего сюжета, отдельно — для статической сцены без действий, и отдельно — плотные временные описания по интервалам. Логика простая: если смешать всё в одну подпись, модели трудно понять, что в сцене является «декорацией», а что — результатом действия или движения камеры.

Сбор игровых и синтетических данных: захват кадров синхронизирован с действиями и состояниями камеры, чтобы модель училась причинным связям.
Профилирование данных: фильтрация, семантическая оценка и геометрические метки превращают сырой видеопоток в материал для обучения модели мира.

Как из генератора видео делают управляемую модель мира

Ключевая идея LingBot-World — не пытаться создать симулятор с нуля, а вырастить его из сильной видеомодели через несколько этапов. Сначала берётся мощный открытый генератор видео (в статье упоминается Wan2.2 image-to-video diffusion на 14B параметров) как источник визуального качества и базовой связности. Затем модель доучивают так, чтобы она лучше держала долгий контекст, меньше забывала структуру сцены и начала следовать действиям пользователя. На этом этапе появляется Mixture-of-Experts: два «эксперта», один лучше держит глобальную структуру, другой — детали. Это попытка одновременно сохранить стабильность и качество картинки.

Действия подаются в модель явно: есть дискретные сигналы вроде W/A/S/D и непрерывное вращение камеры, которое кодируется специальными представлениями. Чтобы управление действительно влияло на генерацию, действия «вплетаются» в слои сети через адаптивную нормализацию. При этом авторы стараются не разрушить уже выученную визуальную часть: базовые блоки замораживаются, а обучаются в основном адаптеры, отвечающие за управление.

Но есть ещё одна преграда — скорость. Классические diffusion-модели тяжёлые для интерактива: ждать рендеринга по несколько секунд (или минут) — не вариант. Поэтому третий этап посвящён переводу системы в причинный, потоковый режим и дистилляции в несколько шагов. Итоговая версия LingBot-World-Fast заявлена как работающая в реальном времени с задержкой меньше секунды при 16 fps.

Многоэтапное обучение: от базового видеоприора к управляемости и долгой памяти, затем — к причинной архитектуре и ускорению для real-time.
Два ключевых инженерных шага: причинное блочное внимание для потоковой генерации и дискриминаторная голова, помогающая бороться с дрейфом качества на длинных траекториях.

Получилась «почти игра»: длинная память и управляемость

По описанию авторов, сильная сторона LingBot-World — сочетание трёх вещей, которые редко встречаются вместе в open-source: разнообразие доменов, длинный горизонт и высокая динамика при интерактивной скорости. В демонстрациях модель удерживает согласованность сцен на масштабе минут: ориентиры не «перерисовываются» после того, как вышли из кадра, а некоторые скрытые процессы продолжаются правдоподобно, даже если их не видно.

Возникающая память: примеры, где ориентиры сохраняются после долгого отсутствия в кадре, а скрытая динамика остаётся согласованной.

Есть и количественная часть: на VBench для длинных (больше 30 секунд) видео модель показывает особенно заметный выигрыш по Dynamic Degree, то есть по насыщенности и правдоподобию движения. При этом показатели плавности движения и мерцания остаются конкурентными, что важно для ощущения «живого» мира, а не набора кадров.

Отдельно любопытны прикладные сценарии. Во-первых, мир можно «ветвить» промтами: менять погоду, стиль или добавлять локальные события вроде фейерверков, не ломая геометрию и динамику. Во-вторых, авторы показывают связку с агентом действий: LLM (Qwen3-VL-2B) предсказывает последовательность действий на несколько секунд вперёд, а модель мира разворачивает по ним видео. В-третьих, из сгенерированных роликов можно строить 3D-реконструкции: облака точек выглядят достаточно согласованными, что косвенно подтверждает, что модель не просто рисует, а поддерживает более стабильное представление сцены.

Управляемые промтами события: глобальные изменения вроде «зимы» и локальные вмешательства вроде «фейерверков», при сохранении согласованности мира.

Открытость — плюс, ограничения — честные

Работа производит впечатление прежде всего тем, что авторы не прячут систему: заявлен полный open-source пайплайн, веса и код инференса. Это важный шаг для сообщества, которое хочет не только смотреть на красивые ролики, но и строить поверх них инструменты — от генерации контента до тренировочных сред для embodied AI.

При этом ограничения обозначены понятно. Память возникает в основном из контекстного окна, без отдельного модуля, поэтому на очень длинных сессиях возможны расползания. Инференс всё ещё дорогой и требует серьёзных GPU. Пространство действий пока относительно узкое: навигация и базовые движения, без точных манипуляций объектами. И, наконец, пока речь идёт о single-agent перспективе, без полноценной мультиагентной системы.

В сумме LingBot-World выглядит как мост между видеогенерацией и интерактивной моделью мира: не идеальная «игра мечты», но уже инструмент, с которым можно экспериментировать, сравнивать, улучшать и, главное, делать это открыто.

💾 Код

🤖 Модель


ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram