i
ДАТАИСТ
Обзор · 2026-07-23

Наконец-то ИИ научили месяцами вести сюжет без потери памяти о героях и мире

Обложка: Наконец-то ИИ научили месяцами вести сюжет без потери памяти о героях и мире

Когда персонажи наконец перестают быть картонными

Обычная проблема почти всех литературных ИИ-симуляций такова: персонажи умеют говорить «в образе», но не умеют жить дальше. Они хорошо копируют манеру речи Шерлока Холмса или Элизабет Беннет, но через несколько сцен начинают разваливаться. Кто-то внезапно забывает свои мотивы. Кто-то меняет характер без причины. Мир вокруг тоже ведет себя странно: пожар случился, но дом как стоял, так и стоит; отношения испортились, но в следующей сцене все снова мило беседуют как ни в чем не бывало.

Авторы работы EvolvingWorld решают ровно эту проблему. Они предлагают не просто еще один набор ролевых диалогов, а полноценную схему для долгой симуляции, где персонажи и мир меняются вместе. Не один отвечает, другой слушает, а затем все обнуляется. Нет — история движется, сцены сменяются, объекты в мире меняют состояние, а у героев накапливаются опыт, эмоции и последствия.

Звучит как естественная вещь для интерактивной литературы, игр и ИИ-агентов. Но именно этого, как показывает статья, сейчас чаще всего и не хватает.

Пример симуляции: из одного снимка истории система разворачивает новые сцены, где меняются и персонажи, и сам мир.

Что не так с прежними системами

Авторы честно фиксируют три слабых места у прошлого поколения ролевых систем.

🟠 Персонажи статичны. Обычно у модели есть профиль героя: возраст, характер, стиль речи, может быть цель. Но этот профиль почти не развивается.

🟣 Мир — это декорация. Во многих системах окружение нужно лишь как фон для диалога. Условно: «они в замке» — и хватит. Что происходит с комнатами, вещами, институтами, правилами мира — почти не отслеживается.

🟠 Длинная история ломает качество. На короткой сцене все выглядит прилично. На десятой начинаются провалы: скачки мотивации, потеря связности, случайные переходы между сценами.

Ключевая идея EvolvingWorld — литературный мир надо моделировать как долгий совместный процесс. Герой влияет на мир. Мир влияет на героя. И оба должны хранить состояние не «в общих чертах», а достаточно явно, чтобы на нем можно было строить следующие сцены.

Почему это важно? Потому что без этого нельзя сделать по-настоящему убедительные интерактивные романы, сюжетные игры, симуляторы персонажей и ИИ-агентов для длинных задач. Если модель не умеет держать нить на дистанции, все ее актерское мастерство быстро теряет цену.

В чем суть EvolvingWorld

Архитектура состоит из двух связанных частей.

🟣 Агент персонажа. Он отвечает за поведение героев: кто что хочет, что говорит, как действует, как меняется профиль персонажа после событий.

🟠 Модель мира. Она следит за общим состоянием мира, локациями, значимыми объектами и за тем, как сцены переходят одна в другую.

Главный ход здесь — открытая схема. То есть авторы не заставляют все книги описываться через фиксированный список полей вроде «цель», «эмоция», «отношения». Для детектива важны одни измерения, для викторианской сироты — другие, для готического романа — третьи. Система сама выделяет релевантные измерения под конкретный мир.

Это кажется мелочью, но на деле это важный сдвиг. Фиксированные поля удобны для таблицы, но плохо переносятся между очень разными книгами. А здесь мир «Гордости и предубеждения» не нужно насильно описывать теми же слотами, что мир «Двадцати тысяч лье под водой».

Общая схема EvolvingWorld: от построения данных по книгам до симуляции сцен и оценки длинных траекторий.

Еще одна сильная деталь — так называемый скрытый трекер. Это внутренний буфер, куда складываются слабые сигналы изменений. Например, персонаж один раз усомнился в друге — этого мало, чтобы переписать отношения. Но если такие сигналы повторяются, трекер накапливает их, и в какой-то момент профиль героя уже можно обновить.

Это очень человеческая логика. Личность редко меняется одним событием. Чаще изменения вызревают постепенно. Авторы пытаются встроить именно это.

Как устроена симуляция

Систему разбили на семь задач, которые идут друг за другом внутри каждой сцены.

🟠 Выбрать участников сцены. Кто вообще должен появиться сейчас?

🟣 Выбрать локацию и сценарную завязку. Где происходит сцена и в чем ее драматическая ситуация?

🟠 Обновить мотивацию персонажей. С чем каждый входит в сцену именно сейчас?

🟣 Выбрать следующего говорящего или действующего. Не по кругу, а по логике момента.

🟠 Сгенерировать реплику, мысль или действие.

🟣 Обновить мир после хода. Если в комнате разбили окно или изменилась политическая обстановка, это надо сохранить.

🟠 Обновить состояние персонажей после сцены. Что стало частью устойчивого профиля, а что пока остается слабым сигналом в скрытом трекере.

Эта разбивка важна сама по себе. Многие работы проверяют только «умеет ли модель говорить как персонаж». Здесь подход другой: длинная симуляция — это не одна задача, а конвейер связанных решений. И если ломается одна часть, например обновление мира, проседает и вся дальнейшая история.

Откуда взяли данные

Для бенчмарка исследователи взяли 57 книг с хронологическим повествованием. Это важно: когда история идет по порядку, можно использовать будущие сцены как опору, чтобы понять, какие изменения в текущей сцене были действительно значимыми.

Масштаб получился солидный:

🟣 9 763 сцены

🟠 132 800 взаимодействий

🟣 3 311 уникальных персонажей

🟠 1 888 локаций

🟣 138 596 обучающих примеров

Кроме того, авторы собрали 222 тестовых снимка состояния мира, от которых модель должна продолжить историю дальше.

Корпус охватывает разные жанры: приключения, драму, готику, литературную классику, немного фантастики. Это не современная массовая проза и не игровые миры, но для академического бенчмарка охват уже приличный.

Отдельно полезно, что данные построены не только как «диалог-ответ», а именно как материал для всех семи задач. То есть модель можно учить не просто говорить, но и планировать сцены, выбирать действующих лиц, обновлять мир и профили.

Как это оценивают

Самая интересная часть работы — оценка. Авторы не ограничились локальной проверкой отдельных реплик. Они оценивают траекторию: как ведет себя система на длинной дистанции.

Есть две большие группы метрик:

🟠 Персонажи. Насколько герой последователен, сохраняет стиль речи, действует исходя из мотивации, замечает окружение, плавно развивается.

🟣 Мир. Насколько логично выбираются сцены, кто в них участвует, как поддерживается состояние мира, вовремя ли обновляются глобальные и локальные изменения.

Всего — 10 измерений и 20 метрик. Оценивает это LLM-судья, причем для каждой метрики отдельно, со своей инструкцией. Подход спорный, но для такой длинной и дорогой оценки он сегодня почти неизбежен.

Что важно: авторы стараются ловить не только «красивый текст», но и структурную дисциплину. То есть если модель забыла обновить локацию после важного события или оборвала симуляцию из-за неправильного формата, это тоже отражается в счете.

Что показали результаты

Главный вывод довольно ясный: обучение на EvolvingWorld помогает моделям держать длинную историю заметно лучше, чем обучение только на ролевом диалоге.

Особенно это видно на открытых моделях. Версии, дообученные на EvolvingWorld, почти везде обходят свои исходные базовые варианты и ролевые базовые системы вроде CoSER и Crab. И это логично: если учить только имитации персонажа, модель не учится жить в меняющемся мире.

Самое интересное — где именно приходит выигрыш:

🟣 Плавнее эволюция персонажей. Меньше резких, ничем не обоснованных скачков в профиле.

🟠 Лучше привязка к окружению. Герои чаще реагируют на мир вокруг, а не говорят в пустоте.

🟣 Лучше длинная связность сцен. Следующая сцена чаще выглядит как продолжение предыдущей, а не как случайный новый эпизод.

На стороне модели мира задача все еще заметно тяжелее, чем на стороне персонажей. Это тоже важное наблюдение статьи. Большие модели уже неплохо умеют продолжать повествование, но явно и аккуратно вести структурированное состояние мира им по-прежнему трудно. Видимо, в предобучении такого навыка просто мало.

Сравнение EvolvingWorld и BookWorld по мере роста длины симуляции: новая схема лучше удерживает плавность развития профилей и связность сцен.

Есть и конкретное сравнение с ближайшим предшественником — BookWorld. По общим метрикам EvolvingWorld стабильно впереди, особенно там, где нужно обновлять персонажей и поддерживать связность на дистанции. По сути, новая система выигрывает именно потому, что не ограничивается парой заранее заданных полей и отслеживает мир глубже.

Еще один хороший сигнал — абляции. Когда из системы убирают скрытый трекер, качество обновления профиля падает. Когда заменяют открытую схему на фиксированную, результат тоже ухудшается. Значит, это не декоративные детали, а рабочие компоненты.

Где у подхода границы

Авторы не скрывают ограничения.

🟠 Мир один на всех. Система хранит «объективное» состояние мира, но не отдельные версии мира в головах разных персонажей. А в литературе это часто критично: люди ошибаются, забывают, видят одно и то же по-разному.

🟣 Контекст все равно ограничен. Модель мира отслеживает только важные сущности, а не все подряд. Полная детализация упирается в длину контекста.

🟠 Корпус состоит из произведений общественного достояния. То есть это в основном классика, а не современные романы, игры и пользовательские вселенные.

Но эти ограничения не отменяют главного: работа очень точно показывает, какого именно кирпича не хватало в системах интерактивной литературы.

Что это меняет на практике

EvolvingWorld важен не только как бенчмарк. Он задает более взрослую постановку задачи для ИИ-симуляций.

Если упростить, то раньше индустрия часто спрашивала: «Может ли LLM сыграть персонажа?» Эта работа спрашивает иначе: «Может ли система долго поддерживать развивающийся мир, где персонажи и окружение меняются согласованно?»

Это уже вопрос уровня:

🟣 интерактивных книг и сюжетных игр;

🟠 ИИ-агентов для длинных сценариев;

🟣 симуляторов общества и мультиагентных миров;

🟠 генерации видео и анимации из последовательности сцен.

Кстати, авторы показывают и такой сценарий: структурированные сцены можно потом отдавать в генерацию видео. Это пока скорее демонстрация направления, но направление очень понятное — от текста к длинным, управляемым историям.

Выводы

EvolvingWorld — это попытка перевести ролевые ИИ-системы из режима «красиво отвечает» в режим последовательно развивается.

Главная мысль статьи: для длинной симуляции мало хорошего диалога. Нужны явные состояния персонажей, явные состояния мира, механизм накопления слабых сигналов, отдельное планирование сцен и оценка не по одной реплике, а по целой траектории.

Результаты показывают, что такой подход действительно работает: и персонажи ведут себя стабильнее, и сцены меньше расползаются с длиной истории. Особенно заметен выигрыш у открытых моделей после обучения на новых данных.

До по-настоящему живых литературных миров еще далеко. Но после этой работы стало намного яснее, в какую сторону вообще надо строить такие системы. Не просто учить LLM говорить голосом героя, а заставлять ее помнить, меняться и жить внутри мира, у которого тоже есть память.

ИИ-обзоры простыми словами

Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram