i
ДАТАИСТ
Обзор · 2026-02-27

Интерфейс как среда: модель мира для офисных ИИ-агентов

Интерфейс как среда: модель мира для офисных ИИ-агентов

Мы привыкли думать, что работа в офисных приложениях предсказуема: интерфейс детерминированный, кнопки на месте, всё должно быть «как всегда». Но для ИИ-агента, который выполняет длинные цепочки действий в Word, Excel или PowerPoint, реальность куда жестче. Одно неверное нажатие в UI — и можно потерять важный артефакт, испортить документ или уйти в состояние, откуда сложно вернуться. А главное — в реальном desktop-софте почти нет безопасного способа «попробовать и откатить», как в симуляторе.

Авторы работы Computer-Using World Model (CUWM) берутся за проблему, которую давно чувствуют все, кто строит computer-using агентов: агенту нужно уметь заранее прикидывать последствия действий, не нажимая кнопки вслепую. В робототехнике и играх для этого часто используют модель мира — внутренний симулятор, который предсказывает, что будет дальше. Но для интерфейсов desktop-приложений такой симулятор сделать трудно: состояние огромно (скриншоты), изменения часто локальные, но критичные, и ошибка на раннем шаге «тянется хвостом» через весь пайплайн.

Обзор CUWM: сначала модель предсказывает текстовое описание изменения UI, затем по нему «дорисовывает» следующий скриншот.

Идея CUWM: сначала понять, что изменится, потом это нарисовать

Предложенная модель мира называется CUWM. Она получает текущий скриншот интерфейса и кандидата действия (например, «нажми Protect Workbook» или «выдели ячейку B2») и предсказывает следующий UI-стейт. Ключевой ход — разложить задачу на два этапа.

Сначала модель делает текстовое описание того, что важно для принятия решений: что именно поменялось после действия. Например, что открылась панель, активировалась вкладка ленты, появилось диалоговое окно, изменилось выделение или содержимое документа. Затем второй модуль берет исходный скриншот и это описание и синтезирует следующий скриншот, стараясь сохранить неизменные части экрана и аккуратно применить только нужные правки. Такой дизайн экономит «внимание» модели: вместо того чтобы заново рисовать весь интерфейс, она концентрируется на причинно связанных изменениях.

Примеры переходов UI, сгенерированных CUWM: из текущего состояния и действия получается реалистичный следующий экран.

Откуда берутся данные и как модель учат не болтать лишнего

С данными у UI вечная боль: вручную размечать пары «до/после» дорого. Поэтому авторы собирают offline-переходы из реальных взаимодействий агентов с Microsoft Office (датасет на базе GUI-360): тройки вида «скриншот до — действие — скриншот после». А текстовые описания изменений для обучения генерируются автоматически через GPT-5 по паре состояний и известному действию. Так появляется удобная цель: не просто угадать картинку, а сначала научиться кратко и структурно описывать изменение.

Дальше происходит важная донастройка: текстовый модуль дополнительно обучают через RL так, чтобы описания были не только похожи на разметку, но и действительно полезны для UI-среды. В награде учитывается оценка LLM-судьей (насколько описание соответствует эталону по важным аспектам интерфейса) и штраф за длину. Это выглядит прагматично: слишком длинные описания часто расплывчаты и добавляют шум, а слишком короткие теряют критичные детали вроде состояния ленты или активной панели.

«Что будет дальше?»

Главная демонстрация пользы CUWM — режим test-time action search. Идея простая: агент на каждом шаге предлагает несколько действий, CUWM симулирует для каждого «что будет на экране дальше», и уже по этим последствиям агент выбирает лучший вариант. При этом сам агент заморожен — мы не улучшаем LLM, а добавляем ей возможность безопасно «прогнать в голове» последствия.

На уровне качества текстовых переходов видно, что обучение помогает: по оценке LLM-судьи базовая модель получает около 0.60, после SFT — около 0.68, после SFT+RL — немного выше. Но важнее функциональная метрика: насколько текстовое предсказание сохраняет информацию, нужную агенту для следующего шага.

Визуальная часть тоже выигрывает от двухэтапности. Если пытаться генерировать следующий экран только из действия, качество резко хуже. Когда же визуальный модуль получает промежуточное текстовое описание изменения, картинка становится ближе к реальности, улучшается читаемость текста на экране и метрики вроде SSIM/LPIPS/FID. После совместной донастройки (полный CUWM) разрыв становится наиболее выраженным.

Сравнение предсказаний CUWM с истинными следующими состояниями: совпадает компоновка и состояние панелей.

А вот и практический эффект: world-model-guided выбор действий повышает успешность выполнения задач в Office. Авторы показывают улучшения на разных LLM/VLM-агентах; например, для GPT-4o рост порядка нескольких процентов, а для Qwen3-VL-8B — заметнее. Интересная деталь: чисто image-based подсказки от модели мира часто оказываются надежнее, чем комбинация «текст + картинка», возможно из‑за конфликтов между модальностями и накопления шума.

Пример выбора действия в Excel: CUWM симулирует последствия вариантов и помогает выбрать правильный шаг.

Что это меняет и куда смотреть дальше

Работа делает важный шаг к тому, чтобы computer-using агенты начали действовать более осмысленно и осторожно. CUWM показывает, что даже в детерминированном софте нужна модель мира: не потому, что среда случайная, а потому что реальные прогоны дорогие и рискованные.

Сильная сторона подхода — факторизация: отдельно «смысл изменения» и отдельно «визуальная реализация». Это делает модель более интерпретируемой и дает удобную точку контроля через RL: можно выравнивать именно ту часть, которая должна быть структурно аккуратной и полезной для планирования.

Ограничения тоже читаются между строк: датасет пока относительно небольшой, домен — только Office, а комбинирование текста и изображения в планировании иногда мешает. Но как базовый рецепт для симуляции UI-переходов в desktop-среде работа выглядит убедительно: сначала научись кратко объяснять, что изменилось, и только потом рисуй.

Кривая улучшения восприятия текста по эпохам обучения: чем выше, тем лучше читаемость и корректность UI-текста.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram