i
ДАТАИСТ
Обзор · 2026-05-10

Синтетические компьютеры учат агентов работать неделями

Обложка: Синтетические компьютеры учат агентов работать неделями

Большая проблема современных ИИ-агентов в том, что мы тестируем их на задачах, а работать им приходится в контексте.

У ИИ появился новый полигон: не просто задача, а целый чужой компьютер

Большая проблема современных ИИ-агентов в том, что мы тестируем их на задачах, а работать им приходится в контексте. Не в вакууме, не в аккуратной песочнице с парой файлов, а в настоящем цифровом хаосе: папки, старые версии документов, таблицы, письма, черновики, непоследовательные названия файлов, замечания коллег, забытые вложения и дедлайны, которые накладываются друг на друга. Именно там и ломается магия красивых демо.

Авторы работы Synthetic Computers at Scale for Long-Horizon Productivity Simulation предлагают амбициозный ход: если реальные рабочие компьютеры использовать нельзя из‑за приватности и цены сбора данных, давайте синтезировать их. Не просто отдельные документы, а целые пользовательские среды — с файловой системой, профессиональными артефактами, историей работы и задачами на месяц вперёд. А затем запускать внутри них длинные симуляции, где агент должен не только что-то написать, но и реально “жить” в этом компьютере: искать нужные файлы, общаться с коллегами, исправлять ошибки, собирать пакет материалов и доводить дело до результата.

Идея звучит как следующий логичный шаг после игрушечных бенчмарков. И, что важнее, авторы показывают, что из таких симуляций можно извлекать полезный опыт, который потом действительно улучшает поведение агентов.

Что именно придумали исследователи

Ключевая идея статьи — создавать синтетические компьютеры, то есть правдоподобные пользовательские среды, собранные на основе персоны. Персона — это описание человека: профессия, стаж, стиль работы, типичные документы, инструменты, привычки организации файлов. Из этой заготовки модель разворачивает подробный профиль пользователя, а затем строит содержимое его компьютера.

Это не просто генерация случайной папки “Документы”. Сначала для пользователя задаются правила: как он называет файлы, где хранит рабочие материалы, насколько он аккуратен, любит ли версии вроде _v2_ и _FINAL_, складывает ли всё на рабочий стол или раскладывает по проектам. Потом по этому профилю планируется файловая система: какие каталоги должны существовать, какие файлы в них лежат, какие из них связаны друг с другом и какой документ из какого вырос.

Общая схема метода: из персоны создают синтетический компьютер, а затем используют его как среду для длинной рабочей симуляции.

Важный момент: файлы здесь не независимы. Таблица с прогнозами может быть основана на загруженном отчёте, презентация — на этой таблице, финальный PDF — на черновике документа. То есть исследователи пытаются моделировать не просто набор файлов, а историю работы, в которой артефакты зависят друг от друга.

После этого в дело вступают два агента. Один формирует цели на период примерно в месяц работы конкретного пользователя. Второй играет роль этого пользователя и должен выполнить задачи, работая внутри синтетического компьютера. Это уже не “напиши краткое резюме отчёта”, а что-то вроде: собери обновлённую финансовую модель, подготовь презентацию для инвесткомитета, обработай комментарии коллег, создай финальный PDF и согласуй пакет с условным отделом комплаенса.

Как выглядит такой синтетический компьютер

Наиболее сильная часть статьи — внимание к бытовому реализму. Исследователи не ограничиваются общими словами про “профессиональные файлы”, а действительно собирают содержательно насыщенные среды. В примере с финансовым консультантом на диске появляются прогнозы по классам активов, клиентские досье, черновики инвестиционных меморандумов, таблицы со сценарным анализом, презентации, PDF-отчёты, данные из внешних источников и даже макросы для Excel.

Как строится синтетический компьютер: от персоны и профиля пользователя к структуре папок, файлам и связям между ними.

Сами артефакты тоже не выглядят как заглушки. Авторы отдельно показывают, что это полноценные документы и таблицы, а не пустые файлы с правдоподобным названием. Для части публичных материалов система пытается скачать реальные документы из сети; если не выходит, синтезирует их сама. Остальные файлы создаются агентом с инструментами для генерации офисных форматов.

Примеры созданных артефактов: рабочая таблица и финальный профессиональный PDF в синтетическом компьютере.

Почему это важно? Потому что производительность агента в реальной работе упирается не только в качество текста. Ему нужно удерживать длинную цепочку зависимостей: откуда взялась цифра, какая версия документа актуальна, кто попросил конкретную правку, где лежит исходный файл, что уже обещали клиенту и что нельзя менять без согласования. Именно такого рода контекст почти всегда вырезается из коротких задач, и именно он определяет успех в долгой работе.

Длинные симуляции вместо коротких задач

После создания среды начинается, пожалуй, самое интересное: агенту дают не одну задачу, а целый пакет рабочих обязательств на 20 рабочих дней. Причём цели завязаны на конкретный компьютер и конкретного пользователя. Если это старший финансовый консультант, задачи будут связаны с обновлением модельных портфелей, адаптацией нового клиента, меморандумами, комплаенсом и внутренними комитетами. Если другая профессия — сценарий меняется.

Особенно ценно, что авторы моделируют сотрудничество. В симуляции есть коллеги, начальники, клиенты, внешние контрагенты. У каждого — своя роль, стиль общения, знания и иногда даже приватные материалы, которые агент получает только через взаимодействие. Это делает задачу гораздо ближе к настоящей работе: не всё известно заранее, часть информации надо запросить, уточнить, получить с задержкой и встроить в процесс.

Средняя симуляция получилась действительно длинной: 2272 хода и 8,59 часа агентного времени на один запуск. Это уже не похоже на обычные бенчмарки с 10–30 шагами. По ходу работы агент планирует неделю, затем выполняет задачи по дням, читает файлы, создаёт новые, редактирует существующие, пишет сообщения коллегам и реагирует на ответы.

Это важный сдвиг в постановке задачи. Здесь оценивается не только “может ли модель решить проблему”, но и как она работает в развёрнутом процессе: умеет ли держать состояние, исправлять курс, использовать внешние материалы и не терять нить проекта после сотен шагов.

Масштаб эксперимента и что получилось

Авторы создали 1000 синтетических компьютеров с разными персонами. До симуляции на одном таком компьютере было в среднем 111,6 файла, после месяца работы — уже 197,4. То есть агент не просто создавал итоговый документ, а реально наращивал рабочую среду новыми артефактами.

Интересна и структура файлов: форматы вроде DOCX, XLSX, PDF и PPTX составили 67,8% всех файлов. Это хороший сигнал: среда действительно похожа на офисную продуктивную работу, а не на абстрактный набор текстов.

Для оценки качества авторы не ограничились субъективным впечатлением. Для 100 компьютеров они построили подробные рубрики и проверяли итоговые результаты по множеству критериев: наличие всех нужных файлов, согласованность цифр между документами, качество аргументации, соблюдение требований коллег, корректность оформления и так далее. Большинство результатов попали в диапазон 60–80% от максимума. Это значит, что агент уже может пройти значительную часть пути, но до надёжного офисного исполнителя ему ещё далеко.

Распределение оценок по рубрике: по компьютерам в целом и по отдельным рабочим результатам.

И это, пожалуй, самая честная часть работы. Авторы показывают не только успехи, но и характерные провалы. В приложении к статье разбирается реальная симуляция, где агент в целом справился, но допустил типичную для длинной работы катастрофу: потерял согласованность между документами. Цифры в таблице, PDF и презентации начали расходиться. Где-то не были внесены замечания коллег. Где-то остались пустые сообщения вместо ответов. Очень узнаваемый паттерн: не фатальная “глупость”, а накопление мелких несогласованностей, из которых и состоит большинство реальных рабочих ошибок.

Можно ли на таком опыте учить агента лучше

Самое практичное в статье — не сама симуляция, а попытка превратить её в механизм самоулучшения. После каждого длинного прогона исследователи делают ретроспективный разбор: что агент делал правильно, где ошибался, какие повторяющиеся сбои характерны для конкретной профессии. Из этих сигналов они создают “навыки” — внешние инструкции и правила поведения для агентов определённого типа.

Например, для финансовых аналитиков в такой навык могут войти правила вроде: держать единый источник истинных чисел, не менять методологию без распространения правки по всем зависимым файлам, проверять, что презентация, меморандум и модель не расходятся между собой, отдельно отслеживать комплаенс-требования и версии документов.

На отложенной выборке из 100 новых синтетических компьютеров такие навыки дали заметный эффект. Средняя оценка выросла с 61,6% до 68,6%, то есть на 7 процентных пунктов. В парных сравнениях улучшенный агент оказался лучше базового в 83 случаях из 100.

Проверка на внешнем бенчмарке: опыт из синтетических компьютеров переносится и на независимые продуктивные задачи.

Ещё интереснее, что перенос сработал и вне собственной среды авторов — на внешнем бенчмарке GDPVal с 220 задачами. Там задачи намного короче и устроены иначе, но навыки, извлечённые из длинных симуляций, всё равно улучшили результат. Это важный сигнал: модель учится не просто “играть в этот конкретный симулятор”, а усваивает более общие рабочие паттерны.

Почему эта работа важна

Вокруг агентных систем сегодня много шума, но почти все упираются в один и тот же предел: на коротких сценариях всё выглядит убедительно, а в длинной работе ломается память, структура и дисциплина исполнения. Эта статья бьёт точно в этот болевой узел.

Её главный вклад не в том, что авторы сделали ещё один бенчмарк. Они предложили инфраструктуру для следующего этапа развития агентов: масштабируемую генерацию рабочих миров, где можно безопасно и массово получать длинные траектории поведения без доступа к частным пользовательским данным. Если это действительно масштабируется до миллионов персон и компьютеров, появляется новый источник данных для обучения: не просто ответы на запросы, а целые истории профессиональной работы.

Это важно и для индустрии, и для исследований. Для индустрии — потому что реальные корпоративные сценарии почти всегда завязаны на файловую систему, версии документов и взаимодействие с людьми. Для исследований — потому что здесь можно изучать не только конечный ответ, но и процесс: планирование, навигацию по среде, использование файлов, обработку обратной связи, восстановление после ошибок.

Конечно, ограничений у подхода хватает. Синтетические компьютеры всё ещё слишком аккуратны по сравнению с реальными. Коллеги в симуляции пока скорее реактивны, чем автономны. Оформление документов может быть однообразным. Но это скорее дорожная карта, чем приговор методу.

Вывод

Synthetic Computers at Scale — одна из тех работ, которые выглядят менее эффектно, чем очередной громкий релиз модели, но потенциально значат больше. Она предлагает смотреть на обучение агентов не как на набор отдельных задач, а как на погружение в реалистичную рабочую среду со всем её беспорядком, историей и зависимостями.

Главный вывод статьи простой: если мы хотим агентов, способных действительно помогать в продуктивной работе, им нужно тренироваться не на стерильных промптах, а в мирах, похожих на наши компьютеры. И чем длиннее, грязнее и реалистичнее будет этот опыт, тем выше шанс, что модель научится не только красиво отвечать, но и доводить сложную работу до конца.

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день

В Telegram