Рекомендательная система может идеально предсказывать следующий клик — и всё равно плохо понимать пользователя.
Человек листает каталог, возвращается к уже просмотренному товару, сравнивает две похожие модели, откладывает покупку, а потом внезапно добавляет вещь в корзину. В такой сессии много пауз, повторных действий и случайных движений. Если обучать симулятор только на следующем действии, он будет копировать отдельные клики, но потеряет логику всего поведения.
Авторы RecVerse предлагают смотреть на покупателя как на участника длинного процесса. ИИ-агент должен видеть экран, помнить ход сессии, постепенно уточнять интересы пользователя и получать оценку за всю траекторию. Для обучения они также выпустили USB — интерактивный набор данных с реальными сессиями покупок.
Почему симуляция покупателя важна
Симулятор пользователя нужен, чтобы проверять рекомендательные системы без постоянных экспериментов на реальных людях. Его можно использовать для:
🟠 проверки новой выдачи товаров до запуска;
🟠 оценки гипотетических изменений интерфейса;
🟠 обучения рекомендательной системы с помощью обучения с подкреплением;
🟠 анализа того, как рекомендации влияют на клики, добавления в корзину и покупки.
Проблема в том, что реалистичный покупатель — это не функция «показали товар → получили клик». Поведение зависит от всей истории сессии. Пользователь мог увидеть нужный товар десять экранов назад, сравнить его с другой вещью и вернуться к нему после просмотра отзывов.
Предыдущие системы решали эту проблему двумя способами. Они либо отбрасывали старые наблюдения, либо складывали всю историю в контекст модели. Первый подход стирает долгосрочные связи. Второй быстро раздувает контекст и не всегда помогает: эксперименты авторов показывают, что после некоторого объёма визуальной истории качество начинает снижаться.
Качество сначала растёт вместе с объёмом визуальной памяти, но затем выходит на плато и немного снижается, тогда как стоимость контекста продолжает увеличиваться.
Есть и другая проблема. Обучение на каждом отдельном действии подталкивает агента слишком буквально повторять журналы поведения. В результате он может начать без остановки изучать товары или, наоборот, почти ничего не делать. Средняя сессия при этом будет далека от реальной.
Что такое RecVerse
RecVerse — визуальный ИИ-агент для симуляции покупателя в мобильном интернет-магазине. На каждом шаге он получает снимок экрана и список доступных действий. Затем модель одновременно решает три задачи:
🟣 какое действие выполнить в интерфейсе;
🟣 какое текущее намерение приписать пользователю;
🟣 что сохранить в памяти.
Действия включают прокрутку, нажатие на товар, переход на страницу товара, возврат назад, добавление в корзину, покупку и завершение сессии. Память тоже считается частью действия. Агент сам решает, когда записать событие и когда обновить общее представление об интересах пользователя.
Архитектура разделяет память на три уровня:
🟣 Рабочая память хранит несколько последних экранов, действий и текущих мыслей. Это краткосрочный визуальный контекст: какие товары только что привлекли внимание и что пользователь сравнивает прямо сейчас.
🟣 Эпизодическая память записывает события текущей сессии. Например: пользователь открыл страницу кроссовок, сравнил цену, вернулся в ленту и снова перешёл к похожей модели.
🟣 Память предпочтений сжимает историю до более общих выводов: пользователь ищет недорогие кухонные товары, предпочитает определённый цвет или избегает конкретного свойства.
RecVerse связывает снимок экрана, три уровня памяти, действие в интерфейсе и обновление памяти в едином цикле.
Такой порядок напоминает человеческое восприятие. Недавний экран нужен для ближайшего решения. События сессии помогают не потерять нить. Обобщённые предпочтения объясняют, почему пользователь выбирает одни товары и игнорирует другие.
Ключевая деталь — память не заполняется по жёстким правилам. Агент учится сам. Он может ничего не записывать после обычной прокрутки, но сохранить событие после подробного просмотра товара или добавления его в корзину.
Почему обучение на всей сессии лучше
Сначала RecVerse дообучают на реальных траекториях методом имитации. Это даёт модели базовое понимание интерфейса и допустимых действий. Затем начинается обучение с подкреплением.
Вместо оценки каждого клика авторы оценивают всю сессию сразу. Для этого используют три сигнала.
Макроуровень отвечает за общий ритм поведения. Сколько было кликов, переходов к товарам, добавлений в корзину и покупок? Насколько эти числа похожи на поведение реальных пользователей?
Микроуровень проверяет содержание выбора. Если пользователь искал обувь, агенту засчитывается выбор товаров из близких категорий, даже если он не открыл ровно тот же товар.
Третий сигнал проверяет формат ответа и возможность выполнить выбранное действие в текущем состоянии интерфейса.
Вместе эти оценки решают разные задачи:
🟠 макронаграда не даёт агенту стать чрезмерно активным или слишком пассивным;
🟠 микронаграда удерживает его в области реального пользовательского интереса;
🟠 проверка формата не позволяет модели генерировать неисполняемые действия.
Для категорий авторы используют трёхуровневую иерархию. Совпадение на уровне «одежда» получает частичное признание, совпадение на уровне «обувь → сандалии» — большее. Это практичнее, чем требовать точного совпадения товара: в настоящем магазине человек может выбрать другой товар той же категории и всё равно вести себя правдоподобно.
USB: среда для настоящего взаимодействия
USB содержит 5 274 реальные пользовательские траектории, почти 70 тысяч действий, более 90 тысяч товаров и 5 222 пользователя. В каждой сессии есть снимки страниц, профиль пользователя, история взаимодействий и разметка действий.
Средняя траектория состоит из 13,24 шага. Каталог разделён на 41 категорию верхнего уровня, 517 категорий второго уровня и 2 256 детализированных категорий.
Распределение товаров в USB по уровням категорий показывает преобладание одежды и одновременно длинный хвост нишевых интересов.
Главное отличие USB от обычных журналов кликов — интерактивная среда. Агент может выбрать действие, которого не было в исходной сессии, и получить соответствующий снимок экрана. Это позволяет действительно запускать многошаговые траектории и обучать модель с подкреплением.
В статическом журнале любое отклонение от исходного действия создаёт проблему: следующего состояния для нового пути просто нет. В USB состояние интерфейса восстанавливается из данных о показанных товарах и расположении элементов.
При этом набор данных заметно смещён в сторону одежды. Это естественно для коммерческого сервиса, но ограничивает выводы о других типах покупок. Поведение пользователя, выбирающего платье, может отличаться от поведения человека, который ищет продукты или электронику.
Результаты
Авторы сравнили RecVerse с текстовыми и визуальными методами. Для оценки использовали две группы показателей.
Первая измеряет, насколько общий стиль поведения похож на реальный. Сюда входят длина траектории, доля кликов, переходов на страницы товаров, добавлений в корзину и покупок.
Вторая оценивает совпадение интересов. Система получает баллы за точные совпадения товаров и за близость категорий.
Обычные текстовые агенты иногда показывали хорошие показатели совпадения товаров, но делали это за счёт слишком высокой активности. Например, они гораздо чаще реальных пользователей кликали и добавляли товары в корзину. Такой агент может казаться точным по отдельным метрикам, хотя его сессии не похожи на человеческие.
RecVerse-GUI с обучением с подкреплением оказался ближе к реальному ритму поведения и одновременно лучше совпадал с намерениями пользователя:
🟣 показатель совпадения товаров вырос с 4,27 у лучшего визуального базового метода до 7,19;
🟣 доля траекторий хотя бы с одним совпадением товара выросла с 5,92 до 10,45;
🟣 иерархическое совпадение категорий увеличилось с 23,11 до 32,64;
🟣 доля кликов достигла 7,78% против 9,08% у реальных пользователей;
🟣 средняя длина сессии составила 16,25 шага против 13,47 у реальных пользователей.
Сравнение методов по отношению к статистике реальных пользователей: RecVerse ближе к области реалистичного поведения и не компенсирует слабое понимание пользователя чрезмерной активностью.
Последняя цифра показывает ограничение подхода. Модель стала лучше понимать интересы, но её траектории всё ещё длиннее человеческих. Она чаще продолжает исследовать каталог и не всегда вовремя завершает сессию.
Что показали дополнительные проверки
Удаление отдельных компонентов памяти ухудшило результаты. Одной рабочей памяти недостаточно: она помогает помнить последние экраны, но не сохраняет общую линию интереса. Удаление памяти предпочтений особенно заметно снижает согласованность действий с намерением пользователя.
Проверка наград дала похожий результат. Без микронаграды агент хуже выбирает товары нужных категорий. Без макронаграды общий ритм становится менее реалистичным.
Удаление уровней памяти и отдельных наград снижает качество: память предпочтений отвечает за долгосрочный интерес, а микронаграда — за точность выбора.
Люди тоже оценивали траектории. В 74% сравнений они предпочитали реального пользователя траектории RecVerse. Для базового визуального метода этот показатель достигал 98%. При прямом сравнении двух симуляторов RecVerse выбирали в 92% случаев.
Разрыв с человеком остаётся. Наблюдатели всё ещё могут отличить машинное поведение от человеческого. Значит, совпадение статистик и категорий ещё не гарантирует естественную сессию. Люди замечают мелкие особенности: странные паузы, повторные переходы, слишком последовательное поведение или неубедительное завершение покупки.
Увеличение модели с 2 до 4 миллиардов параметров улучшило в первую очередь согласованность интересов. Точность, полнота и совпадение категорий выросли, а общий стиль поведения остался примерно реалистичным. Но размер модели не исправил все расхождения: некоторые показатели просмотра и покупки по-прежнему отличаются от человеческих.
Вывод
RecVerse предлагает способ моделировать пользователей. Нужно моделировать целую сессию. Для этого агенту требуются:
🟠 ограниченная краткосрочная память для текущего экрана;
🟠 эпизодическая память для событий сессии;
🟠 память предпочтений для долгосрочного намерения;
🟠 обучение с подкреплением по оценке всей траектории;
🟠 отдельные сигналы для общего ритма и содержания выбора.
Практическая ценность подхода зависит от того, насколько хорошо он переносится на реальные рекомендательные системы. Пока обучение ограничено короткими траекториями до 20 шагов, а данные собраны на одной торговой площадке и в основном описывают одежду.
Тем не менее направление понятно. Симулятор должен быть похож на пользователя не только по числу кликов. Он должен помнить, что уже видел, менять интересы по ходу сессии, иногда ошибаться и вовремя останавливаться. Только такой ИИ-агент может стать полезной средой для проверки рекомендательных систем до их запуска на реальных людях.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram