Когда «средний пользователь» мешает понять продукт
Почти все оценки ИИ-систем и цифровых продуктов страдают одной и той же болезнью. Они проверяют усреднённую абстракцию. Как будто у всех один и тот же уровень опыта, один и тот же стиль общения, одна и та же терпимость к ошибкам, задержкам и странным ответам.
На практике это ломает картину. Новичок в задаче по программированию хочет пояснений и подтверждений. Опытный разработчик — короткий ответ и больше самостоятельности от агента. Один пользователь уйдёт после первой галлюцинации чат-бота. Другой даст ещё шанс. Если вы меряете всё одним числом, вы этого не увидите.
Работа MatrAIx: Simulating the World with 8.3 Billion Persona Agents предлагает другой путь: тестировать продукты на большой популяции симулированных пользователей, у которых есть разные биографии, привычки, ценности, навыки и ограничения. Вместо одного «типичного пользователя» — целый мир персон.
Если вы делаете чат-бота, сайт, приложение или ИИ-ассистента, вам мало знать, «решает ли система задачу». Нужно понимать, для кого именно она решает её хорошо, а для кого — нет.
Что такое MatrAIx
MatrAIx — это большой пайплайн для оценки продуктов с помощью симулированных пользователей. У него три главные части.
Общая схема MatrAIx: как из большой базы персон собрать когорту, прогнать задачи и получить отчёт по подгруппам.
Первая часть — Persona 8B. Это база из 8,3 миллиарда персон. Каждая описана по 1290 категориальным признакам. Там есть базовые вещи вроде возраста, региона, языка и образования. Есть и более тонкие: стиль общения, склонность к риску, интересы, здоровье, цифровые привычки, отношение к ИИ, опыт в инструментах и так далее.
Вторая часть — среды исполнения. Их четыре:
🟠 обзор — персона отвечает на вопросы и анкеты
🟠 чат-бот — персона разговаривает с ИИ-системой
🟠 веб — персона ходит по сайтам
🟠 приложение — персона пользуется настольным или мобильным приложением
Третья часть — библиотека задач. В работе их 1010. Это сценарии для торговли, финансов, медицины, софта и ещё пары десятков областей. Например: как пользователь отреагирует на повышение цены, продолжит ли разговор после ошибки чат-бота, сможет ли найти нужную функцию в приложении, насколько он терпим к задержке ответа.
Коротко:
🟣 8,3 млрд персон в полной популяции
🟣 почти 1 млн персон в открытом наборе
🟣 1290 признаков на одну персону
🟣 4 среды оценки
🟣 1010 задач
🟣 18 189 прогонов в основных экспериментах
Откуда взялись эти «люди»
Здесь самая интересная инженерная часть. Авторы не просто сгенерировали миллиарды случайных профилей. Они старались сохранить зависимости между признаками.
Если выбирать всё независимо, получится чепуха. Например, язык, регион и уровень владения английским начнут сочетаться нелепо. Возраст перестанет согласовываться с образованием и карьерой. Профиль будет выглядеть правдоподобно по отдельным полям, но странно целиком.
Чтобы этого избежать, авторы строят ориентированный ациклический граф зависимостей. У каждого признака есть «родители». Скажем, уровень английского зависит от основного языка и региона. Образование — от возраста. Навыки — от карьеры, среды и других признаков. Потом персона собирается шаг за шагом, по топологическому порядку.
Граф зависимостей между признаками персон: демография и образование тянут за собой навыки, интересы и поведение.
Этот ход не делает симуляцию «настоящими людьми», но не даёт системе массово штамповать внутренне противоречивые профили.
Кроме синтетических персон, есть и персоны с опорой на реальные источники. Их собирали из шести типов данных: биографии из Википедии, истории отзывов Amazon, опрос разработчиков Stack Overflow, General Social Survey, профили PRISM и добровольный опрос самой команды MatrAIx.
В открытый набор попали около миллиона персон:
🟠 599 847 персон с опорой на реальные источники
🟠 400 000 синтетических персон
Прямые идентификаторы удалены. Имена, контакты и прочие явные привязки не публикуются. Остаются только извлечённые признаки и текстовые описания.
Почему 1290 признаков — это не перебор
На бумаге число выглядит комично. Но логика понятна: если вы хотите проверять разные группы людей, описание должно быть достаточно подробным.
Трёхслойная таксономия Persona 8B: пять верхних групп признаков, 16 подгрупп и 55 категорий.
Все признаки разбиты на пять верхних блоков:
🟣 фон: демография, язык, образование, карьера
🟣 психология: ценности, черты личности, взгляды, мотивация
🟣 возможности: доменные знания, навыки, инструменты, программирование
🟣 поведение и взаимодействие: привычки, стиль работы, принятие ИИ
🟣 образ жизни: интересы, культура, еда, здоровье, спорт
Это нужно не для красоты. Идея в том, что вы можете собрать когорту не только по простым фильтрам вроде возраста и региона. Можно выбрать, например, людей с низким доверием к ИИ, высокой ценовой чувствительностью, средним техническим уровнем и предпочтением коротких ответов. Или, наоборот, пользователей, которые любят подробные объяснения и готовы терпеть задержку.
Для продуктовой команды это почти замена хорошему исследовательскому брифу.
Как это проверяли
Одна из главных проблем всех симуляторов пользователей: они могут не следовать выданной персоне. Модель получает профиль «любит шутки, пишет многословно, избегает жаргона», а потом отвечает своим обычным голосом.
Авторы отдельно проверяют именно это — придерживается ли ИИ-агент назначенной персоны.
Они взяли 10 поведенческих атрибутов. Среди них — вежливость, чувство юмора, многословность, использование жаргона, любовь к эмодзи, стиль комментариев в коде, длина имён переменных и другие. Для каждого атрибута сделали испытания во всех четырёх средах: обзор, чат-бот, веб, приложение. Всего вышло 400 прогонов.
Проверка следования персоне: по атрибутам и по средам исполнения.
Результат:
🟣 366 из 400 прогонов
🟣 91,5% случаев
🟣 нужное поведение либо проявлялось, либо правильно подавлялось
Но здесь важны детали.
🟠 лучше всего всё работало в обзоре, чат-боте и вебе
🟠 хуже — в среде приложения
🟠 легче заставить модель что-то выразить, чем от чего-то отказаться
🟠 особенно трудно подавлять «вежливость», если базовая модель по умолчанию воспитанная
Последний пункт показателен. Если персона должна быть резкой и невежливой, модель нередко всё равно скатывается в безопасный, сглаженный тон. То есть персона конкурирует с базовой настройкой модели — и не всегда побеждает.
Это ограничение. Симулятор пользователя здесь зависит от того, какая LLM играет эту персону.
Что показали прикладные задачи
Дальше начинается самое полезное: помогает ли симулятор увидеть различия между группами пользователей.
Авторы прогнали 18 189 испытаний на восьми задачах. Использовали три модели в роли персона-агентов: Claude Opus 4.8, GPT 5.5 и Claude Haiku 4.5.
Один из примеров — чат-бот для планирования питания. Персоны разговаривали с фиксированным помощником и оценивали, готовы ли следовать предложенному плану. Здесь интересно не только итоговое число, но и сами траектории диалога: кто просит замены, кто спорит из-за цены, кто задаёт вопросы о порциях, кто дольше уточняет ограничения.
Графы переходов в диалоге о планировании питания: разговоры по-разному развиваются у групп с разной экономической мотивацией.
Разница между группами видна не только в финальном ответе, но и в том, как они идут к этому ответу. Пользователи с более сильной чувствительностью к цене чаще отвергают предложения как нереалистичные и просят замену. Более обеспеченные пользователи больше обсуждают формат ответа и варианты питания вне дома.
Это шаг вперёд по сравнению с обычным бенчмарком. Там вы бы увидели только: «ответ сгенерирован» или «задача решена». Здесь видно, где именно начинается трение.
Но есть и неприятный момент. В ряде задач итог очень сильно зависел от того, какая модель играет пользователя.
Короткая выжимка:
🟣 в задаче про повышение цены доля колеблющихся пользователей была 98,3% у GPT 5.5, 27,0% у Opus и 83,3% у Haiku
🟣 в задаче про платный план на сайте — 75,8%, 23,2% и 93,9% соответственно
🟣 в задаче про продолжение использования чат-бота после ошибки различия тоже были огромными
То есть одна и та же когорта персон, один и тот же продукт, один и тот же сценарий — а выводы о продукте могут быть противоположными.
Главный практический вывод работы: модель, которая играет пользователя, сама становится частью условий эксперимента. Её нельзя считать нейтральной оболочкой.
Где здесь польза, а где границы
MatrAIx не обещает «цифровых двойников человечества». Это не замена полевым исследованиям, не замена реальным интервью и не основание для решений в чувствительных областях.
Авторы прямо пишут: такие симуляции годятся для предпродакшн-проверок, стресс-тестов, анализа подгрупп и сравнения версий продукта. Но если вы хотите делать выводы о реальных людях, потом всё равно нужна проверка на людях.
У симулированных пользователей есть несколько жёстких ограничений:
🟠 они могут сглаживать различия между группами
🟠 они могут усиливать стереотипы
🟠 они не всегда умеют правдоподобно скрывать информацию, отказываться, уходить из диалога
🟠 на результат сильно влияет базовая модель
🟠 если модель пользователя и тестируемая система близки по устройству, возможен эффект «самоодобрения»
Последний риск особенно важен. Если одна и та же семья моделей играет и пользователя, и систему, вы можете получить завышенную оценку просто потому, что модель «любит» ответы, похожие на свои собственные.
Вывод
MatrAIx двигает оценку ИИ-систем и цифровых продуктов от абстрактного «среднего пользователя» к популяции с разными биографиями и привычками. Вместо одного итогового балла появляется разрез по когортам, подгруппам и сценариям поведения.
Главная идея статьи: оценивать нужно не только способность системы решить задачу, но и то, как по-разному эту же систему воспринимают разные пользователи.
Из работы стоит вынести несколько вещей:
🟣 симуляция пользователей уже годится для ранних продуктовых проверок
🟣 большие популяции персон полезны, если вы хотите искать редкие кейсы и различия между подгруппами
🟣 следование персоне можно довести до уровня около 91,5%, но это не снимает вопроса о правдоподобии
🟣 результат зависит от модели-персонажа настолько сильно, что её нужно всегда указывать в отчёте
🟣 реальные пользовательские исследования такие системы не заменяют, а сужают пространство гипотез перед ними
Если вы строите ИИ-продукт, здесь есть ясная практическая мысль. Прежде чем выпускать систему в мир, полезно прогнать её не по одному бенчмарку и не по одной демке, а по набору разных пользовательских ролей. Не чтобы получить окончательную истину, а чтобы заранее увидеть, где продукт раздражает, теряет доверие или проваливает ожидания конкретных групп.
Именно в этом месте симулированные пользователи становятся рабочим инструментом.
ИИ-обзоры простыми словами
Каждый день читаем свежие статьи об ИИ и пересказываем главное естественным языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день
В Telegram