i
ДАТАИСТ
Обзор · 2026-01-03

Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи

Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи

Пока ИИ уверенно решает задачи на логику и пишет код, в реальной жизни люди всё чаще спрашивают его о более приземлённом: что купить в магазине, чем заменить ингредиент в блюде, как починить протекающий кран или какую сборку выбрать в игре. И здесь внезапно выясняется неприятная вещь: бытовые запросы выглядят простыми только на словах. Они завязаны на контекст, на актуальные данные из интернета, на безопасность, совместимость, цены и ссылки. А ещё — на способность не выдумывать.

Авторы работы The AI Consumer Index (ACE) предлагают измерять именно это: насколько ИИ-модели готовы выполнять высокоценные потребительские задачи, где ошибка — это потраченное время, деньги или риск.

Таблица лидеров ACE

Бенчмарк про «обычных людей», а не про олимпиадные вопросы

ACE устроен как набор сценариев из четырёх доменов: Shopping, Food, Gaming и DIY (Сделай сам). В полной версии скрыто 400 задач (по 100 на домен) — это сделано специально, чтобы модели не могли «подучить ответы». Для исследователей отдельно опубликован небольшой открытый датасет из 80 кейсов.

Ключевая идея: задачи не абстрактные. В каждом промте есть персона — кто пользователь и в каких условиях он действует. Без неё ответ легко получится «в среднем по больнице», но бесполезный. Авторы признают, что ради честной оценки в конец промта добавили короткую спецификацию ожиданий: в реальной жизни люди часто так не формулируют, но для сравнения моделей это снижает разночтения.

Пример рубрики для покупок с 9 критериями

Как это делали

Датасет собирали руками доменных специалистов: шеф-поваров и нутрициологов, строителей и инженеров, профессиональных игроков и разработчиков, стилистов и редакторов shopping-медиа. Всего участвовали 47 экспертов, а каждый кейс проходил несколько кругов ревью.

Важно, что для каждого запроса эксперты составляют рубрику — набор проверяемых критериев. Например: есть ли конкретные шаги, соблюдены ли ограничения, даны ли предупреждения по безопасности, подходит ли товар под требования, приведены ли ссылки.

Обзор процесса производства по созданию кейсов для AI Consumer Index. Контроль качества применяется на каждом этапе.

Самая интересная часть — как ловят «правдоподобные выдумки»

ACE не ограничивается проверкой того, что «ответ выглядит разумно». Для Shopping и Gaming многие критерии требуют обоснованности (связи с реальностью): модель должна опираться на найденные веб-источники, а не сочинять.

Оценка устроена иерархически. Сначала проверяется «ядро задачи» — критерии: действительно ли модель решает проблему пользователя, а не просто пишет много полезных советов мимо цели. Если провал — задача обнуляется. Это защищает от ситуации, когда ответ набирает очки на второстепенных деталях, но не делает главное.

Дальше, если критерий требует обоснования, включается логика с штрафом: подтвердил источниками — плюс, не подтвердил — минус. То есть уверенно соврать становится хуже, чем честно не утверждать.

Иерархический процесс оценки критериев в ACE-v1.

Что показали результаты

Авторы прогнали 10 лучших ИИ-моделей с включённым веб-поиском. Каждый промт выполнялся 8 раз, чтобы сгладить случайность, а ответы оценивал отдельный LLM-судья. Всего получилось 32 000 ответов и более 220 000 проверок критериев.

Лучшие результаты в среднем по всем доменам — около 56%: лидирует GPT 5 (Thinking = High) — 56.1%, рядом o3 Pro — 55.2% и GPT 5.1 — 55.1%. Но самое показательное — разброс по доменам. В Food модели чувствуют себя увереннее (у лидера 70.1%), а вот в Shopping даже лучший результат ниже 50% (45.4%). Это довольно близко к интуитивному ощущению пользователей: рецепты и общие советы ИИ даёт неплохо, а вот с покупками всё упирается в точность цен, наличие, версии товаров и корректные ссылки.

Отдельно авторы показывают разрыв между тем, насколько модели «выполняют требования» и насколько хорошо умеют подтверждать факты. Некоторые модели выглядят так, будто стараются быть полезными любой ценой — даже ценой выдумки.

Чистая разница долей успешных ответов: сравнение критериев, связанных с обоснованностью (grounded), со всеми критериями. Отрицательные значения означают, что модели относительно хуже обосновывают ответы (то есть не выдумывают информацию), чем выполняют требования запросов.

Почему это важно и куда бенчмарк двигает индустрию

ACE хорошо подсвечивает неудобную правду: «умение говорить» и «умение помогать» — не одно и то же. В потребительских сценариях ценность создают мелочи: точная цена, рабочая ссылка, совместимость детали, правильное предупреждение по безопасности, учёт вкусов и ограничений. Именно там модели чаще всего оступаются, потому что проще сгенерировать правдоподобный ответ, чем аккуратно проверить факт.

Авторы честно описывают ограничения: проверки обоснованности могут ошибаться из‑за разнообразия сайтов, интернет меняется и требует регулярных перезапусков, а публикация датасета и методики теоретически позволяет «подстроиться под тест». Но в целом ACE выглядит как шаг к более взрослой оценке ИИ, как надежного персонального помощника для каждого.

💾 Код

ИИ-обзоры статей

Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.

Новые обзоры — каждый день.

В Telegram