Почему ИИ не справляется со списком покупок и когда мы сможем доверить ему бытовые задачи

Пока ИИ уверенно решает задачи на логику и пишет код, в реальной жизни люди всё чаще спрашивают его о более приземлённом: что купить в магазине, чем заменить ингредиент в блюде, как починить протекающий кран или какую сборку выбрать в игре. И здесь внезапно выясняется неприятная вещь: бытовые запросы выглядят простыми только на словах. Они завязаны на контекст, на актуальные данные из интернета, на безопасность, совместимость, цены и ссылки. А ещё — на способность не выдумывать.
Авторы работы The AI Consumer Index (ACE) предлагают измерять именно это: насколько ИИ-модели готовы выполнять высокоценные потребительские задачи, где ошибка — это потраченное время, деньги или риск.

Бенчмарк про «обычных людей», а не про олимпиадные вопросы
ACE устроен как набор сценариев из четырёх доменов: Shopping, Food, Gaming и DIY (Сделай сам). В полной версии скрыто 400 задач (по 100 на домен) — это сделано специально, чтобы модели не могли «подучить ответы». Для исследователей отдельно опубликован небольшой открытый датасет из 80 кейсов.
Ключевая идея: задачи не абстрактные. В каждом промте есть персона — кто пользователь и в каких условиях он действует. Без неё ответ легко получится «в среднем по больнице», но бесполезный. Авторы признают, что ради честной оценки в конец промта добавили короткую спецификацию ожиданий: в реальной жизни люди часто так не формулируют, но для сравнения моделей это снижает разночтения.

Как это делали
Датасет собирали руками доменных специалистов: шеф-поваров и нутрициологов, строителей и инженеров, профессиональных игроков и разработчиков, стилистов и редакторов shopping-медиа. Всего участвовали 47 экспертов, а каждый кейс проходил несколько кругов ревью.
Важно, что для каждого запроса эксперты составляют рубрику — набор проверяемых критериев. Например: есть ли конкретные шаги, соблюдены ли ограничения, даны ли предупреждения по безопасности, подходит ли товар под требования, приведены ли ссылки.

Самая интересная часть — как ловят «правдоподобные выдумки»
ACE не ограничивается проверкой того, что «ответ выглядит разумно». Для Shopping и Gaming многие критерии требуют обоснованности (связи с реальностью): модель должна опираться на найденные веб-источники, а не сочинять.
Оценка устроена иерархически. Сначала проверяется «ядро задачи» — критерии: действительно ли модель решает проблему пользователя, а не просто пишет много полезных советов мимо цели. Если провал — задача обнуляется. Это защищает от ситуации, когда ответ набирает очки на второстепенных деталях, но не делает главное.
Дальше, если критерий требует обоснования, включается логика с штрафом: подтвердил источниками — плюс, не подтвердил — минус. То есть уверенно соврать становится хуже, чем честно не утверждать.

Что показали результаты
Авторы прогнали 10 лучших ИИ-моделей с включённым веб-поиском. Каждый промт выполнялся 8 раз, чтобы сгладить случайность, а ответы оценивал отдельный LLM-судья. Всего получилось 32 000 ответов и более 220 000 проверок критериев.
Лучшие результаты в среднем по всем доменам — около 56%: лидирует GPT 5 (Thinking = High) — 56.1%, рядом o3 Pro — 55.2% и GPT 5.1 — 55.1%. Но самое показательное — разброс по доменам. В Food модели чувствуют себя увереннее (у лидера 70.1%), а вот в Shopping даже лучший результат ниже 50% (45.4%). Это довольно близко к интуитивному ощущению пользователей: рецепты и общие советы ИИ даёт неплохо, а вот с покупками всё упирается в точность цен, наличие, версии товаров и корректные ссылки.
Отдельно авторы показывают разрыв между тем, насколько модели «выполняют требования» и насколько хорошо умеют подтверждать факты. Некоторые модели выглядят так, будто стараются быть полезными любой ценой — даже ценой выдумки.

Почему это важно и куда бенчмарк двигает индустрию
ACE хорошо подсвечивает неудобную правду: «умение говорить» и «умение помогать» — не одно и то же. В потребительских сценариях ценность создают мелочи: точная цена, рабочая ссылка, совместимость детали, правильное предупреждение по безопасности, учёт вкусов и ограничений. Именно там модели чаще всего оступаются, потому что проще сгенерировать правдоподобный ответ, чем аккуратно проверить факт.
Авторы честно описывают ограничения: проверки обоснованности могут ошибаться из‑за разнообразия сайтов, интернет меняется и требует регулярных перезапусков, а публикация датасета и методики теоретически позволяет «подстроиться под тест». Но в целом ACE выглядит как шаг к более взрослой оценке ИИ, как надежного персонального помощника для каждого.
ИИ-обзоры статей
Каждый день читаем свежие статьи по ИИ и пересказываем главное человеческим языком — без хайпа и воды. Если хотите понимать, куда движутся ИИ-агенты раньше остальных, — подписывайтесь.
Новые обзоры — каждый день.
В Telegram