Где ИИ ошибается в задачах на интеллект
Пазлы и игры давно используют для проверки способностей ИИ. В 1959 году статья специалиста IBM Артура Самуэля популяризировала термин «машинное обучение» на примере алгоритма, который учился играть в шашки; позже такими испытательными площадками стали шахматы и го. В конце 2024 года лучшие модели решали лишь 18% головоломок «Связи» газеты «Нью-Йорк таймс», а к началу 2025-го некоторые справлялись с ними почти безошибочно. Но задачки показывают не только прогресс ИИ: модели по-прежнему путаются в изменённых загадках, визуальных задачах и логике. В материале — семь тестов, на которых человек пока может превзойти ИИ.
Пространственное рассуждение
Первый набор задач проверяет область, где у людей есть заметное преимущество, — пространственное рассуждение. Такие задания знакомы по тестам на коэффициент интеллекта: нужно мысленно повернуть объект и определить, какая из картинок показывает тот же предмет под другим углом.
Хотя современные языковые модели обычно умеют анализировать изображения, с такими задачами они справляются плохо. Разговоры о моделях мира, которые должны помочь ИИ понимать физическую среду, пока не означают, что LLM умеют обращаться с трёхмерными объектами так же, как архитекторы или инженеры-механики.
Правило испытания простое: выбрать вариант, в котором изображён объект из условия задачи, но с другой стороны. Правильный ответ только один.
Рыцари и лжецы
Передовые LLM обладают огромной памятью: во время обучения они увидели колоссальный объём фактов и могут точно воспроизводить многие из них. Это помогает им опережать людей в викторинах, но иногда мешает. Если новая задача похожа на пример из обучающих данных, модель может не заметить небольшое отличие и выдать заученный ответ.
Именно это показало исследование 2024 года, которое провели специалисты Google и Университета Иллинойса в Урбане-Шампейне. Они обучали и проверяли модели на слегка изменённых задачах классического типа «Рыцари и лжецы». Одни персонажи в них всегда говорят правду, другие всегда лгут — нужно определить, кто есть кто.
В задаче приведено утверждение Эдварда: «Мы с Уоллесом одного типа». Чтобы решить её, достаточно установить, какие персонажи говорят правду, а какие лгут, исходя из их реплик.
Похожий эффект проявляется в испытании SimpleBench. Его вопросы напоминают более сложные задачи, с которыми модели, вероятно, сталкивались во время обучения. Люди замечают подвох, а даже самые качественные модели часто ошибаются.
Задачи ARC-AGI
ИИ ошибается не только в трёхмерных визуальных задачах: трудности возникают и с изображениями на плоскости. Это заметно влияет на результаты в самом известном бенчмарке задач-головоломок ARC-AGI.
Здесь нужно вывести абстрактное общее правило из нескольких примеров. Модели лучше решают такие задачи, когда получают сетку не как изображение, а как строку чисел, где закодирован цвет каждой клетки.
Исследования показывают, что даже правильные ответы модели нередко получают с помощью сложных и неприменимых в других случаях правил. Люди же опираются на простые визуальные закономерности. За последний год результаты моделей в ARC-AGI заметно улучшились, однако некоторые задачи, включая приведённую в материале, всё ещё ставят их в тупик.
В испытании нужно изучить три пары сеток, понять правило преобразования левой сетки в правую, а затем раскрасить четвёртую сетку по тому же принципу. Ответ не зависит от ориентации сеток.
Интуитивные ошибки людей
Когнитивные ловушки характерны не только для ИИ. У людей есть собственные ошибки мышления, которых модели могут не допускать. Психологи создали наборы задач, противоположные SimpleBench: человек часто отвечает на них автоматически, а модель подходит к вопросу более обдуманно.
Одни задания используют ошибки в интуитивном понимании математики. Другие сформулированы так, чтобы подтолкнуть к очевидному ответу, который рассыпается при внимательном чтении. В этом разделе предлагается отвечать как можно быстрее.
Когда задачи становятся сложнее
Иногда способность LLM решить головоломку зависит от её масштаба. Исследователи Apple выяснили, что модели отлично проходят простые варианты задачи о Ханойской башне: нужно переносить стопку дисков по одному, ни разу не положив больший диск на меньший.
Похожая картина наблюдается в задачах о переправе через реку, где несколько человек должны перебраться на другой берег по заданным правилам. Но при увеличении числа дисков или людей до шести и более модели начинают ошибаться.
Логические таблицы
В другом исследовании специалисты Вашингтонского университета, Стэнфордского университета и Института Аллена по исследованию ИИ обнаружили похожие трудности у LLM с логическими таблицами. В таких задачах по списку подсказок нужно определить свойства нескольких людей или объектов.
В работе Apple результаты быстро разошлись по сети, однако комментаторы усомнились, показывают ли они особое ограничение рассуждения LLM или лишь обычный эффект: чем сложнее задача, тем больше вероятность ошибки.
В задаче о переправе требуется составить план поездок, который переведёт всех через реку. В логической таблице нужно по списку подсказок определить, кто живёт в каждом доме и какую музыку любит. Решение только одно; для проверки выводов можно отмечать клетки крестиком, а затем — галочкой.
Материал подготовила Грейс Хакинс, журналист MIT Technology Review, имеющая степень доктора философии по нейробиологии. Текст вошёл в выпуск журнала за сентябрь—октябрь 2026 года.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram