i
ДАТАИСТ
Новости · 2026-08-28

ИИ проваливает эти тесты на интеллект

Пазлы и игры давно используют для проверки способностей ИИ. В 1959 году статья специалиста IBM Артура Самуэля популяризировала термин «машинное обучение» на примере алгоритма, который учился играть в шашки; позже такими испытательными площадками стали шахматы и го. В конце 2024 года лучшие модели решали лишь 18% головоломок «Связи» газеты «Нью-Йорк таймс», а к началу 2025-го некоторые справлялись с ними почти безошибочно. Но задачки показывают не только прогресс ИИ: модели по-прежнему путаются в изменённых загадках, визуальных задачах и логике. В материале — семь тестов, на которых человек пока может превзойти ИИ.

Обложка: ИИ проваливает эти тесты на интеллект

Где ИИ ошибается в задачах на интеллект

Пазлы и игры давно используют для проверки способностей ИИ. В 1959 году статья специалиста IBM Артура Самуэля популяризировала термин «машинное обучение» на примере алгоритма, который учился играть в шашки; позже такими испытательными площадками стали шахматы и го. В конце 2024 года лучшие модели решали лишь 18% головоломок «Связи» газеты «Нью-Йорк таймс», а к началу 2025-го некоторые справлялись с ними почти безошибочно. Но задачки показывают не только прогресс ИИ: модели по-прежнему путаются в изменённых загадках, визуальных задачах и логике. В материале — семь тестов, на которых человек пока может превзойти ИИ.

Пространственное рассуждение

Первый набор задач проверяет область, где у людей есть заметное преимущество, — пространственное рассуждение. Такие задания знакомы по тестам на коэффициент интеллекта: нужно мысленно повернуть объект и определить, какая из картинок показывает тот же предмет под другим углом.

Хотя современные языковые модели обычно умеют анализировать изображения, с такими задачами они справляются плохо. Разговоры о моделях мира, которые должны помочь ИИ понимать физическую среду, пока не означают, что LLM умеют обращаться с трёхмерными объектами так же, как архитекторы или инженеры-механики.

Правило испытания простое: выбрать вариант, в котором изображён объект из условия задачи, но с другой стороны. Правильный ответ только один.

Рыцари и лжецы

Передовые LLM обладают огромной памятью: во время обучения они увидели колоссальный объём фактов и могут точно воспроизводить многие из них. Это помогает им опережать людей в викторинах, но иногда мешает. Если новая задача похожа на пример из обучающих данных, модель может не заметить небольшое отличие и выдать заученный ответ.

Именно это показало исследование 2024 года, которое провели специалисты Google и Университета Иллинойса в Урбане-Шампейне. Они обучали и проверяли модели на слегка изменённых задачах классического типа «Рыцари и лжецы». Одни персонажи в них всегда говорят правду, другие всегда лгут — нужно определить, кто есть кто.

В задаче приведено утверждение Эдварда: «Мы с Уоллесом одного типа». Чтобы решить её, достаточно установить, какие персонажи говорят правду, а какие лгут, исходя из их реплик.

Похожий эффект проявляется в испытании SimpleBench. Его вопросы напоминают более сложные задачи, с которыми модели, вероятно, сталкивались во время обучения. Люди замечают подвох, а даже самые качественные модели часто ошибаются.

Задачи ARC-AGI

ИИ ошибается не только в трёхмерных визуальных задачах: трудности возникают и с изображениями на плоскости. Это заметно влияет на результаты в самом известном бенчмарке задач-головоломок ARC-AGI.

Здесь нужно вывести абстрактное общее правило из нескольких примеров. Модели лучше решают такие задачи, когда получают сетку не как изображение, а как строку чисел, где закодирован цвет каждой клетки.

Исследования показывают, что даже правильные ответы модели нередко получают с помощью сложных и неприменимых в других случаях правил. Люди же опираются на простые визуальные закономерности. За последний год результаты моделей в ARC-AGI заметно улучшились, однако некоторые задачи, включая приведённую в материале, всё ещё ставят их в тупик.

В испытании нужно изучить три пары сеток, понять правило преобразования левой сетки в правую, а затем раскрасить четвёртую сетку по тому же принципу. Ответ не зависит от ориентации сеток.

Модельсложное и неприменимое правило
Человекпростая визуальная закономерность

Интуитивные ошибки людей

Когнитивные ловушки характерны не только для ИИ. У людей есть собственные ошибки мышления, которых модели могут не допускать. Психологи создали наборы задач, противоположные SimpleBench: человек часто отвечает на них автоматически, а модель подходит к вопросу более обдуманно.

Одни задания используют ошибки в интуитивном понимании математики. Другие сформулированы так, чтобы подтолкнуть к очевидному ответу, который рассыпается при внимательном чтении. В этом разделе предлагается отвечать как можно быстрее.

Когда задачи становятся сложнее

Иногда способность LLM решить головоломку зависит от её масштаба. Исследователи Apple выяснили, что модели отлично проходят простые варианты задачи о Ханойской башне: нужно переносить стопку дисков по одному, ни разу не положив больший диск на меньший.

Похожая картина наблюдается в задачах о переправе через реку, где несколько человек должны перебраться на другой берег по заданным правилам. Но при увеличении числа дисков или людей до шести и более модели начинают ошибаться.

18%доля решённых головоломок «Связи» в конце 2024 года
6 и большечисло дисков или людей, после которого модели начинают ошибаться

Логические таблицы

В другом исследовании специалисты Вашингтонского университета, Стэнфордского университета и Института Аллена по исследованию ИИ обнаружили похожие трудности у LLM с логическими таблицами. В таких задачах по списку подсказок нужно определить свойства нескольких людей или объектов.

В работе Apple результаты быстро разошлись по сети, однако комментаторы усомнились, показывают ли они особое ограничение рассуждения LLM или лишь обычный эффект: чем сложнее задача, тем больше вероятность ошибки.

В задаче о переправе требуется составить план поездок, который переведёт всех через реку. В логической таблице нужно по списку подсказок определить, кто живёт в каждом доме и какую музыку любит. Решение только одно; для проверки выводов можно отмечать клетки крестиком, а затем — галочкой.

Материал подготовила Грейс Хакинс, журналист MIT Technology Review, имеющая степень доктора философии по нейробиологии. Текст вошёл в выпуск журнала за сентябрь—октябрь 2026 года.

Ежедневные новости об ИИ

Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.

Только важное — каждый день

В Telegram