ИИ улучшает оценки студентов, но не гарантирует обучение
Рандомизированный эксперимент с 1 053 первокурсниками Университета Боккони показал: доступ к GPT-4o заметно повысил оценки за маркетинговое задание. Короткий урок по причинному мышлению не улучшил традиционный балл, зато помог студентам предлагать более разнообразные решения и глубже объяснять причины, допущения и возможные последствия своих идей. При этом исследователи не проверяли, что студенты действительно усвоили без ChatGPT, поэтому рост оценки говорит об улучшении работы с ИИ, а не обязательно об улучшении обучения.
Что проверяли
Исследователи изучали, какие элементы хорошей студенческой работы может улучшить ИИ. В эксперименте участвовали 1 053 первокурсника Университета Боккони. GPT-4o помог студентам получить заметно более высокие оценки за задание по бизнесу, а урок по причинному мышлению подтолкнул их к более необычным и разнообразным решениям.
В ноябре 2025 года 13 групп вводного курса по управлению случайным образом разделили на четыре варианта:
Студенты должны были не более чем в 180 словах подготовить маркетинговые рекомендации для университетского магазина сувениров. На уроке разбирали связную причинную логику, фальсифицируемость и то, каким образом предложенное действие может привести к нужному результату.
Доступ к ChatGPT и обучение критическому мышлению оказывали взаимодополняющее воздействие на работу студентов. Один лишь ChatGPT в основном улучшал традиционные оценки, тогда как педагогическое вмешательство способствовало развитию причинно-следственного мышления и разнообразия идей
Источник: the-decoder.com
Студенты с доступом к GPT-4o получили почти на один балл больше по шкале от 1 до 5. В их ответах в среднем было примерно на две идеи больше, аргументация была логичнее, а рекомендации сильнее совпадали с оценками трёх профильных экспертов.
Даже после того как исследователи учли качество аргументации, число и разнообразие идей, а также свойства текста, преимущество GPT-4o сохранилось. Авторы связывают его с более высоким качеством содержания, а не с тем, что студенты стали больше знать.
Что дал урок по причинному мышлению
Урок не повысил традиционные оценки. В среднем работы таких студентов получили даже немного меньший балл. Зато они чаще объясняли, почему предложенное действие должно сработать и при каких условиях может провалиться. Кроме того, эти студенты предлагали более разнообразные идеи, которые сильнее отличались от ответов однокурсников.
Совместное применение урока и GPT-4o не дало дополнительного прироста традиционной оценки. По показателям причинного мышления оба подхода дополняли друг друга, а повышенное разнообразие идей, характерное для группы с уроком, сохранилось.
Большее число идей, более связная аргументация и разнообразие идей внутри одного ответа были связаны с более высокими оценками. При этом более выраженная фальсифицируемость, подробное объяснение механизма действия предложений и большее отличие от идей других студентов коррелировали с более низкими баллами.
Это не означает, что оригинальность всегда снижала оценку. В рамках этого задания традиционный балл в основном вознаграждал хорошо структурированные ответы, которые оставались в пределах ожидаемого пространства решений. Авторы считают, что разнообразие и оригинальность нужно напрямую включать в критерии оценивания, если от студентов действительно хотят их получать.
Оценка не равна обучению
Современные системы оценивания измеряют проработанность, структуру и полноту работы, но не обучение и понимание. Поэтому ИИ легко использовать как инструмент списывания.
После эксперимента не было проверки, на которой студенты должны были бы без ChatGPT показать, что они поняли и запомнили. Авторы прямо признают: пока неизвестно, связан ли выигрыш GPT-4o с реально полученными студентами знаниями или только с более качественным результатом, подготовленным при помощи ИИ. Исследование показывает улучшение оценённой работы по конкретному заданию, но не улучшение обучения.
Эксперимент проводили только с первокурсниками одного университета и на узкой маркетинговой задаче. Случайное распределение проходило между 13 учебными группами, а не индивидуально среди всех 1 053 участников.
Основной балл выставляли люди, которые не знали, к какой группе относился тот или иной текст. Несколько дополнительных показателей, включая причинное мышление и разнообразие идей, оценивали модели OpenAI и Anthropic.
OpenAI предоставила технологию для исследования и участвовала в его проведении. Несколько авторов работают в OpenAI или были сотрудниками компании во время эксперимента.
Что показывают другие исследования
Накопленные данные указывают: имеет значение не сам факт использования ИИ, а то, помогает ли он студенту думать самостоятельно или заменяет это мышление. Во втором случае результаты студентов ухудшаются.
Исследование, охватившее более 500 000 оценок американских студентов, показало, что после запуска ChatGPT рост высших оценок сильнее всего проявился на курсах с большим объёмом домашних заданий, связанных с письмом и программированием. В контролируемых экспериментах после отключения ИИ участники справлялись хуже контрольной группы. Наиболее заметным падение было у тех, кто в основном использовал GPT для получения готовых ответов.
Похожую картину за более длительный период показало 30-месячное исследование с участием более 26 000 студентов в Китае. С ИИ домашние задания становились лучше и выполнялись быстрее, но результаты экзаменов снижались. На последующих вступительных экзаменах долгосрочное падение составило от 18 до 24 процентов. При этом у студентов, которые проводили на домашних заданиях примерно столько же времени, сколько и пользователи без ИИ, сопоставимого снижения не наблюдалось.
Несмотря на растущее число таких данных, OpenAI в основном представляет результаты как вызов для систем оценивания: если ИИ способен создавать отполированные работы уровня эксперта, один итоговый текст уже меньше говорит о том, что студент действительно понимает.
Авторы предлагают оценивать работы с учётом оригинальности, рассуждения и рассмотрения нескольких подходов, а не только соответствия наиболее обычному или аккуратно оформленному ответу. Это может быть оправданно, однако изменение критериев оценивания, вероятно, потребует перестройки всей системы образования.
Ежедневные новости об ИИ
Каждый день отбираем важные новости об ИИ, роботах и метавселенных и рассказываем главное — без хайпа и воды. Если хотите понимать, что происходит в ИИ раньше остальных, — подписывайтесь.
Только важное — каждый день
В Telegram