Исследование на 1053 первокурсниках университета Bocconi выглядит как маленький эксперимент с большими последствиями. Студентов разделили на четыре группы: без вмешательств, с уроком по причинно-следственному мышлению, с доступом к GPT-4o, и с обоими инструментами сразу. Задание было простым — написать маркетинговые рекомендации для университетского магазина в пределах 180 слов. Разница получилась разительной.
Студенты с доступом к GPT-4o получили оценки почти на целый балл выше по пятибалльной шкале. Их тексты содержали в среднем на две идеи больше, были логичнее выстроены и точнее совпадали с рекомендациями профильных экспертов. Даже когда исследователи убрали из расчёта качество аргументации, количество идей и их разнообразие, преимущество GPT-4o осталось заметным. Авторы связывают это с повышением качества контента как такового — не со знаниями, которые студенты приобрели.
А вот урок по причинному мышлению традиционные оценки не поднял — работы этой группы получили баллы даже немного ниже среднего. Но эти студенты чаще объясняли, почему предложенное действие должно сработать и при каких условиях оно может провалиться. Они генерировали более разнообразные идеи, расходящиеся с тем, что писали одногруппники. Иначе говоря: урок учил думать, а не писать красиво — и система оценивания этого просто не заметила.
Ключевая деталь — то, как устроена сама рубрика оценивания. Больше идей, более связная аргументация и разнообразие внутри одного ответа коррелировали с высокими баллами. А вот более строгая проверяемость утверждений, подробное объяснение механизма работы идеи и расхождение с ответами других студентов — коррелировали с оценками ниже. Система оценки вознаграждает структуру, полировку и завершённость — но не понимание и не оригинальность. Именно это делает AI удобным инструментом для обмана системы: он умеет производить убедительный, хорошо оформленный текст лучше, чем способность реально рассуждать.
Важная оговорка: в этом исследовании не проверяли, что осталось у студентов в голове после того, как AI забрали. Сами авторы признают: неясно, отражает ли преимущество GPT реальные знания или просто более качественный вывод текста с помощью машины. Но другие работы эту дыру закрывают. Исследование более 500 000 оценок американских студентов показало, что лучшие оценки после запуска ChatGPT росли сильнее всего именно в курсах с большим объёмом письменных и программистских домашних заданий — там, где легче всего переложить работу на нейросеть. Контролируемые эксперименты показали, что после отключения AI участники справлялись хуже контрольной группы, и хуже всех — те, кто использовал GPT как машину готовых ответов. А 30-месячное исследование более 26 000 студентов в Китае показало отложенный эффект: домашние задания становились лучше и быстрее, но результаты экзаменов падали на 18–24% в долгосрочной перспективе.
OpenAI, чьи сотрудники участвовали в исследовании, предпочитает интерпретировать результат как вызов системам оценивания. Если AI способен производить экспертный по виду текст, сам финальный продукт говорит всё меньше о реальном понимании автора. Формально это верно. Но переписать критерии оценки, скорее всего, означает переписать всю систему образования вокруг них — а это задача совсем другого масштаба, чем один эксперимент на 13 группах первокурсников.
Во что углубиться:
- 26 000-студенческое исследование в Китае про отложенный эффект AI на экзаменах: как считали разрыв в 18-24%
- Как устроена рубрика оценивания причинного мышления в вузах и почему её сложно автоматизировать
- Эффект AI на программистские и письменные курсы в американских университетах после запуска ChatGPT
