AI在科學評估題表現較佳,是否需要重想評估目標?
研究以54道2019年美國NAEP科學評估題,測試ChatGPT及GPT-4,並按題目的認知複雜性及維度,與四、八及十二年級學生的既有答題資料比較。兩個模型在所測題目普遍優於多數學生。題目要求提高時,學生通常需要更高能力才能答對;模型的表現則大多未呈相同變化。這是模型與既有評估資料的比較,並非人工智能教學介入實驗。
論文原文
Can Generative AI and ChatGPT Outperform Humans on Cognitive-Demanding Problem-Solving Tasks in Science?研究及來源資料
研究來自哪裏?
University of Georgia、University of Alabama
發現資料有誤?提供更正資料