人工智能與數字教育觀察
AI and Digital Education Spectator

AI在科學評估題表現較佳,是否需要重想評估目標?

研究以54道2019年美國NAEP科學評估題,測試ChatGPT及GPT-4,並按題目的認知複雜性及維度,與四、八及十二年級學生的既有答題資料比較。兩個模型在所測題目普遍優於多數學生。題目要求提高時,學生通常需要更高能力才能答對;模型的表現則大多未呈相同變化。這是模型與既有評估資料的比較,並非人工智能教學介入實驗。

論文原文

Can Generative AI and ChatGPT Outperform Humans on Cognitive-Demanding Problem-Solving Tasks in Science?
研究及來源資料
研究來自哪裏?
University of Georgia、University of Alabama
地域視角
世界各地研究 · 美國
DOI
10.1007/s11191-024-00496-1
期刊/研討會
Science & Education
類型
五十四道NAEP科學題;模型答案與既有學生表現比較
研究/內容地區
美國
學習領域
科學教育
原文日期
2024-01-29
最近核實
2026-09-11
研究來源分類
期刊
作者
Xiaoming Zhai、Matthew Nyaaba、Wenchao Ma
學習階段
小學、中學
研究領域
數學與科學、教學與評估
研究對象
人工智能系統、文獻及資料
分類說明
分析對象是AI模型及既有評估資料,未把歷年考生列作本研究直接招募的參與者。