人工智能在歷史科評改的應用初探
林玉恬分享校本歷史科AI評改的初步試驗,以十份中四答卷提供示例,再比較教師與模型的評分。她發現模型較易辨認答案有否引用資料及正反論證,卻未能細緻判斷推論是否充分、立場是否一致,部分評分因而偏高。文章建議細化評分指示、增加不同作答風格的樣本及持續校準,並由教師保留專業把關角色。
林玉恬分享校本歷史科AI評改的初步試驗,以十份中四答卷提供示例,再比較教師與模型的評分。她發現模型較易辨認答案有否引用資料及正反論證,卻未能細緻判斷推論是否充分、立場是否一致,部分評分因而偏高。文章建議細化評分指示、增加不同作答風格的樣本及持續校準,並由教師保留專業把關角色。