人工智能與數字教育觀察
AI and Digital Education Spectator

德國PISA短答研究:AI評分準確,也要檢查不同學生群組是否公平

研究以德國PISA 2015閱讀題的38,722份短答,比較不同自動評分方法,並檢查性別和家庭語言背景的公平性。最準確的方法結合RoBERTa文字表示與支援向量機,未見明顯性別偏差,卻對主要在家使用外語的學生給予略高於人工評分的分數。差異在個別題目更突出,與錯答辨識、學生表現、答案語言差異及試題難度有關,顯示整體準確率未能盡錄群組偏差。

論文原文

Algorithmic Fairness in Automatic Short Answer Scoring
研究及來源資料
研究來自哪裏?
DIPF | Leibniz Institute for Research and Information in Education、Goethe-Institut、Centre for International Student Assessment
地域視角
世界各地研究 · 德國
DOI
10.1007/s40593-025-00495-5
期刊/研討會
International Journal of Artificial Intelligence in Education
類型
自動評分比較;2015年德國PISA共38,722份短答
研究/內容地區
德國
科目
閱讀評估
原文日期
2025-07-24
最近核實
2026-09-11
研究來源分類
期刊
作者
Nico Andersen、Julia Mang、Frank Goldhammer、Fabian Zehner
學習階段
中學
研究領域
教學與評估、共融教育與學生福祉
研究對象
文獻及資料、人工智能系統
分類說明
以既有學生作答資料測試評分系統,並非重新招募學生參與教學實驗;學段按PISA對象列中學,領域屬閱讀及評估。