六千多名初中生試驗:AI錯題輔導的價值取決於練習安排
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
研究將74名四年級醫學生隨機分成兩組,在同一教師教授的青光眼課程中,比較DeepSeek輔助問題導向學習與傳統教學。AI結合問題導向學習組的理論測驗、問診、診斷推理及整體臨床表現較佳,學生同時擔心AI醫療建議不準確。由於工具和教學方式一併改變,結果不能單獨歸因於AI;研究規模及追蹤時間亦有限。
研究以60名小四學生進行六周詩歌寫作活動,實驗組接受ChatGPT形成性回饋並修訂作品,對照組沒有AI支援。控制前測後,實驗組的詩歌寫作評分及對詩歌的態度均較佳。活動由教師引導處理回饋,並非讓學生自行使用聊天工具。研究只涉及一校兩班,沒有長期追蹤,亦未能分離額外回饋、修訂練習與AI本身各自的作用。
研究調查香港中文大學107名社會科學本科生,按認知要求區分AI用途,並以迴歸分析檢視使用頻率與累積平均積點的關係。控制部分人口、態度及家庭因素後,用AI校對、摘要及整理資料等較低階任務與成績呈正相關,中階及高階任務則未見顯著關聯。研究採用單校橫斷問卷,不能確定因果,也沒有直接量度學生的分析能力或概念理解。
研究在354名大學生的入門經濟學課程中,比較助教自行撰寫評語與使用FeedbackWriter建議的評語,共處理1,366篇稿件。助教可採納、修改或刪除AI建議;收到AI輔助評語的學生,修訂稿質素較佳,評語亦較具體可行,但後測成績未見顯著差異。研究的修訂稿評分主要依賴語言模型,並以部分真人評分核對,作品改善未必代表知識保留。