逾百萬學生資料研究:分區訓練AI,預測成績毋須集中原始紀錄
研究運用逾109萬名學生的考試資料,結合31項學業、教學及社會經濟因素,比較不同成績預測模型。分區訓練只交換模型更新,各區保留原始資料;個人化模型的整體預測表現略高於兩個集中訓練模型。過往成績的預測力最強,環境因素的影響則因地區而異。研究使用模擬分區資料,著重預測準確程度,未測試模型能否改善學生學習。

研究運用逾109萬名學生的考試資料,結合31項學業、教學及社會經濟因素,比較不同成績預測模型。分區訓練只交換模型更新,各區保留原始資料;個人化模型的整體預測表現略高於兩個集中訓練模型。過往成績的預測力最強,環境因素的影響則因地區而異。研究使用模擬分區資料,著重預測準確程度,未測試模型能否改善學生學習。
研究分析美國50所獲評為最具創新性大學的官方網站,以文件分析及主題分析整理生成式人工智能政策。共同做法包括由教師訂定課程規則、要求申報使用情況、保障資料私隱、審慎採用人工智能偵測,以及提供素養培訓。各校在使用許可、工具選擇及管理成熟程度上仍有差異,支援則分布於教學中心、圖書館、資訊科技部門和學術誠信辦公室。
研究透過三項研究、七組資料及逾88萬份文本,分析AI寫作助手與語言多樣性的關係,並比較人類原文及模型潤飾後的文字。AI大致保留核心內容,卻令寫作風格更相似;不同資料及模型中,寫作複雜度的差異縮小21%至50%,部分較佔優勢的作者特徵亦被放大。結果涉及文字特徵及其社會訊息,沒有直接量度學生的長期寫作能力或創造力。
文章檢視AI何時可被視為解釋學習的認知模型,綜合神經網絡、強化學習、認知架構及大型語言模型的研究。作者提出理論根據、量度效度、機制透明、人類學習軌跡、錯誤模式及因果干預等準則,指出單靠準確預測分數不足以解釋學生如何學習。文章屬理論與方法綜述,沒有新學生樣本,所列準則亦不表示現有模型已通過相關驗證。
研究由來自九個地區的作者合作,按2024年QS院校名單蒐集大學公開課程資料,分別整理計算類及人工智能/機器學習化學課程。已有計算課程的院校,亦較常提供人工智能課程;部分院校課程較少,可能涉及資源優次或師資不足。論文並討論課程更新、教師知識及不同持份者的角色。公開課程資料未必完整反映實際教學,也不能直接代表學生能力。
文章結合概念分析及近期研究,探討教師、學生與人工智能如何在回饋過程中合作,重點比較回饋的及時性、準確程度、細節、可理解程度及語氣。分析亦把師生關係和學生參與判斷、回應及修改的過程納入考慮,涉及內地師生資料。文章屬研究綜合,著重釐清不同回饋來源的特點與合作方式,沒有以實驗比較人與人工智能回饋對成績的個別效果。
研究分析南非公立大學於2025年2月公開的生成式AI指引,以透明、責任、私隱、人類自主及共融五項倫理原則編碼。當時46%的大學有全校性指引,對學生披露AI使用及負責任學習的要求較詳細;院校數據治理、教職員責任和共融安排則較簡略,部分只屬建議。研究呈現特定時點的文件內容,沒有驗證各校落實情況或指引對學習的影響。
研究系統整理2015至2025年的28篇實證論文,分析教師與人工智能共同設計學習任務時的理論、工具功能、協作方式及目的。生成式工具較常用於教案、提示和創意構思;傳統人工智能則多涉及分析與回饋設計。工具大多擔任助手或內容生成者,較少成為持續對話及共同修訂的伙伴。選用考慮主要涉及效率、回應能力、創意及公平,相關理論仍較分散。
研究以120道希伯來語高中化學公開試選擇題,測試ChatGPT-4o、Claude 3.5 Sonnet及Gemini 1.5 Pro,並與逾13.9萬名考生的資料比較。三個模型的整體表現均顯著低於學生,圖像及多步推理題尤其困難。研究再由化學教育專家分析最難題目的學科錯誤。結果對應受測版本及特定語言試卷,不能直接代表更新模型的能力。
研究統合2022至2024年的35項實驗,共涉及4,193名參與者,分析ChatGPT對認知及非認知學習成果的影響。整體效果量為0.670,屬中等正面效果,學科、介入時間及教學模式能解釋部分差異,學段及知識類型則未有顯著調節作用。作者同時指出樣本選擇及未充分涵蓋調節因素的限制,平均結果不代表每種工具或課堂均有相同效果。
研究綜合2013至2025年35項實證研究,按事前規劃、任務執行及事後反思,分析規則式、數據驅動及生成式AI的支援效果。整體效果量為0.507,任務執行階段較事前規劃為高;生成式AI部分結果較強,但研究之間差異很大。以行為紀錄量度的效果亦大於自評,顯示教學安排及量度方式會影響結論,短期任務改善未必等同持久的自我調節能力。
文章綜合認知心理學、教育理論及AI倫理,提出在大學課程使用語言模型的教學框架,涵蓋概念理解、推論、評價、後設認知、求知及知識誠信六類過程。八項設計原則包括保留思考難度、將AI回應視為待檢驗的想法,以及交替安排有AI與無AI活動。文中以兩個課堂情境說明應用,屬概念分析,並非已完成課堂驗證的成效研究。
研究以瑞典高中新增的AI科為例,分析政策、課程及支援文件如何界定AI素養。作者採用三維素養模型,分別檢視操作技能、文化脈絡和批判理解,發現文件較重視操作層面,雖包含部分文化理解,讓學生質疑、回應或改變AI實踐的空間則較少。結果反映課程文本的取向,沒有觀察所有教師的課堂實踐,亦不能用來判定學生的實際批判能力。
研究以30篇大學生英文習作,比較一般提示、加入批改專業知識的提示,以及同時提供示例的提示,如何影響ChatGPT辨識語言錯誤。結果顯示,一般提示的表現低於Grammarly;加入專業知識後兩者相若,再加入示例則有較佳表現。進步主要見於用字、直接翻譯、句子結構及代名詞錯誤。不過,即使使用最詳細的提示,ChatGPT仍有部分辨識限制。
文章檢視海外中文文化教材的需要,指出一般人工智能輸出可能出現內容錯誤、拼音或翻譯不足,以及語言程度不合適等問題。作者參照TOTE模型與分級教材原則,設計中文文化教學智能體,把文化內容及學習者程度納入生成過程。研究著重問題診斷和系統設計,摘要未交代參與人數、比較組或學習測試,因此所述應用優勢尚不能等同已證實的學習成效。
研究整理2000至2025年172篇情緒AI實證文獻,並以其中49篇的54項研究進行統合分析。結合認知與情緒支援的知識學習效果量為0.88,只有認知支援則為0.52;在觀感及情緒指標上,結合支援未必佔優。單獨提供情緒支援的證據只有兩項研究,部分情緒結果亦有發表偏差線索。不同工具及任務的差異,限制了對情緒支援本身作用的判斷。
文章綜述人工智能如何支援多語課堂及有特殊教育需要的學生,重點包括即時翻譯、溝通協助和個別化學習材料。文獻呈現學生參與和表現的正面經驗,也指出教師角色及工作量可能隨工具使用而改變。工具能否公平取得、學生資料如何處理,以及應用是否符合倫理要求,均是主要關注。文章整理不同技術的用途與限制,並非針對單一教學介入進行成效比較。
研究以德國PISA 2015閱讀題的38,722份短答,比較不同自動評分方法,並檢查性別和家庭語言背景的公平性。最準確的方法結合RoBERTa文字表示與支援向量機,未見明顯性別偏差,卻對主要在家使用外語的學生給予略高於人工評分的分數。差異在個別題目更突出,與錯答辨識、學生表現、答案語言差異及試題難度有關,顯示整體準確率未能盡錄群組偏差。
研究整理2014年1月至2024年4月的63篇期刊論文,分析高等教育人工智能學習工具的設計,以及認知、技能和情感成果。32篇採用公開工具,31篇自行開發系統;常見用途包括評估、個別回饋和智能導學,部分工具提供多媒體材料。整體而言,知識掌握和情感成果較多呈正面結果,但思考歷程及技能發展的成效差異較大,顯示不同學習成果不能合併看待。
研究系統整理2024年NARST科學教育會議的36篇人工智能相關論文,分析應用方式及挑戰。文獻中的工具逐漸結合多種用途、文字與圖像生成,但大多延續既有科學教育取向,未重新界定其基本方向。主要難題涉及教育目標、學習內容、個別回饋的評估、教師準備,以及偏差與公平。資料限於單一會議,所呈現的是該研究社群的發展,並非全球文獻全貌。
研究系統回顧2014至2024年人工智能在科學及化學教育中的應用,發現2021年後相關文獻增加,常見工具包括ChatGPT及對話機械人。應用涵蓋網上學習、實驗課、多模式教材、跨學科學習及個別支援。文獻同時反覆提出性別與種族偏差、錯誤生成、版權、抄襲、可靠性、技術設備及語言支援等問題。各研究的工具及衡量方式不同,未有統一成效幅度。
研究以系統文獻綜述檢視自我調節學習的量度方法,整理142篇文章所用的行為、情境及生理資料,並對照認知、後設認知、情緒與動機等過程。多類資料的收集日益普遍,但分析往往未能對齊事件的時間與先後次序,情緒和動機亦較少得到充分量度。研究提出AI分析的可能用途,重點在於如何理解學習過程,並非測試聊天工具能否提高學生成績。
研究以系統文獻綜述整理28項智能輔導系統研究,共涉及4,597名中小學生,並分析各項準實驗的設計及介入時間。整體學習與表現結果傾向正面,但與不具智能功能的輔導系統比較時,優勢有所減弱。作者指出,較長介入、更多元樣本及教育倫理仍需研究。綜述涵蓋不同智能系統,不能直接用來評價每一款生成式AI聊天工具。