文章目錄
更多篩選 · 已選1項
AI提升作業評分,因果推理訓練拓闊構思
研究將1,053名一年級經濟、管理及金融本科生分配至因果推理訓練、ChatGPT、兩者兼有或對照條件,要求他們處理真實商品營銷問題。AI提高作業評分、文字連貫性及構思數量;推理訓練未顯著提高評分,卻增加機制分析及構思多樣性,兩者並用保留了相關作用。研究集中一次作業及特定評準,沒有測量移除工具後的知識保留或長期能力。
六千多名初中生試驗:AI錯題輔導的價值取決於練習安排
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
把AI變成提問伙伴:八步探究流程的課堂試行
研究在大學生態學課程試行八步AI探究流程,交替安排AI探索、查核文獻、修訂及人類回饋,分析45名學生的評分和反思。所有步驟的有用程度評分中位數均為「幫助很大」,但步驟間差異很小,校正多重比較後未見個別步驟的顯著差異。學生認為AI有助收窄構思,文獻閱讀及回饋亦支持進展。研究沒有對照組或獨立能力前後測,結果主要反映使用經驗。
查資料、代寫、修文:AI用法與自評批判思考的關係不同
研究調查342名中國大學生,分析AI查資料、生成內容及修訂文字,與自評批判思考的關係。查資料呈正相關,生成內容呈負相關,修訂文字則未見顯著關聯。內在動機加強查資料的正向關聯,亦加強生成內容的負向關聯;外在動機則減弱後者。研究採用一次自陳問卷,沒有客觀思考測驗,認知負荷亦未直接量度,不能據此確定AI造成能力改變。
AI預測答對率,能否解釋學生怎樣學?教育心理學提出效度要求
文章檢視AI何時可被視為解釋學習的認知模型,綜合神經網絡、強化學習、認知架構及大型語言模型的研究。作者提出理論根據、量度效度、機制透明、人類學習軌跡、錯誤模式及因果干預等準則,指出單靠準確預測分數不足以解釋學生如何學習。文章屬理論與方法綜述,沒有新學生樣本,所列準則亦不表示現有模型已通過相關驗證。
74名醫學生試驗:AI配合問題導向學習有初步成效
研究將74名四年級醫學生隨機分成兩組,在同一教師教授的青光眼課程中,比較DeepSeek輔助問題導向學習與傳統教學。AI結合問題導向學習組的理論測驗、問診、診斷推理及整體臨床表現較佳,學生同時擔心AI醫療建議不準確。由於工具和教學方式一併改變,結果不能單獨歸因於AI;研究規模及追蹤時間亦有限。
小四詩歌寫作研究:教師引導的AI回饋呈現短期改善
研究以60名小四學生進行六周詩歌寫作活動,實驗組接受ChatGPT形成性回饋並修訂作品,對照組沒有AI支援。控制前測後,實驗組的詩歌寫作評分及對詩歌的態度均較佳。活動由教師引導處理回饋,並非讓學生自行使用聊天工具。研究只涉及一校兩班,沒有長期追蹤,亦未能分離額外回饋、修訂練習與AI本身各自的作用。
中大社科生調查:AI用途與成績有何關係?
研究調查香港中文大學107名社會科學本科生,按認知要求區分AI用途,並以迴歸分析檢視使用頻率與累積平均積點的關係。控制部分人口、態度及家庭因素後,用AI校對、摘要及整理資料等較低階任務與成績呈正相關,中階及高階任務則未見顯著關聯。研究採用單校橫斷問卷,不能確定因果,也沒有直接量度學生的分析能力或概念理解。
先構思再用AI:196名大學生的創作實驗
196名大學生分別獨立完成創作、自由使用ChatGPT,或先構思再請AI協助改良,其後全部人獨立完成另一項產品發明任務。自由使用AI組在首項任務最具創意,但移除工具後,表現回落至與獨立完成組相若。先構思再協作組在第二項任務較出色,對話亦較常用來改善原有想法。結果反映短期任務的獨立創作表現,未有證明長期創造力的改變。
AI協助助教寫評語:修訂稿進步,後測未見顯著差異
研究在354名大學生的入門經濟學課程中,比較助教自行撰寫評語與使用FeedbackWriter建議的評語,共處理1,366篇稿件。助教可採納、修改或刪除AI建議;收到AI輔助評語的學生,修訂稿質素較佳,評語亦較具體可行,但後測成績未見顯著差異。研究的修訂稿評分主要依賴語言模型,並以部分真人評分核對,作品改善未必代表知識保留。
217名大學生實驗:AI同伴性格改變討論過程,未明顯改變道德選擇
217名大學生分成三人小組,討論自動駕駛的道德困境,組別分為全人類、支持型AI同伴及質疑型AI同伴。支持型AI組較多提出有根據或附帶條件的主張,質疑型AI則帶出較多元的價值連繫,兩種AI均減少離題。最終道德選擇主要受原有立場影響,討論後解釋的複雜度改善有限。結果顯示AI性格對討論過程的影響,較對最終選擇的影響明顯。
挪威真實語文課錄影:教師同時教「用AI」與「認識AI」
研究利用挪威EDUCATE項目的課堂錄影,篩查五所中學、20個班的75節英語及挪威語課,分析教師在日常教學中如何使用和介紹生成式AI。部分教師一面以工具支援學科活動,一面引導學生檢查答案、理解局限,並強調自己的思考仍有必要。錄影來自2023至2024年,研究描述真實課堂的教學方式,沒有以對照組驗證學習成效,也不能代表全國學校。
35項研究的平均結果,能否回答你的課堂問題?
研究統合2022至2024年的35項實驗,共涉及4,193名參與者,分析ChatGPT對認知及非認知學習成果的影響。整體效果量為0.670,屬中等正面效果,學科、介入時間及教學模式能解釋部分差異,學段及知識類型則未有顯著調節作用。作者同時指出樣本選擇及未充分涵蓋調節因素的限制,平均結果不代表每種工具或課堂均有相同效果。
有目標也可能更依賴AI:自我調節不能只看目標設定
研究以巴斯克大學404名教育相關學位學生的量表及開放回答,分析自我調節與AI依賴的關係。目標設定與較高AI使用依賴呈直接正相關,但經堅持和從錯誤學習的間接關聯為負。多數學生只有限度使用或查資料,較集中依賴出現在小部分學生。研究的依賴指標着重任務使用頻率,並非沉迷或能力衰退的測量,一次問卷亦不能確定因果及先後次序。
35項自我調節學習研究:AI在執行任務階段的支援較強
研究綜合2013至2025年35項實證研究,按事前規劃、任務執行及事後反思,分析規則式、數據驅動及生成式AI的支援效果。整體效果量為0.507,任務執行階段較事前規劃為高;生成式AI部分結果較強,但研究之間差異很大。以行為紀錄量度的效果亦大於自評,顯示教學安排及量度方式會影響結論,短期任務改善未必等同持久的自我調節能力。
批判思考怎樣留在學生手上?八項AI教學設計原則
文章綜合認知心理學、教育理論及AI倫理,提出在大學課程使用語言模型的教學框架,涵蓋概念理解、推論、評價、後設認知、求知及知識誠信六類過程。八項設計原則包括保留思考難度、將AI回應視為待檢驗的想法,以及交替安排有AI與無AI活動。文中以兩個課堂情境說明應用,屬概念分析,並非已完成課堂驗證的成效研究。
瑞典高中AI課程分析:技術知識之外,批判與行動空間足夠嗎?
研究以瑞典高中新增的AI科為例,分析政策、課程及支援文件如何界定AI素養。作者採用三維素養模型,分別檢視操作技能、文化脈絡和批判理解,發現文件較重視操作層面,雖包含部分文化理解,讓學生質疑、回應或改變AI實踐的空間則較少。結果反映課程文本的取向,沒有觀察所有教師的課堂實踐,亦不能用來判定學生的實際批判能力。
澳洲科學課三個個案:想用AI自主學習,也需要合適支援
研究以澳洲中學科學課三名有特殊學習需要學生為個案,結合訪談、ChatGPT對話、工作紙和課堂錄影,分析學生使用AI時的選擇及行動能力。學生能表達拓展知識、連繫生活和尋求協助的意願,卻在理解答案、維持焦點及檢查資訊上遇到困難。學習意願與實際能力未必一致,成人支援仍有作用。個案數目有限,研究沒有估計整體成效或長期獨立學習的變化。
121名英文主修生修訂AI初稿:接受、潤飾與重寫內容有何不同?
研究讓中國南部一所大學121名英文主修生,評價及修訂按個人履歷生成的ChatGPT個人陳述,並訪談其中九人。初稿與終稿比較呈現三種做法:依從式接受、着重形式的修改,以及着重內容的創新。學生對AI初稿的評價隨修訂模式而異,差異亦與真實個人聲音、AI建構的聲音及表達自身意圖的投入有關。研究分析修訂主動性,並非AI與無AI教學成效的比較。
情緒AI統合分析:鼓勵與知識支援,各有甚麼作用?
研究整理2000至2025年172篇情緒AI實證文獻,並以其中49篇的54項研究進行統合分析。結合認知與情緒支援的知識學習效果量為0.88,只有認知支援則為0.52;在觀感及情緒指標上,結合支援未必佔優。單獨提供情緒支援的證據只有兩項研究,部分情緒結果亦有發表偏差線索。不同工具及任務的差異,限制了對情緒支援本身作用的判斷。
AI讓功課做得更好,學生真的學得更多嗎?
研究在近一千名高中數學學生中,比較一般GPT-4聊天介面、加入學習支援限制的AI導師及沒有AI的條件,分開評估練習和其後獨立測驗。兩種AI均提高練習表現,但移除工具後,一般聊天組低於無AI組;具學習支援設計的工具則大幅減輕負面影響。結果顯示有工具協助的練習表現與獨立解題能力可能不同,不能推論其他學科或工具會有相同效果。
丹麥兩項課堂實驗:會追問的AI導師,較通用聊天工具有利概念理解
兩項課堂實驗分別涉及175名大學生及234名高中生,比較會追問概念的ChatTutor、通用ChatGPT及無AI支援條件。ChatTutor組在兩項即時測試的概念知識均較ChatGPT組佳,高中組在延後測試仍有優勢;與無AI條件相比,只有部分測試達顯著差異。ChatTutor亦提高信任及使用樂趣,但自我效能沒有顯著差異,成效隨比較條件及測試時間而變。