AI提升作業評分,因果推理訓練拓闊構思
研究將1,053名一年級經濟、管理及金融本科生分配至因果推理訓練、ChatGPT、兩者兼有或對照條件,要求他們處理真實商品營銷問題。AI提高作業評分、文字連貫性及構思數量;推理訓練未顯著提高評分,卻增加機制分析及構思多樣性,兩者並用保留了相關作用。研究集中一次作業及特定評準,沒有測量移除工具後的知識保留或長期能力。
研究將1,053名一年級經濟、管理及金融本科生分配至因果推理訓練、ChatGPT、兩者兼有或對照條件,要求他們處理真實商品營銷問題。AI提高作業評分、文字連貫性及構思數量;推理訓練未顯著提高評分,卻增加機制分析及構思多樣性,兩者並用保留了相關作用。研究集中一次作業及特定評準,沒有測量移除工具後的知識保留或長期能力。
研究重分析218名大學生使用自適應系統學習認知心理學詞彙的紀錄,共25,843組學習序列,間隔由數秒至數星期不等。固定參數的遺忘模型難以同時描述短期和長期表現,按時間間隔調整參數後,對保留資料的預測較佳。這是既有行為資料的模型比較,沒有把學生隨機分配到不同複習系統,亦未證明採用新模型便能提高學習成績。
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
研究在大學生態學課程試行八步AI探究流程,交替安排AI探索、查核文獻、修訂及人類回饋,分析45名學生的評分和反思。所有步驟的有用程度評分中位數均為「幫助很大」,但步驟間差異很小,校正多重比較後未見個別步驟的顯著差異。學生認為AI有助收窄構思,文獻閱讀及回饋亦支持進展。研究沒有對照組或獨立能力前後測,結果主要反映使用經驗。
研究在瑞典兩所學術背景不同的大學收集1,097份問卷,結合統計及主題分析比較學生使用生成式人工智能的經驗。學生主要用於查找資料、修訂和分析文字,亦有人把工具當作討論伙伴或導師。兩校大多數指標相近,只有院校支援及課程融合的感受呈顯著差異,科技導向院校較高。學生普遍把人工智能視為教學補充,對生成內容的信任則屬中等。
研究調查342名中國大學生,分析AI查資料、生成內容及修訂文字,與自評批判思考的關係。查資料呈正相關,生成內容呈負相關,修訂文字則未見顯著關聯。內在動機加強查資料的正向關聯,亦加強生成內容的負向關聯;外在動機則減弱後者。研究採用一次自陳問卷,沒有客觀思考測驗,認知負荷亦未直接量度,不能據此確定AI造成能力改變。
研究從澳洲大學焦點小組中選取三名學生作深入個案,了解他們如何在學業、身分及日常生活中決定是否使用生成式人工智能。分析顯示,學生的選擇同時受到學習觀、院校規則、道德立場、時間與資源限制,以及教師和同儕關係影響。支持工具與保留態度可以並存,亦會隨目的和處境改變。三個個案呈現使用決定的複雜性,並不代表所有大學生的共同取向。
文章檢視AI何時可被視為解釋學習的認知模型,綜合神經網絡、強化學習、認知架構及大型語言模型的研究。作者提出理論根據、量度效度、機制透明、人類學習軌跡、錯誤模式及因果干預等準則,指出單靠準確預測分數不足以解釋學生如何學習。文章屬理論與方法綜述,沒有新學生樣本,所列準則亦不表示現有模型已通過相關驗證。
研究開發六款平板遊戲,先由10名職能治療師評估內容及年齡適切性,再安排10名4至6歲自閉症兒童試玩,檢視視覺動作整合訓練的可行性。各項內容效度指標高於0.78,不同難度的遊戲通過率為50%至90%,難度增加時通常較低。研究沒有對照組或能力前後測,結果支持設計與操作的初步可行性,尚未證明訓練能改善能力或轉移至日常生活。
研究以隨機實驗比較大學生在有或沒有生成式AI協助下,閱讀陌生議題及撰寫分析文章的表現,並安排即時和一周後的獨立測驗。AI組的即時知識測驗高出0.27個標準差,優勢維持至一周後;當下文章質素變化不大,延後寫作的風格和切題程度則有所改善。以AI解釋概念者的延後進步較大,但使用方式由學生自行選擇,不能據此確定不同用法的因果效果。
研究將74名四年級醫學生隨機分成兩組,在同一教師教授的青光眼課程中,比較DeepSeek輔助問題導向學習與傳統教學。AI結合問題導向學習組的理論測驗、問診、診斷推理及整體臨床表現較佳,學生同時擔心AI醫療建議不準確。由於工具和教學方式一併改變,結果不能單獨歸因於AI;研究規模及追蹤時間亦有限。
研究分析德國三所中學98名九年級學生,在數學課使用AI導師的1,616個對話回合,並收集前後測、學習需要及認知負荷資料。學生事前多希望得到概念解釋和逐步支援,實際對話卻少有明確檢查或評估自己的理解。後測表現低於前測,額外認知負荷亦與較低分數相關。對話分類仍屬AI初步編碼,研究沒有無AI對照組,不能斷定工具導致退步。
研究以482名新西蘭初級中文學習者為對象,探討數字人示範太極時,動作、語音及學習環境如何配合中文學習。設計結合示範速度調整、動作分解、重複練習及聲畫提示,並觀察學生即時掌握動作和記憶詞語的表現。研究指出多種提示配合有助學習,但未交代完整分組及延後測試,所得即時表現不能直接代表長期語言能力的提升。
研究以60名小四學生進行六周詩歌寫作活動,實驗組接受ChatGPT形成性回饋並修訂作品,對照組沒有AI支援。控制前測後,實驗組的詩歌寫作評分及對詩歌的態度均較佳。活動由教師引導處理回饋,並非讓學生自行使用聊天工具。研究只涉及一校兩班,沒有長期追蹤,亦未能分離額外回饋、修訂練習與AI本身各自的作用。
研究結合印尼兩所大學270名學生的問卷及15次訪談,探討ChatGPT輔助寫作與自主判斷、持續解難及作者責任的關係。學生較肯定效率、作品質素、信心和學習樂趣,協作等行為參與則較不明顯。訪談呈現逐漸依賴工具、減少自行思考,以及作者身份變得模糊等經驗。結果主要反映學生自述,尚未以長期行為資料驗證批判思考能力的變化。
研究調查香港中文大學107名社會科學本科生,按認知要求區分AI用途,並以迴歸分析檢視使用頻率與累積平均積點的關係。控制部分人口、態度及家庭因素後,用AI校對、摘要及整理資料等較低階任務與成績呈正相關,中階及高階任務則未見顯著關聯。研究採用單校橫斷問卷,不能確定因果,也沒有直接量度學生的分析能力或概念理解。
文章結合概念分析及近期研究,探討教師、學生與人工智能如何在回饋過程中合作,重點比較回饋的及時性、準確程度、細節、可理解程度及語氣。分析亦把師生關係和學生參與判斷、回應及修改的過程納入考慮,涉及內地師生資料。文章屬研究綜合,著重釐清不同回饋來源的特點與合作方式,沒有以實驗比較人與人工智能回饋對成績的個別效果。
196名大學生分別獨立完成創作、自由使用ChatGPT,或先構思再請AI協助改良,其後全部人獨立完成另一項產品發明任務。自由使用AI組在首項任務最具創意,但移除工具後,表現回落至與獨立完成組相若。先構思再協作組在第二項任務較出色,對話亦較常用來改善原有想法。結果反映短期任務的獨立創作表現,未有證明長期創造力的改變。
研究將371名七至九年級學生隨機分至學習價值支援、認知策略支援及標準ChatGPT三組,在物理或英語課完成六節45分鐘活動。學習價值組的價值感發展較認知策略組有利,但兩個介入組在努力、學科知識及精緻化策略方面,均未顯著優於標準ChatGPT組。較有意義的互動與興趣維持相關,屬探索性結果,未足以證明整體自我調節能力提升。
研究在354名大學生的入門經濟學課程中,比較助教自行撰寫評語與使用FeedbackWriter建議的評語,共處理1,366篇稿件。助教可採納、修改或刪除AI建議;收到AI輔助評語的學生,修訂稿質素較佳,評語亦較具體可行,但後測成績未見顯著差異。研究的修訂稿評分主要依賴語言模型,並以部分真人評分核對,作品改善未必代表知識保留。
217名大學生分成三人小組,討論自動駕駛的道德困境,組別分為全人類、支持型AI同伴及質疑型AI同伴。支持型AI組較多提出有根據或附帶條件的主張,質疑型AI則帶出較多元的價值連繫,兩種AI均減少離題。最終道德選擇主要受原有立場影響,討論後解釋的複雜度改善有限。結果顯示AI性格對討論過程的影響,較對最終選擇的影響明顯。
研究利用挪威EDUCATE項目的課堂錄影,篩查五所中學、20個班的75節英語及挪威語課,分析教師在日常教學中如何使用和介紹生成式AI。部分教師一面以工具支援學科活動,一面引導學生檢查答案、理解局限,並強調自己的思考仍有必要。錄影來自2023至2024年,研究描述真實課堂的教學方式,沒有以對照組驗證學習成效,也不能代表全國學校。
研究統合2022至2024年的35項實驗,共涉及4,193名參與者,分析ChatGPT對認知及非認知學習成果的影響。整體效果量為0.670,屬中等正面效果,學科、介入時間及教學模式能解釋部分差異,學段及知識類型則未有顯著調節作用。作者同時指出樣本選擇及未充分涵蓋調節因素的限制,平均結果不代表每種工具或課堂均有相同效果。
研究收集中國、歐洲及美國共912名大學生的資料,結合統計模型、組態分析及訪談,探討學生與生成式人工智能合作時的思考分工。結果顯示,查核人工智能內容與把部分工作交給工具可以同時出現;策略性分工與較深層的反思及自述學習轉變有關。重視效率的取向亦可能加強查核及分工行為。這些關係主要由調查模型呈現,並非對學習能力變化的隨機實驗。