六千多名初中生試驗:AI錯題輔導的價值取決於練習安排
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
研究在美國六千多名初中生的數學練習中,隨機比較AI與一般電腦支援,以及不同掌握學習規則,一周後再評估。AI組進度較慢、題量較少,但在已作答的題目中準確度較高,錯題後下一次答對的比例亦增加。延後測驗較正面的結果集中在AI配合掌握學習流程及部分已練習內容,且部分差異只達邊緣顯著,未足以確認廣泛的數學遷移效果。
研究在大學生態學課程試行八步AI探究流程,交替安排AI探索、查核文獻、修訂及人類回饋,分析45名學生的評分和反思。所有步驟的有用程度評分中位數均為「幫助很大」,但步驟間差異很小,校正多重比較後未見個別步驟的顯著差異。學生認為AI有助收窄構思,文獻閱讀及回饋亦支持進展。研究沒有對照組或獨立能力前後測,結果主要反映使用經驗。
廖寶珊紀念書院物理科主任黃鍶晴以ChatGPT和Gemini協助開發PhyschinggLab,把題目、公式與示意圖製成配對遊戲,加入錯題簿及光學、電磁學模擬。學生參與提供修改意見,已有逾200名中三以上學生使用,當時涵蓋約一成半高中物理課題。教師仍在改良程式,並計劃加入AI錯題分析。
研究分析德國三所中學98名九年級學生,在數學課使用AI導師的1,616個對話回合,並收集前後測、學習需要及認知負荷資料。學生事前多希望得到概念解釋和逐步支援,實際對話卻少有明確檢查或評估自己的理解。後測表現低於前測,額外認知負荷亦與較低分數相關。對話分類仍屬AI初步編碼,研究沒有無AI對照組,不能斷定工具導致退步。
香海正覺蓮社佛教普光學校為較難掌握抽象數學的學生設計彩虹數線,用開始和結束的閘門標記及數粒,協助理解空間與數量,並在不同度量課題反覆運用。教師另製作電子主題課本,加入生活數學、AI技術和一站式電子學習平台,以較細的學習步幅組織校本課程,讓實物操作與電子教材互相配合。
研究由來自九個地區的作者合作,按2024年QS院校名單蒐集大學公開課程資料,分別整理計算類及人工智能/機器學習化學課程。已有計算課程的院校,亦較常提供人工智能課程;部分院校課程較少,可能涉及資源優次或師資不足。論文並討論課程更新、教師知識及不同持份者的角色。公開課程資料未必完整反映實際教學,也不能直接代表學生能力。
研究以六道電場及高斯定律選擇題,分別用英語及土耳其語提問ChatGPT-4o,再由三名物理教育學者及一名評估學者分析回覆。評閱涵蓋理解、應用、分析和計算,除了答案正確性,亦檢視概念連繫及推理一致性。英語回覆在各層面較佳;土耳其語題涉及多步推理或情境解讀時,表現下降較明顯。研究限於六題,未直接量度學生學習成效。
研究將371名七至九年級學生隨機分至學習價值支援、認知策略支援及標準ChatGPT三組,在物理或英語課完成六節45分鐘活動。學習價值組的價值感發展較認知策略組有利,但兩個介入組在努力、學科知識及精緻化策略方面,均未顯著優於標準ChatGPT組。較有意義的互動與興趣維持相關,屬探索性結果,未足以證明整體自我調節能力提升。
研究以120道希伯來語高中化學公開試選擇題,測試ChatGPT-4o、Claude 3.5 Sonnet及Gemini 1.5 Pro,並與逾13.9萬名考生的資料比較。三個模型的整體表現均顯著低於學生,圖像及多步推理題尤其困難。研究再由化學教育專家分析最難題目的學科錯誤。結果對應受測版本及特定語言試卷,不能直接代表更新模型的能力。
研究以澳洲中學科學課三名有特殊學習需要學生為個案,結合訪談、ChatGPT對話、工作紙和課堂錄影,分析學生使用AI時的選擇及行動能力。學生能表達拓展知識、連繫生活和尋求協助的意願,卻在理解答案、維持焦點及檢查資訊上遇到困難。學習意願與實際能力未必一致,成人支援仍有作用。個案數目有限,研究沒有估計整體成效或長期獨立學習的變化。
研究在2024/25學年上學期比較兩組各九名準教師,探討生成式人工智能融入數學探究學習後的表現。參加者運用工具設計個別化數學活動,課末評估主要採用學習成果自評。人工智能組的批判思考自評較高,差異達統計顯著;解難和書面溝通的組間差異則未達顯著。研究人數少,結果主要反映課末自我評價,不能直接推算客觀能力的進步幅度。
聖方濟愛德小學教師自設聊天機械人,以因數及最大公因數計算為題,協助學生重溫數學概念。公開示範課把自主學習與AI適性化支援結合,圍繞一個具體數學課題設計互動活動。教師亦介紹課堂活動安排、學生表現及實施時遇到的挑戰,探索聊天機械人如何配合小學數學學習。
研究在近一千名高中數學學生中,比較一般GPT-4聊天介面、加入學習支援限制的AI導師及沒有AI的條件,分開評估練習和其後獨立測驗。兩種AI均提高練習表現,但移除工具後,一般聊天組低於無AI組;具學習支援設計的工具則大幅減輕負面影響。結果顯示有工具協助的練習表現與獨立解題能力可能不同,不能推論其他學科或工具會有相同效果。
研究系統整理2024年NARST科學教育會議的36篇人工智能相關論文,分析應用方式及挑戰。文獻中的工具逐漸結合多種用途、文字與圖像生成,但大多延續既有科學教育取向,未重新界定其基本方向。主要難題涉及教育目標、學習內容、個別回饋的評估、教師準備,以及偏差與公平。資料限於單一會議,所呈現的是該研究社群的發展,並非全球文獻全貌。
研究系統回顧2014至2024年人工智能在科學及化學教育中的應用,發現2021年後相關文獻增加,常見工具包括ChatGPT及對話機械人。應用涵蓋網上學習、實驗課、多模式教材、跨學科學習及個別支援。文獻同時反覆提出性別與種族偏差、錯誤生成、版權、抄襲、可靠性、技術設備及語言支援等問題。各研究的工具及衡量方式不同,未有統一成效幅度。
研究在哈佛大學本科物理課進行隨機對照實驗,比較專門設計的AI導師與課堂主動學習,並收集知識測驗及學生感受。AI導師採用與課堂相同的教學原則,學生在較短時間內取得較佳學習表現,亦感到更投入和有動機。結果涉及特定工具與教學設計,研究範圍集中大學物理課的部分內容,未能據此推論中小學、其他學科或長期學習會有相同成效。
研究讓120名摩洛哥工程一年級學生分組學習熱力學,比較一般教學與結合ChatGPT的探究活動。前後測顯示,人工智能組概念理解進步較大,尤其減少了對熵及內能的部分誤解;涉及數量及計算的誤解則仍有保留。學生對工具的易用及支援作用持正面看法,有目的地使用與較佳結果相關。研究評估的是人工智能配合探究教學的整體安排。
這項範疇文獻綜述整理ChatGPT在數學教育中的用途,包括解釋概念、設計教案與評估、個別化學習及合作活動。文獻顯示,工具具備提供即時回饋和支援自主學習的潛力,同時涉及答案不準確、倫理疑慮及過度依賴等問題。作者分析教師覆核與教學安排在其中的作用,並討論學生與工具互動方式的改變。綜述著重用途與議題,沒有提出一致的學習成效估算。
研究分析工程學生的三次訪談,了解他們初用ChatGPT時,如何逐步形成使用方式。用途涵蓋數學與工程、一般學業及個人生活;在數學建模中,學生會用它澄清概念、比較策略、把模型轉成程式,以及改善程式。訪談亦顯示,學生對工具限制的判斷隨經驗發展,部分把它視為可以討論想法的學習伙伴。研究呈現個案經驗,沒有以對照測驗確認能力提升。
研究以逾400道物理題,測試ChatGPT使用哈薩克語、拉脫維亞語、俄語及英語作答的表現,並參照學生答題結果。工具在理論選擇題略勝學生,處理實際解難題則較弱,正確率僅17%。不同語言亦有明顯差異,英語表現最佳,哈薩克語較低。結果反映受測版本在特定題目及語言中的能力,並非學生使用人工智能輔助學習後的成效。
研究以馬耳他中學數學教師為對象,分析專業發展活動前後的問卷及現場筆記,了解教學信念與ChatGPT觀感之間的關係。重視探索和概念連繫的教師較看好工具,認為可用於設計練習、評估及個別回饋。教師亦指出,工具在理解數學圖像及答案準確性方面有局限。資料主要反映教師自述的信念與活動經驗,未直接量度學生的數學學習表現。
研究針對大型語言模型的化學推理能力,設計具挑戰性的提問,要求ChatGPT等模型處理複雜化學問題,再分析答案及推論。這些提問刻意測試模型在學科內容上的能力邊界,結果揭示現有系統的推理弱點,流暢的文字解說並不一定伴隨可靠的化學判斷。論文屬模型能力分析,未安排學生學習介入,也沒有以成績比較證明相關工具的教學效果。
研究以一百三十四名中二學生的迪士尼路線優化專題,評估數學建模在中學的實踐。課程按閱讀、建模、估算、計算、驗證及寫作六階段設計,並分析數碼作品、問卷、訪談及課堂觀察。多數學生接受活動,在閱讀、計算和寫作表現較好,但建模及驗證仍較薄弱,反映教材及教師教學支援有待改善。
研究探討真實科學探究活動能否改善中學生對科學問題、多元研究方法,以及數據與證據關係的理解。研究分析前後科學探究圖、問卷及訪談,發現小組較能將探究視為動態、非線性的過程;但個人對三項重點的理解只略有改變,與自評理解的顯著提升並不一致,提示課程需更有焦點的反思與引導。