人工智能與數字教育觀察
AI and Digital Education Spectator
RESEARCH

教育研究

教師與學生一起閱讀習作的欄目插畫
更多篩選 · 已選1項

15

AI潤文保留意思,也可能令不同人的聲音愈來愈相似

研究透過三項研究、七組資料及逾88萬份文本,分析AI寫作助手與語言多樣性的關係,並比較人類原文及模型潤飾後的文字。AI大致保留核心內容,卻令寫作風格更相似;不同資料及模型中,寫作複雜度的差異縮小21%至50%,部分較佔優勢的作者特徵亦被放大。結果涉及文字特徵及其社會訊息,沒有直接量度學生的長期寫作能力或創造力。

南加州大學
Nature Human Behaviour2026-08-24 · 約1分鐘
相關報道

物理答案之外:ChatGPT如何建立推理步驟?

研究以六道電場及高斯定律選擇題,分別用英語及土耳其語提問ChatGPT-4o,再由三名物理教育學者及一名評估學者分析回覆。評閱涵蓋理解、應用、分析和計算,除了答案正確性,亦檢視概念連繫及推理一致性。英語回覆在各層面較佳;土耳其語題涉及多步推理或情境解讀時,表現下降較明顯。研究限於六題,未直接量度學生學習成效。

Eskişehir Osmangazi University
Discover Education2026-05-09 · 約1分鐘

希伯來語化學考試:三個AI模型仍遜於中學生

研究以120道希伯來語高中化學公開試選擇題,測試ChatGPT-4o、Claude 3.5 Sonnet及Gemini 1.5 Pro,並與逾13.9萬名考生的資料比較。三個模型的整體表現均顯著低於學生,圖像及多步推理題尤其困難。研究再由化學教育專家分析最難題目的學科錯誤。結果對應受測版本及特定語言試卷,不能直接代表更新模型的能力。

Weizmann Institute of Science
Journal of Science Education and Technology2026-03-28 · 約1分鐘

英文批改提示加入錯誤類別和例子,有何分別?

研究以30篇大學生英文習作,比較一般提示、加入批改專業知識的提示,以及同時提供示例的提示,如何影響ChatGPT辨識語言錯誤。結果顯示,一般提示的表現低於Grammarly;加入專業知識後兩者相若,再加入示例則有較佳表現。進步主要見於用字、直接翻譯、句子結構及代名詞錯誤。不過,即使使用最詳細的提示,ChatGPT仍有部分辨識限制。

蘭州大學、澳門理工大學
ReCALL2025-12-29 · 約1分鐘

中文文化教學智能體的內容與語言設計

文章檢視海外中文文化教材的需要,指出一般人工智能輸出可能出現內容錯誤、拼音或翻譯不足,以及語言程度不合適等問題。作者參照TOTE模型與分級教材原則,設計中文文化教學智能體,把文化內容及學習者程度納入生成過程。研究著重問題診斷和系統設計,摘要未交代參與人數、比較組或學習測試,因此所述應用優勢尚不能等同已證實的學習成效。

作者機構未列於公開資料
《國際中文教育學報》期刊出版 2025-12 · 約1分鐘

英文回饋比較:AI與教師關注的問題有何不同?

研究比較土耳其一所大學56名學生的117份英文習作,分析ChatGPT與三名教師的回饋。人工智能共提供1,986項意見,其中88.11%被評為正確、切合程度及有用,其餘涉及錯誤或不必要修改。正確的人工智能回饋與教師意見約有56%重疊,內容及組織方面的重疊較少。研究評估回饋的質素與涵蓋範圍,並未測試學生採納意見後的學習成效。

Boğaziçi University
Language Teaching2025-09-09 · 約1分鐘

德國PISA短答研究:AI評分準確,也要檢查不同學生群組是否公平

研究以德國PISA 2015閱讀題的38,722份短答,比較不同自動評分方法,並檢查性別和家庭語言背景的公平性。最準確的方法結合RoBERTa文字表示與支援向量機,未見明顯性別偏差,卻對主要在家使用外語的學生給予略高於人工評分的分數。差異在個別題目更突出,與錯答辨識、學生表現、答案語言差異及試題難度有關,顯示整體準確率未能盡錄群組偏差。

DIPF | Leibniz Institute for Research and Information in Education、Goethe-Institut等
International Journal of Artificial Intelligence in Education2025-07-24 · 約1分鐘

同一道物理題換語言,ChatGPT表現也會不同

研究以逾400道物理題,測試ChatGPT使用哈薩克語、拉脫維亞語、俄語及英語作答的表現,並參照學生答題結果。工具在理論選擇題略勝學生,處理實際解難題則較弱,正確率僅17%。不同語言亦有明顯差異,英語表現最佳,哈薩克語較低。結果反映受測版本在特定題目及語言中的能力,並非學生使用人工智能輔助學習後的成效。

Riga Technical University、Al-Farabi Kazakh National University等
Technology, Knowledge and Learning2025-01-15 · 約1分鐘

用刻意設計的化學提問,檢視AI推理盲點

研究針對大型語言模型的化學推理能力,設計具挑戰性的提問,要求ChatGPT等模型處理複雜化學問題,再分析答案及推論。這些提問刻意測試模型在學科內容上的能力邊界,結果揭示現有系統的推理弱點,流暢的文字解說並不一定伴隨可靠的化學判斷。論文屬模型能力分析,未安排學生學習介入,也沒有以成績比較證明相關工具的教學效果。

University of the Basque Country UPV/EHU、Udako Euskal Unibertsitatea
Education and Information Technologies2025-01-03 · 約1分鐘

AI編寫外語教案:指示更詳細,質素未必更高

研究逐步增加提示內容,以ChatGPT生成外語教案,並重複相同提示,檢視教案質素與差異。整體教案評分較高,但加入更多細節未必提高品質,同一提示亦可產生差異甚大的結果。部分活動沿用背誦預設對話等舊有做法,與着重溝通的教學原則不符。研究對象是AI生成教案,沒有直接觀察教師實施或量度學生的學習成效。

University of North Carolina at Charlotte
ReCALL2024-12-11 · 約1分鐘

四個AI角色共同改數學題,教師怎樣評價?

研究設計四個人工智能角色,分別從數學深度、語言、照顧差異及能力要求出發,經多輪對話共同修改六項數學任務,再由六名在職教師盲評原題與改寫版本。生成版本增加了可行解題途徑及具體指示,但文字量與題意精確度之間未必取得平衡。教師亦以多項尺度評分並解釋取捨。研究評估的是任務設計,未比較學生使用改寫題目後的學習表現。

TUD Dresden University of Technology、University of Hamburg
Digital Experiences in Mathematics Education2024-10-24 · 約1分鐘

用數碼箭咀記錄比例推理,為機器學習建立資料

研究以設計研究方法,在問題導向的數學協作平台開發SPArrows數碼標註功能,讓學生和教師用視覺筆記記錄比例推理。教師及研究人員可為標註加上標籤,累積日後訓練機器學習分析推理過程的資料。論文交代系統發展中出現的設計難題,並連繫至其設計原則。這項工作屬概念驗證,並未證明系統已能可靠評分,亦未比較學生的學習成效。

Michigan State University、The Concord Consortium
Digital Experiences in Mathematics Education2024-10-16 · 約1分鐘

英國大學盲測:AI試卷取得分數,未代表學生掌握了內容

研究把完全由人工智能撰寫的答案放入英國一所大學心理學本科五個科目的真實評卷程序,評卷者事前並不知情。94%的人工智能答卷未被識別,平均評級較真實學生答卷高約半個等級。按科目比較,人工智能答卷優於同數量隨機抽取學生答卷的機會為83.4%。研究檢視的是無監考評估辨認作答來源的能力,並未量度學生使用工具後的學習進步。

University of Reading、University of Essex
PLOS ONE2024-06-26 · 約1分鐘

200篇學生作文比較:受訓教師評語在四項品質指標較佳

研究比較同一批中學生作文的200份真人評語及200份ChatGPT評語,按評分準則、改善方向、準確度、重點排序和支持語氣評分。受訓教育工作者在後四項較佳,依據評分準則一項則未呈現同樣優勢;評語品質亦隨作文原有質素而變,未因學生的英語學習背景而有明顯差異。研究量度的是評語品質,沒有直接比較學生收到評語後的學習進步。

University of California, Irvine(美國)、Arizona State University(美國)等
Learning and Instruction2024-03-11 · 約1分鐘
相關報道

AI在科學評估題表現較佳,是否需要重想評估目標?

研究以54道2019年美國NAEP科學評估題,測試ChatGPT及GPT-4,並按題目的認知複雜性及維度,與四、八及十二年級學生的既有答題資料比較。兩個模型在所測題目普遍優於多數學生。題目要求提高時,學生通常需要更高能力才能答對;模型的表現則大多未呈相同變化。這是模型與既有評估資料的比較,並非人工智能教學介入實驗。

University of Georgia、University of Alabama
Science & Education2024-01-29 · 約1分鐘