AI潤文保留意思,也可能令不同人的聲音愈來愈相似
研究透過三項研究、七組資料及逾88萬份文本,分析AI寫作助手與語言多樣性的關係,並比較人類原文及模型潤飾後的文字。AI大致保留核心內容,卻令寫作風格更相似;不同資料及模型中,寫作複雜度的差異縮小21%至50%,部分較佔優勢的作者特徵亦被放大。結果涉及文字特徵及其社會訊息,沒有直接量度學生的長期寫作能力或創造力。

研究透過三項研究、七組資料及逾88萬份文本,分析AI寫作助手與語言多樣性的關係,並比較人類原文及模型潤飾後的文字。AI大致保留核心內容,卻令寫作風格更相似;不同資料及模型中,寫作複雜度的差異縮小21%至50%,部分較佔優勢的作者特徵亦被放大。結果涉及文字特徵及其社會訊息,沒有直接量度學生的長期寫作能力或創造力。
研究以六道電場及高斯定律選擇題,分別用英語及土耳其語提問ChatGPT-4o,再由三名物理教育學者及一名評估學者分析回覆。評閱涵蓋理解、應用、分析和計算,除了答案正確性,亦檢視概念連繫及推理一致性。英語回覆在各層面較佳;土耳其語題涉及多步推理或情境解讀時,表現下降較明顯。研究限於六題,未直接量度學生學習成效。
研究以120道希伯來語高中化學公開試選擇題,測試ChatGPT-4o、Claude 3.5 Sonnet及Gemini 1.5 Pro,並與逾13.9萬名考生的資料比較。三個模型的整體表現均顯著低於學生,圖像及多步推理題尤其困難。研究再由化學教育專家分析最難題目的學科錯誤。結果對應受測版本及特定語言試卷,不能直接代表更新模型的能力。
研究以30篇大學生英文習作,比較一般提示、加入批改專業知識的提示,以及同時提供示例的提示,如何影響ChatGPT辨識語言錯誤。結果顯示,一般提示的表現低於Grammarly;加入專業知識後兩者相若,再加入示例則有較佳表現。進步主要見於用字、直接翻譯、句子結構及代名詞錯誤。不過,即使使用最詳細的提示,ChatGPT仍有部分辨識限制。
文章檢視海外中文文化教材的需要,指出一般人工智能輸出可能出現內容錯誤、拼音或翻譯不足,以及語言程度不合適等問題。作者參照TOTE模型與分級教材原則,設計中文文化教學智能體,把文化內容及學習者程度納入生成過程。研究著重問題診斷和系統設計,摘要未交代參與人數、比較組或學習測試,因此所述應用優勢尚不能等同已證實的學習成效。
研究以德國PISA 2015閱讀題的38,722份短答,比較不同自動評分方法,並檢查性別和家庭語言背景的公平性。最準確的方法結合RoBERTa文字表示與支援向量機,未見明顯性別偏差,卻對主要在家使用外語的學生給予略高於人工評分的分數。差異在個別題目更突出,與錯答辨識、學生表現、答案語言差異及試題難度有關,顯示整體準確率未能盡錄群組偏差。
研究以逾400道物理題,測試ChatGPT使用哈薩克語、拉脫維亞語、俄語及英語作答的表現,並參照學生答題結果。工具在理論選擇題略勝學生,處理實際解難題則較弱,正確率僅17%。不同語言亦有明顯差異,英語表現最佳,哈薩克語較低。結果反映受測版本在特定題目及語言中的能力,並非學生使用人工智能輔助學習後的成效。
研究針對大型語言模型的化學推理能力,設計具挑戰性的提問,要求ChatGPT等模型處理複雜化學問題,再分析答案及推論。這些提問刻意測試模型在學科內容上的能力邊界,結果揭示現有系統的推理弱點,流暢的文字解說並不一定伴隨可靠的化學判斷。論文屬模型能力分析,未安排學生學習介入,也沒有以成績比較證明相關工具的教學效果。
研究逐步增加提示內容,以ChatGPT生成外語教案,並重複相同提示,檢視教案質素與差異。整體教案評分較高,但加入更多細節未必提高品質,同一提示亦可產生差異甚大的結果。部分活動沿用背誦預設對話等舊有做法,與着重溝通的教學原則不符。研究對象是AI生成教案,沒有直接觀察教師實施或量度學生的學習成效。
研究設計四個人工智能角色,分別從數學深度、語言、照顧差異及能力要求出發,經多輪對話共同修改六項數學任務,再由六名在職教師盲評原題與改寫版本。生成版本增加了可行解題途徑及具體指示,但文字量與題意精確度之間未必取得平衡。教師亦以多項尺度評分並解釋取捨。研究評估的是任務設計,未比較學生使用改寫題目後的學習表現。
研究以設計研究方法,在問題導向的數學協作平台開發SPArrows數碼標註功能,讓學生和教師用視覺筆記記錄比例推理。教師及研究人員可為標註加上標籤,累積日後訓練機器學習分析推理過程的資料。論文交代系統發展中出現的設計難題,並連繫至其設計原則。這項工作屬概念驗證,並未證明系統已能可靠評分,亦未比較學生的學習成效。