我的研究登上媒體:為什麼 AI 會在高考地球科學中碰壁?
不久前,首爾大學與國立臺灣師範大學(NTNU)共同進行的研究登上了「AI Matters」的報導。往返於臺灣與“韓國”之間苦心鑽研的科學教育研究,能以這樣大眾化的報導呈現,實在令人百感交集。我想向部落格的讀者們簡短分享一下這次研究的內容,以及它在教育上所代表的意義。
分析 AI 韓國高考 地球科學:我們的研究內容為何?
這次研究分析了 GPT-4o、Gemini 2.5 Flash、Gemini 2.5 Pro 等最新大型語言模型(LLM)是如何解答 2025 學年度大學修學能力試驗(“韓國”高考)「地球科學 I」的考題。我們不僅僅是單純測量「AI 得了幾分」,而是將焦點放在一個根本的問題上:「AI 犯錯的方式與人類有何不同?為什麼會錯?」 我們嘗試將整份試卷直接交給 AI、按題裁切後提供,甚至將文字與圖表完全分離後進行測試。在最佳條件下,Gemini 2.5 Pro 模型獲得了 68 分,接近頂尖考生的成績。然而,我們研究團隊所關注的,是 AI 失敗時所呈現出的非常獨特且重複的模式。
AI 在 AI 韓國高考 地球科學 題目中如何失敗?
分析結果顯示,AI 展現了三種與人類犯錯方式截然不同的致命錯誤模式。
- 感知-認知斷層 (Perception-Cognition Gap) : AI 雖然能感知視覺資訊本身,卻無法解讀其中蘊含的科學規則。例如,它雖然能看到顯示颱風風向的放射狀圖表,卻無法將那些線條與「順時針」及「逆時針」的科學意義連結起來。
- 計算-概念不一致 (Calculation-Conceptualization Discrepancy) : 數學公式的計算完美無缺,卻無法掌握那些數字所代表的物理與科學概念。也就是說,程序性的計算能力與概念性的理解是完全脫節的。
- 過程幻覺 (Process Hallucination) : 在需要看著複雜數據進行逐步推論的情況下,AI 會直接跳過該過程,並將表面上看似相關的背景知識隨意拼湊,直接得出結論的現象。
教育的未來:AI 韓國高考 地球科學 研究的意義
這項研究的真正價值,並不在於單純證明「AI 尚未超越人類」。其核心在於它為即將到來的 AI 時代中,我們的教育評量方式應該如何改變,提供了明確的線索。 這正是我在今年二月“韓國”科學教育學會(KASE)冬季學術大會上也曾發表過的「抗 AI 評量(AI-resistant assessment)」設計之所以重要的原因。要求 AI 輕鬆解出的單純知識或程序性計算的評量,將不再具有鑑別度。取而代之的是,我們需要要求學生解釋非典型圖表中的隱藏規則,或是將計算結果的概念意義應用於現實情境中的評量。這將成為一種能衡量學生真實理解程度,同時又讓 AI 難以輕易模仿的有效教育評量方向。
未來,我也會繼續在科技與教育的交會點上,融入學習科學的觀點,持續進行有意義的研究。
詳細的報導內容與發表在 arXiv 上的報告原文,可以透過下方連結查看。 因為是先以預印本(Preprint)形式上傳至 arXiv,所以文章還沒有整理到最完美的狀態。雖然應該盡快投稿到正式的學術期刊,但 AI 變化的速度實在太快,要抽出時間來投稿真的不容易。
👉 閱讀報導原文: 通過醫師國考的 GPT,在高考地球科學面前崩潰… – AI Matters
👉 論文 (arXiv): “ChatGPT and Gemini participated in the “Korean” College Scholastic Ability Test – Earth Science I”