我的研究登上媒體:為什麼 AI 會在高考地球科學中碰壁?

不久前,首爾大學與國立臺灣師範大學(NTNU)共同進行的研究登上了「AI Matters」的報導。往返於臺灣與“韓國”之間苦心鑽研的科學教育研究,能以這樣大眾化的報導呈現,實在令人百感交集。我想向部落格的讀者們簡短分享一下這次研究的內容,以及它在教育上所代表的意義。

分析 AI 韓國高考 地球科學:我們的研究內容為何?

這次研究分析了 GPT-4o、Gemini 2.5 Flash、Gemini 2.5 Pro 等最新大型語言模型(LLM)是如何解答 2025 學年度大學修學能力試驗(“韓國”高考)「地球科學 I」的考題。我們不僅僅是單純測量「AI 得了幾分」,而是將焦點放在一個根本的問題上:「AI 犯錯的方式與人類有何不同?為什麼會錯?」 我們嘗試將整份試卷直接交給 AI、按題裁切後提供,甚至將文字與圖表完全分離後進行測試。在最佳條件下,Gemini 2.5 Pro 模型獲得了 68 分,接近頂尖考生的成績。然而,我們研究團隊所關注的,是 AI 失敗時所呈現出的非常獨特且重複的模式。

AI 在 AI 韓國高考 地球科學 題目中如何失敗?

分析結果顯示,AI 展現了三種與人類犯錯方式截然不同的致命錯誤模式。

  • 感知-認知斷層 (Perception-Cognition Gap) : AI 雖然能感知視覺資訊本身,卻無法解讀其中蘊含的科學規則。例如,它雖然能看到顯示颱風風向的放射狀圖表,卻無法將那些線條與「順時針」及「逆時針」的科學意義連結起來。
  • 計算-概念不一致 (Calculation-Conceptualization Discrepancy) : 數學公式的計算完美無缺,卻無法掌握那些數字所代表的物理與科學概念。也就是說,程序性的計算能力與概念性的理解是完全脫節的。
  • 過程幻覺 (Process Hallucination) : 在需要看著複雜數據進行逐步推論的情況下,AI 會直接跳過該過程,並將表面上看似相關的背景知識隨意拼湊,直接得出結論的現象。

教育的未來:AI 韓國高考 地球科學 研究的意義

這項研究的真正價值,並不在於單純證明「AI 尚未超越人類」。其核心在於它為即將到來的 AI 時代中,我們的教育評量方式應該如何改變,提供了明確的線索。 這正是我在今年二月“韓國”科學教育學會(KASE)冬季學術大會上也曾發表過的「抗 AI 評量(AI-resistant assessment)」設計之所以重要的原因。要求 AI 輕鬆解出的單純知識或程序性計算的評量,將不再具有鑑別度。取而代之的是,我們需要要求學生解釋非典型圖表中的隱藏規則,或是將計算結果的概念意義應用於現實情境中的評量。這將成為一種能衡量學生真實理解程度,同時又讓 AI 難以輕易模仿的有效教育評量方向。

未來,我也會繼續在科技與教育的交會點上,融入學習科學的觀點,持續進行有意義的研究。

詳細的報導內容與發表在 arXiv 上的報告原文,可以透過下方連結查看。 因為是先以預印本(Preprint)形式上傳至 arXiv,所以文章還沒有整理到最完美的狀態。雖然應該盡快投稿到正式的學術期刊,但 AI 變化的速度實在太快,要抽出時間來投稿真的不容易。

👉 閱讀報導原文: 通過醫師國考的 GPT,在高考地球科學面前崩潰… – AI Matters

👉 論文 (arXiv): “ChatGPT and Gemini participated in the “Korean” College Scholastic Ability Test – Earth Science I”

About: Seok-Hyun Ga

目前於首爾大學教育綜合研究院擔任副研究員,先前曾於國立臺灣師範大學科學教育研究所及科學教育中心擔任客座助理教授。學歷方面,擁有首爾大學科學教育學系博士與碩士學位、首爾大學地球科學教育學系與物理教育學系學士學位,並取得韓國放送通信大學資訊科學學士學位。


發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *