AI 11天破解5年難題!Claude 寫下數學史新頁

30 秒看重點

  • 事件:Claude 僅花 11 天,便搞定原本需耗時 5 年的數學形式化證明專案。
  • 意義:證明 AI 已具備自主邏輯推理與極高精準度的自我除錯能力。
  • 影響:這將加速科學研究與軟硬體安全驗證,台灣晶片設計業有望大幅縮短開發週期。

這項研究顛覆了過去「AI 不擅長邏輯與數學」的刻板印象。透過巧妙的引導框架,Claude 3.5 Sonnet 展現了如優秀研究助理般的「自主代理」特質,在面對嚴格的程式驗證時,能自己看懂錯誤訊息並不斷修正,直至完美通關。

關鍵數據:原本預估需 5 年 的人工學術計畫,AI 僅用 11 天 完成,效率提升超過 150 倍

AI 怎麼在 11 天內搞定 5 年的數學難題?

這次的突破並非 AI「發現」了新定理,而是完成了極其硬核的「形式化證明」。布朗大學等研究團隊啟動了一項宏大計畫:將人類歷史上最複雜的數學證明之一——「費馬最後定理」的現代證明過程,翻譯成電腦看得懂的 Lean 程式碼。由於現代數學極度抽象,這類工作以往需要頂尖數學家手動輸入,既枯燥又極度耗費時間,原本預計要花上整整五年。

然而,研究團隊並沒有讓人類硬幹,而是打造了一個自動化協作系統,讓 Claude 3.5 Sonnet 當主力。關鍵在於,當 AI 寫出的 Lean 程式碼出現邏輯漏洞時,編譯器會報錯;此時,AI 不需人類介入,就能自主閱讀這些報錯訊息、理解自己錯在哪裡,並在幾秒鐘內重新推理、修改程式碼,直到完全無誤。這種「自主除錯(Self-debugging)」的閉環機制,讓 AI 在短短 11 天內,寫出了數千行無 Bug 的嚴密數學證明代碼,直接讓五年的學術規畫提前宣告完成。

  1. 2024 年初:學術團隊啟動「費馬最後定理形式化」專案,估計需 5 年人工投入。
  2. 近期:團隊導入 Claude 3.5 Sonnet,並設計自動化「提示詞-編譯-回饋」鏈結。
  3. 11 天後:AI 成功完成該階段的形式化證明,效率與精準度震驚全球學術界。

台灣怎麼看這件事?

這項技術對台灣的重大意義,在於「高階晶片設計(IC Design)」與「關鍵軟體安全」的驗證革命。台灣身為全球半導體的心臟,聯發科、聯詠等晶片設計大廠在推出新產品前,必須進行極度繁複的硬體驗證(Formal Verification),以確保晶片邏輯萬無一失。如果能將這種「AI 自主除錯與形式化驗證」技術導入台灣的 IC 設計與工業軟體開發流程,將可把動輒數月的測試期縮短至幾天內,大幅降低研發成本,讓台灣半導體供應鏈的效率再次領先全球。

編輯觀點

不要再以為 AI 只會胡言亂語或畫畫了!這次的成果是「AI 代理經濟(Agentic Economy)」的完美實踐。當 AI 擁有像 Lean 這樣的「外掛工具」和即時反饋機制時,它的推理極限會被瞬間拉高。未來,各行各業最搶手的人才,將是那些「懂得如何為 AI 設計完美回饋機制」的架構師。這波巨浪走得極快,不論是學術界還是產業界,如果還不開始佈局推理型 AI 的協作流程,很快就會被這 150 倍的效率怪獸無情淘汰。

常見問題

Q1:AI 這次是自己證明了「費馬最後定理」嗎?
不是。費馬最後定理已在 1994 年被人類數學家安德魯·懷爾斯證明。AI 的工作是把這份極度複雜的人類證明,精確地「翻譯」成電腦可以百分之百驗證的 Lean 程式碼。
Q2:為什麼「形式化證明」這麼困難?
因為它不容許任何一絲模糊空間。日常數學家寫論文可以用「顯而易見」一筆帶過,但形式化證明要求連最微小的邏輯步驟,都必須寫成電腦能完全驗證的嚴格代碼,極耗心力。
Q3:這次突破主要依賴哪一個 AI 模型?
研究團隊主要使用的是 Anthropic 的 Claude 3.5 Sonnet,因為該模型在邏輯推理、程式碼編寫以及理解複雜上下文報錯訊息的能力上,目前處於業界領先地位。
Q4:這項技術能應用在數學以外的地方嗎?
可以,且商業價值極高。最直接的應用是「高安全性軟體驗證」(如自動駕駛、航太控制系統)以及「微處理器與晶片設計驗證」,能確保系統絕不出錯。
Q5:這會讓人類科學家或工程師失業嗎?
不會,但工作型態會改變。AI 扮演的是不眠不休的超強「研究助理」,人類則需要晉升為「導師」與「系統架構師」,負責引導 AI 的研究方向與架構設計。

名詞小教室

Lean 證明助理 (Lean Proof Assistant)
它就像是數學界的「超級文法檢查器」。當你寫下一段數學證明,它會用極度嚴苛的電腦邏輯,幫你檢查每一步有沒有漏洞,確保整篇論述「絕對正確」。