Claude 花 11 天做完數學界預期要好幾年的事:費馬最後定理的第一份電腦可驗證證明,官方數字全公開
文章最後更新:2026-09-06
Anthropic 公布了一件在 AI 圈與數學圈都算重量級的事:一個內部模型在 11 天內,完成了費馬最後定理的第一份端到端、電腦可驗證的形式化證明。數學界原本預期這件事要花好幾年。
我們直讀 Anthropic 官方研究頁,把數字與「人到底做了多少」整理如下——因為這兩件事決定了這則消息該怎麼解讀。
一、官方公布的數字
| 項目 | 官方數字 |
|---|---|
| 使用的模型 | 「一個大致相當於 Claude Fable 5.1 的通用內部研究模型」 |
| 耗時 | 11 天(完成於 2026-08-17 至 18) |
| 產出的 Lean 程式碼 | 1,300 萬行 |
| 證明的定理數 | 30,300 條(其中 29,500 條用於最終證明) |
| 耗用輸出 token | 約 60 億 |
| 失敗嘗試佔比 | 非樣板程式碼中約 7% 來自失敗的嘗試 |
二、什麼是「形式化」,為什麼重要
一個大型數學證明要確認正確,人工審查可能要花好幾年。形式化就是把數學推理翻譯成 Lean 這類證明輔助工具看得懂的形式,讓電腦來驗證每一步。
換句話說,這件事的價值不在於「AI 證明了費馬最後定理」——證明是 Wiles 在 1990 年代做出來的——而在於把那份證明變成電腦可以逐步檢查的版本,而且用了 11 天而不是好幾年。
官方也提到,這是 Freek Wiedijk 那份著名的「100 個形式化挑戰」清單上的最後一項,等於為一個 20 年的基準畫下句點。
三、人做了多少?官方講得很誠實
這是最容易被誇大的部分,官方頁的說法值得原樣引述:
- 模型「大致上自主運作」,研究員 Tianyi Peng 只給偶爾的高層次指示,例如「Jacobian 當作 scheme 來處理聽起來優先度高」。
- 人類的數學輸入「僅限於偶爾的高層次指示」。
- 完成後由數學家 Kevin Buzzard 進行審查。
也就是說:不是完全無人監督,但人類介入的是方向而非內容。這個區別對想理解「AI 現在能做多長的自主工作」的人很關鍵。
四、關鍵工具:Prove2Me
官方把突破歸因於一個開源平台 Prove2Me——一個「協作形式化數學的開放平台」,它維護定理之間的相依關係、加速編譯、並讓定理可以被搜尋與重複使用。有報導補充說它維護一張定理陳述的有向無環圖,並協調多個 Claude 代理針對它工作。
這對一般開發者也有啟發:讓長時間自主工作變得可行的,往往不是模型本身,而是外部的狀態管理與驗證機制。有一個能持續累積、可查詢、可自動驗證的結構,代理才不會在幾百步之後迷失。
五、官方自己講的缺點
Anthropic 頁面明白寫著:這份證明很可能比它需要的長得多——相較於 Mathlib(Lean 的標準數學庫)簡潔的風格。
這是誠實而重要的一句。1,300 萬行不是優點,是還沒被整理過的量體。對照到日常使用,也是同一個經驗:AI 可以把事情做完,但做完不等於做得精簡。
六、待查核
- 使用的內部模型是否會以產品形式推出:官方只說「大致相當於 Claude Fable 5.1」,待查核。
- 這 60 億輸出 token 的推論成本:官方未公布,待查核。
- Prove2Me 的授權與一般開發者可用程度:官方頁未詳述,待查核。
查核於 2026-09-06。來源:Anthropic 官方研究頁、官方論文 PDF。內容隨時可能更新。Claude 各方案的差別,見我們的 Claude 工具頁。
阿莫和皮米怎麼看
寫長文、做內容:Pro US$20/月值得。純免費用戶要有心理準備,額度滾動制用完就得等,而且沒有 Claude Code。團隊用建議年繳省 20%。

