AI解開著名數學難題,但最後一步之前人類已經做了大半的活
那個被稱為AI攻克世紀難題的證明,關鍵構造由人類團隊手寫數月完成,模型只是搶先把最後一步跑完併發布。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
AI證明數學「既全管又全不管」
模型現在既會生成證明也會和證明檢查器互動,但它本身很不擅長檢查自己寫的證明是否正確。去年的一個關鍵轉變是:給大模型配一個叫Lean的編程語言模塊,把猜想翻譯成這套語言寫出來,再由Lean這個非AI的軟件逐步核驗每一步是否符合基本邏輯公理。真正讓人能多信一點AI數學結果的,不是模型本身變聰明了,而是這套「模型生成+獨立軟件核驗」的分工結構。
— Justin Solomon定理證明者這類數學家先被衝擊
數學家被分成「理論建構者」(自己提出該研究什麼問題)和「定理證明者」(解答別人留下的經典難題)。後者目前承受的衝擊更大:很多人花了幾十年鑽研一個邊界清晰、早已定義好的難題,而AI工具恰恰擅長挑這種「已經接近被證明」的問題,接手做完最後一程。相比之下,判斷一個問題是否值得研究、是否有洞見,仍然高度依賴人的判斷。
— Justin Solomon從證明稀缺到證明過剩的轉型
以前判斷一個數學家水平高低的幾個指標——發表在哪、寫了多少、成果是否有趣、是否拿獎——彼此是高度相關的,因為寫出一個證明本身就很稀缺、很耗工夫。按Terence Tao的說法,現在進入了「證明過剩」時代,這些指標開始互相脫鉤:AI公司發現證明一個大定理本身就是一條好新聞稿,而寫對prompt變成了一種新的、帶經濟價值的技能,這讓「誰真正貢獻了洞見」變得模糊。
— Justin Solomon數學界的「奉承」已變成郵件轟炸
Justin最近收到大量來自外部人士的郵件:他們拿AI工具證明了一個「新結果」,AI告訴他們這很重要,於是他們找MIT教授來驗證。他自己也測試過,AI在他的研究領域沒能解開任何真正的開放問題,但證明了一個很表面的小結論後,還貼心地問要不要幫忙轉換成期刊投稿模板。同樣的審核危機也發生在整個學術界:機器學習頂會ICLR的投稿量十年間從一兩千篇漲到六萬篇,根本沒有足夠的人力去審,甚至出現高中生混進同行評審系統的情況。
— Justin Solomon納維-斯托克斯反例背後真正的作者
媒體熱炒的那個「證偽納維-斯托克斯方程」的反例,核心構造其實是一個西班牙數學家團隊用紙筆花了很長時間推出來的,AI只是在此基礎上完成了關鍵的最後一步,而且過程中還捲入了兩個AI團隊之間關於歸屬的「人際糾紛」。這揭示了一種學界目前沒有答案的署名難題:當人類打好大半地基、模型補完最後一程時,功勞到底該怎麼分。
— Justin Solomon誰的算力多,誰就贏數學獎
當外界風傳有人快要證出納維-斯托克斯反例時,OpenAI被認為是在最後關頭瘋狂砸算力搶先完成證明併發布。OpenAI隨後表示不需要Clay數學研究所的百萬美元獎金——因為他們兩分鐘燒掉的算力成本就夠了。普通學者根本沒有這種砸錢能力,而且頂尖實驗室手裡始終握著一個比學界能拿到的版本領先一兩代的內部模型,這個問題在教育領域同樣存在:擁有更貴AI訂閱賬戶的學生,作業質量可能天然更好。
— Justin SolomonAI證明還困在「已知的凸包」裡
按Justin同事Nestor Guillen的分析,目前AI產出的大部分數學證明,本質上是把已經知道的事實用精巧的方式重新組合、填補計算空白,停留在「已知知識的凸包」內部,還沒有出現真正憑空提出一個全新理論的例子。這也是判斷AI能否「遞歸自我改進」——自己提出下一個值得研究的問題——的關鍵未決問題,而不只是能不能解答別人已經提出的問題。
— Justin SolomonMIT用舉重類比重新設計作業
過去一兩年,學生作業的得分幾乎都接近滿分,因為AI可以悄悄代寫。MIT沒有選擇禁用AI,而是把作業重新定義成「舉重」——做作業本身不是目的,是為了變得更強,所以在作業之後加了一個照搬作業題的小測驗來檢驗學生是不是真的理解了,並給項目加入口頭答辯環節,確保考核的是學生本人,而不是Claude的能力。
— Justin Solomon原話 · 已逐字校驗
And these AI tools are sort of at least good at sort of cherry picking the ones that are somehow close to being proved and taking that last mile in some cases.
這些AI工具至少擅長挑選那些已經接近被證明的問題,然後在某些情況下完成最後一程。
Justin Solomon23:31
The way that Terence Tao put it is that it used to be we were in this era of proof scarcity, that mathematicians, it was really hard. And it was this very bespoke object that took a lot of craftwork and training to produce. Now we're in this era of proof abundance.
按Terence Tao的說法,以前我們處在證明稀缺的時代,對數學家來說非常難,證明是一種需要大量手藝和訓練才能打造出來的定製品。現在我們進入了證明過剩的時代。
Justin Solomon25:32
what I've noticed lately is I get a lot of emails from outside folks that sort of, they've been playing with their AI system, they've proven a new result, and the AI told them it was really important and they need an MIT professor to validate, which is absolutely fascinating.
我最近注意到的是,我收到很多外部人士的郵件,他們一直在玩自己的AI系統,證明了一個新結果,AI告訴他們這非常重要,於是他們需要一位MIT教授來驗證,這實在是太有意思了。
Justin Solomon26:35
the construction of that spoon arguably was done in large part by a team in Spain of human mathematicians on pen and paper.
那把勺子的構造,可以說很大一部分是由西班牙的一個人類數學家團隊用紙筆完成的。
Justin Solomon34:45
OpenAI was quick to say that they don't need the million dollars, because of course they don't. In two minutes, they're burning through a million dollars worth of compute anyway.
OpenAI很快表示他們不需要那一百萬美元,這當然是因為他們不需要——反正兩分鐘內他們燒掉的算力成本就有一百萬美元。
Justin Solomon39:48
they're arguably in what mathematicians might call the convex hole of existing knowledge, meaning there's sort of a bunch of stuff we already know.
可以說它們都處在數學家所說的「已有知識的凸包」之內,也就是說那都是我們已經知道的一堆東西。
Justin Solomon44:55
What we observed in the last year or two is that our students are getting nearly 100% on all their homeworks.
過去一兩年我們觀察到的是,我們的學生在所有作業上幾乎都能拿到接近100%的分數。
Justin Solomon50:02
數字與實體
| Clay數學研究所千禧年難題獎金 | 100萬美元 | 38:48 |
| 頂尖AI模型賬戶月費 | 約200美元/人/月 | 41:51 |
術語
- LeanLean證明語言
- 一種把數學證明寫成代碼、再由軟件逐步核驗每一步是否符合邏輯公理的編程語言。
- Navier-Stokes equations納維-斯托克斯方程
- 描述流體運動的方程組,其解是否永遠存在且不發散是數學界著名的未解難題之一。
- Clay Math InstituteClay數學研究所
- 設立「千禧年大獎難題」、為每個被證明的世紀數學難題提供百萬美元獎金的機構。
- convex hull凸包
- 此處指AI證明目前只是在已知事實範圍內重新組合,還沒跳出這個範圍產生全新理論。
收聽指南
關心AI數學突破新聞是否被誇大的人,以及高校教師、科研管理者和判斷AI公司科研公關敘事的投資人。
開場聊《心靈捕手》和納維-斯托克斯概念科普的前15分鐘可以快進,核心內容從17分鐘後展開。