世界太吵,來原聲聽播客

a16z

AI 能證明定理,卻還提不出值得問的問題

多倫多大學數學家 Daniel Litt 說,模型最擅長把已知技巧用到極致,但數學真正的價值在於理解——而理解目前還留在人腦裡。

AI 數學推理能力學術激勵形式化驗證模型邊界

原視頻在 YouTube 上放不出來,用音頻聽:

一位一線數學家對 AI 數學能力的誠實校準:哪些結果真讓他改觀,哪些只是標題黨。信息密度高,適合想聽內行判斷的人。

核心論點 · 點時間戳可跳到原聲

3:09

最讓他改觀的是單位距離問題

Daniel 說,到目前為止他最喜歡的完全自主 AI 結果是 Erdős 單位距離問題的解,大約五月中旬公布。他之所以看重它,是因為這個結果有點創造性:它從 60 年代的經典想法裡借來技巧,但這些技巧對研究平面點構型的人來說是新的。而且事後證明它很有生產力——一批數學家拿這些想法去構造了其他開放問題的反例,比如實數上的和積猜想。他把這稱為目前他知道的唯一一個「事後看確實帶來了新理解」的自主結果。

— Daniel Litt
6:11

模型的推理鏈看起來非常像人

主持人問這是否是「非人的」邏輯推演,Daniel 反駁說,他認為這個論證非常人類。OpenAI 放出的一些思維鏈在他看來完全可以辨認——如果他想像自己解題時的思維鏈,大概就長那樣。他說他研究過的大多數結果都是這樣:不像有什麼「第 37 手」的神來之筆,就是一個人類數學家在做人做的數學。模型唯一顯得非人的地方是不知疲倦、知道得多。

— Daniel Litt
9:13

數學可驗證這個說法被高估了

Daniel 說,很多人說數學是可驗證領域,所以 AI 進步快。但他的判斷是:模型主要在擴展非形式化推理,而不是 Lean 證明,所以這些技術很可能泛化到其他領域。他還指出,大量數學訓練數據並不反映數學家怎麼思考——論文是打磨過的,教科書幾乎不展示動機,所以想跟上研究方向,通常得直接跟研究者聊。

— Daniel Litt
10:15

模型強在應用已知技巧,弱在直覺

Daniel 說,模型的結果有固定風味:依賴它們的長計算能力,或把許多領域、許多論文裡的技術想法拼起來。但它們在直覺和大局觀上更弱。他描述自己的工作方式:先有一個非常不嚴格的哲學,覺得這個東西類比於那個東西,然後努力把它精確化。而目前最好的模型結果裡,看不到多少這種推理。他強調,非常擅長應用所有已知技巧本身是強大的,也有數學家靠這個做出高質量工作,但那只是數學家關心的一小片窄帶。

— Daniel Litt
29:42

人證不出來,反而逼出了更好的定理

Daniel 講了他唯一一篇模型有用的論文。有個引理他想證,所有前沿模型都證不出來。於是他自己算了一堆例子,意識到也許有個更好的陳述,找到之後模型很快就證明了那個更好的版本。他說,現在把原來那個引理丟給 ChatGPT 5.6 Pro,它會輸出你見過最糟的證明——十頁殘酷計算,毫無洞見。那個證明本身沒錯,但不會帶來這個更漂亮的概念性解釋。他說自己當時意識到這個醜陋的證明可行,但實在下不去手,所以去找了另一個論證。

— Daniel Litt
35:45

現有激勵正在批量生產垃圾論文

Daniel 說,數學的目標不是生產論文,而是生產理解。但現在的激勵結構不鼓勵人真正投入。他描述了一個實驗:讓 Codex 上網找五篇代數幾何的近期猜想並證明它們,來回幾次後,一小時內就得到三篇很糟但正確的論文,現在躺在他硬盤上。他說 arXiv 上投稿量暴漲,很多明顯低質量,甚至同一證明、同一定理在幾天內出現三到五篇。他認為這不一定是模型變好就會消失的問題。

— Daniel Litt
37:45

一千個數學家還是一個數學家複製一千次

Daniel 說,數學的進步來自讓一千朵花開放,人們追隨自己的好奇心,知識邊界以某種相對均勻的方式擴張,然後機會主義地出現應用。他擔心的是:如果讓數學探索從屬於模型想追求的東西,你得到的可能是一個數學家被複制一千次,而不是一百萬個數學家做一百萬件不同的事。主持人補充說,如果實驗室推出來的證明都收斂在相似的東西上,因為它們技術上依賴同一批文獻,那這種多樣性直覺從哪裡來就不清楚了。

— Daniel Litt
52:13

模型證明短,是因為它檢查不了長的

有人誇模型證明短而漂亮,Daniel 的判斷相反:它們不產出又長又複雜的證明,是因為做不到——檢查正確性的能力還不夠。他說,就算讓模型寫短證明,你再問它這對不對,它經常自己說不對。長證明的問題是模型可能不知道自己錯了。他舉例:OpenAI 最近放出的十個問題都在 Lean 裡形式化了,這是它們為真的有力證據;他毫不懷疑還有更多沒法形式化的,因為前置引理還沒進 Mathlib。他還提到有人貼出 800 頁 AI 生成的奇點消解證明,他說這絕不可能是對的。

— Daniel Litt

原話 · 已逐字校驗

I actually think the argument was very human.

我其實認為這個論證非常人類。

Daniel Litt6:11

It's like a human mathematician doing math. It's like a human mathematician doing certain types of math.

就像一個人類數學家在做人做的數學。就像一個人類數學家在做某幾類數學。

Daniel Litt7:12

the goal of mathematics is not to produce mathematics papers. Um, like it's to produce some kind of understanding.

數學的目標不是生產數學論文,而是生產某種理解。

Daniel Litt34:44

a lot of progress in mathematics comes from like letting you know, a thousand different flowers bloom and people pursue their own curiosity

數學的很多進步來自讓一千朵不同的花開放,讓人們追隨自己的好奇心。

Daniel Litt37:45

if what you're getting is like one mathematician duplicated a thousand times or like actually you know a million different mathematicians doing a million different things.

你得到的是一個數學家被複制一千次,還是一百萬個不同的數學家在做一百萬件不同的事。

Daniel Litt38:46

they will still sometimes produce things that are just wrong and they know they're wrong.

它們有時還是會產出就是錯的東西,而且它們自己知道是錯的。

Daniel Litt53:13

there's no way it's correct. Like, this will be a major result.

它絕不可能是對的。那會是一個重大結果。

Daniel Litt54:13

數字與實體

Erdős 單位距離問題 AI 自主解公布時間五月中旬3:09
Codex 一小時產出的論文數3 篇很糟但正確的論文35:45
OpenAI 形式化發布的問題數10 個,全部在 Lean 中形式化53:13
AI 生成的奇點消解證明頁數800 頁54:13
Daniel 女兒能可靠計算的數字範圍30 以內可靠,50 半可靠59:31

術語

LeanLean 證明助手
一種形式化數學證明的編程語言與驗證器,證明可被機器逐行檢查。
MathlibMathlib 數學庫
Lean 生態中規模最大的形式化數學定理庫,前置引理需先入庫才能形式化新證明。
Erdős unit distance problemErdős 單位距離問題
平面點構型中關於單位距離出現次數的經典問題,長期被認為有上界,後被反例推翻。
sum product conjecture和積猜想
實數上關於加法與乘法不能同時保持小集合的猜想,後被構造出反例。
resolution of singularities奇點消解
代數幾何中把奇異簇化為光滑簇的經典定理,正特徵情形長期未完全解決。

收聽指南

誰該聽

對 AI 數學能力有判斷需求的工程師和研究者,以及想知道「模型到底強在哪、弱在哪」的技術決策者。

可跳過

最後十分鐘聊女兒學數學和二十面體玩具,與主線判斷無關。