AI 能證明定理,卻還提不出值得問的問題
多倫多大學數學家 Daniel Litt 說,模型最擅長把已知技巧用到極致,但數學真正的價值在於理解——而理解目前還留在人腦裡。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
最讓他改觀的是單位距離問題
Daniel 說,到目前為止他最喜歡的完全自主 AI 結果是 Erdős 單位距離問題的解,大約五月中旬公布。他之所以看重它,是因為這個結果有點創造性:它從 60 年代的經典想法裡借來技巧,但這些技巧對研究平面點構型的人來說是新的。而且事後證明它很有生產力——一批數學家拿這些想法去構造了其他開放問題的反例,比如實數上的和積猜想。他把這稱為目前他知道的唯一一個「事後看確實帶來了新理解」的自主結果。
— Daniel Litt模型的推理鏈看起來非常像人
主持人問這是否是「非人的」邏輯推演,Daniel 反駁說,他認為這個論證非常人類。OpenAI 放出的一些思維鏈在他看來完全可以辨認——如果他想像自己解題時的思維鏈,大概就長那樣。他說他研究過的大多數結果都是這樣:不像有什麼「第 37 手」的神來之筆,就是一個人類數學家在做人做的數學。模型唯一顯得非人的地方是不知疲倦、知道得多。
— Daniel Litt數學可驗證這個說法被高估了
Daniel 說,很多人說數學是可驗證領域,所以 AI 進步快。但他的判斷是:模型主要在擴展非形式化推理,而不是 Lean 證明,所以這些技術很可能泛化到其他領域。他還指出,大量數學訓練數據並不反映數學家怎麼思考——論文是打磨過的,教科書幾乎不展示動機,所以想跟上研究方向,通常得直接跟研究者聊。
— Daniel Litt模型強在應用已知技巧,弱在直覺
Daniel 說,模型的結果有固定風味:依賴它們的長計算能力,或把許多領域、許多論文裡的技術想法拼起來。但它們在直覺和大局觀上更弱。他描述自己的工作方式:先有一個非常不嚴格的哲學,覺得這個東西類比於那個東西,然後努力把它精確化。而目前最好的模型結果裡,看不到多少這種推理。他強調,非常擅長應用所有已知技巧本身是強大的,也有數學家靠這個做出高質量工作,但那只是數學家關心的一小片窄帶。
— Daniel Litt人證不出來,反而逼出了更好的定理
Daniel 講了他唯一一篇模型有用的論文。有個引理他想證,所有前沿模型都證不出來。於是他自己算了一堆例子,意識到也許有個更好的陳述,找到之後模型很快就證明了那個更好的版本。他說,現在把原來那個引理丟給 ChatGPT 5.6 Pro,它會輸出你見過最糟的證明——十頁殘酷計算,毫無洞見。那個證明本身沒錯,但不會帶來這個更漂亮的概念性解釋。他說自己當時意識到這個醜陋的證明可行,但實在下不去手,所以去找了另一個論證。
— Daniel Litt現有激勵正在批量生產垃圾論文
Daniel 說,數學的目標不是生產論文,而是生產理解。但現在的激勵結構不鼓勵人真正投入。他描述了一個實驗:讓 Codex 上網找五篇代數幾何的近期猜想並證明它們,來回幾次後,一小時內就得到三篇很糟但正確的論文,現在躺在他硬盤上。他說 arXiv 上投稿量暴漲,很多明顯低質量,甚至同一證明、同一定理在幾天內出現三到五篇。他認為這不一定是模型變好就會消失的問題。
— Daniel Litt一千個數學家還是一個數學家複製一千次
Daniel 說,數學的進步來自讓一千朵花開放,人們追隨自己的好奇心,知識邊界以某種相對均勻的方式擴張,然後機會主義地出現應用。他擔心的是:如果讓數學探索從屬於模型想追求的東西,你得到的可能是一個數學家被複制一千次,而不是一百萬個數學家做一百萬件不同的事。主持人補充說,如果實驗室推出來的證明都收斂在相似的東西上,因為它們技術上依賴同一批文獻,那這種多樣性直覺從哪裡來就不清楚了。
— Daniel Litt模型證明短,是因為它檢查不了長的
有人誇模型證明短而漂亮,Daniel 的判斷相反:它們不產出又長又複雜的證明,是因為做不到——檢查正確性的能力還不夠。他說,就算讓模型寫短證明,你再問它這對不對,它經常自己說不對。長證明的問題是模型可能不知道自己錯了。他舉例:OpenAI 最近放出的十個問題都在 Lean 裡形式化了,這是它們為真的有力證據;他毫不懷疑還有更多沒法形式化的,因為前置引理還沒進 Mathlib。他還提到有人貼出 800 頁 AI 生成的奇點消解證明,他說這絕不可能是對的。
— Daniel Litt原話 · 已逐字校驗
I actually think the argument was very human.
我其實認為這個論證非常人類。
Daniel Litt6:11
It's like a human mathematician doing math. It's like a human mathematician doing certain types of math.
就像一個人類數學家在做人做的數學。就像一個人類數學家在做某幾類數學。
Daniel Litt7:12
the goal of mathematics is not to produce mathematics papers. Um, like it's to produce some kind of understanding.
數學的目標不是生產數學論文,而是生產某種理解。
Daniel Litt34:44
a lot of progress in mathematics comes from like letting you know, a thousand different flowers bloom and people pursue their own curiosity
數學的很多進步來自讓一千朵不同的花開放,讓人們追隨自己的好奇心。
Daniel Litt37:45
if what you're getting is like one mathematician duplicated a thousand times or like actually you know a million different mathematicians doing a million different things.
你得到的是一個數學家被複制一千次,還是一百萬個不同的數學家在做一百萬件不同的事。
Daniel Litt38:46
they will still sometimes produce things that are just wrong and they know they're wrong.
它們有時還是會產出就是錯的東西,而且它們自己知道是錯的。
Daniel Litt53:13
there's no way it's correct. Like, this will be a major result.
它絕不可能是對的。那會是一個重大結果。
Daniel Litt54:13
數字與實體
| Erdős 單位距離問題 AI 自主解公布時間 | 五月中旬 | 3:09 |
| Codex 一小時產出的論文數 | 3 篇很糟但正確的論文 | 35:45 |
| OpenAI 形式化發布的問題數 | 10 個,全部在 Lean 中形式化 | 53:13 |
| AI 生成的奇點消解證明頁數 | 800 頁 | 54:13 |
| Daniel 女兒能可靠計算的數字範圍 | 30 以內可靠,50 半可靠 | 59:31 |
術語
- LeanLean 證明助手
- 一種形式化數學證明的編程語言與驗證器,證明可被機器逐行檢查。
- MathlibMathlib 數學庫
- Lean 生態中規模最大的形式化數學定理庫,前置引理需先入庫才能形式化新證明。
- Erdős unit distance problemErdős 單位距離問題
- 平面點構型中關於單位距離出現次數的經典問題,長期被認為有上界,後被反例推翻。
- sum product conjecture和積猜想
- 實數上關於加法與乘法不能同時保持小集合的猜想,後被構造出反例。
- resolution of singularities奇點消解
- 代數幾何中把奇異簇化為光滑簇的經典定理,正特徵情形長期未完全解決。
收聽指南
對 AI 數學能力有判斷需求的工程師和研究者,以及想知道「模型到底強在哪、弱在哪」的技術決策者。
最後十分鐘聊女兒學數學和二十面體玩具,與主線判斷無關。