AI物理學的真正瓶頸不是算力不夠,而是描述語言不夠好
數學已經有證明驗證工具讓AI能自我迭代改進,物理沒有——同一個『謎題』換一套描述框架就變得顯而易見,真正卡住進展的是語言,不是智力。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
一場數學證明提前兩年成真
2026年3月,Math Inc.用AI自動證明了Maryna Vyazovska憑此獲菲爾茲獎的高維球堆積問題。Gorard原本預計這要到2027年末甚至2028年才會發生,結果提前了大約兩年。他的反應不是「AI真強」,而是「我想問題想錯了,時間線完全錯了」——這不只是改了科研規劃,而是改了他對整個人生的規劃。更嚴重的是,學術界根本沒有時間適應這個變化。
— Jonathan Gorard學術界靠模糊兩字融資百年
學術界一直刻意模糊「science as product」(解決真實問題)和「science as process」(驅動好奇心)的界限:用後者為前者融資,聲稱好奇心終會產生有用的東西。他舉例,數論研究者常聲稱自己的工作與密碼學相關,但現實中密碼學用的都是千年前就有的數學。這套正當化系統花了上百年才建立起來,而一旦AI能獨立完成「product」,就沒人再需要為「process」付錢了。
數學有驗證工具,物理沒有
這是AI在不同學科進展懸殊的關鍵原因。AI在coding和數學上的突破依賴形式驗證工具——compiler、Lean、Agda這類proof assistant,讓AI能無監督自我改進,因為它能立刻知道自己對不對。但物理、化學、生物、工程都沒有對應的驗證管道。Hilbert在20世紀初就想為物理做數學那套形式化工作,但失敗了。正因缺這套工具,AI在自然科學上的進展遠落後於代碼和數學。
觀察本身早已帶著理論
物理和數學的根本區別在於:數學不需要處理「實驗驗證」,物理必須處理。Kuhn和Hanson早就指出不存在「純粹觀察」——任何觀察都在某個理論框架內發生,無論是語義層面(「檢測到一個粒子」背後藏著幾十層理論假設)還是知覺層面(光學錯覺就是明證)。想自動化科學推理,不能簡單把觀察和預測做匹配,必須把整個理論框架空間都參數化進去。
AI能力曲線來自工具鏈不是模型
Gorard的判斷是:當前AI能力提升不來自transformer模型本身的改進,而來自post-training、reinforcement learning、harness、tools、skills這類周邊構造。他認為transformer對啟動這輪革命很關鍵,但最終不會是關鍵部分——驗證這個假設的辦法很簡單,把底層LLM換成擴散模型,同時保留所有post-training和reinforcement learning管道,看結果是否一樣。
— Jonathan Gorard物理的謎其實是語言的卡
一個看起來是「基礎之謎」的東西,其實只神秘於某一個特定模型。黑洞面積定律在廣義相對論裡很神秘,但換到邊界場論的對偶描述裡就是熱力學,「totally obvious」;波粒二象性在粒子框架裡看不懂,換到波的框架裡就理解了。Gorard由此推論:很多「物理卡殼」其實是描述語言卡殼,不是現實本身設下的限制。
— Jonathan Gorard他最怕AI自動化掉的是快樂
Gorard對老一輩學者欣然擁抱Claude做研究感到困惑——他們說「太好了,我可以用它讀論文、解方程、寫代碼」,他的反應卻是「等等,那正是我喜歡的部分」。這暴露了一個代際分歧:不是AI能力夠不夠的問題,而是誰來擁有「思考的快樂」。他對這種工作方式的牴觸並不新,年輕時就已經對17世紀浪漫的自然哲學與如今充滿調試的計算物理之間的落差感到失望。
— Jonathan GorardAI真正瓶頸是描述語言不是算力
Gorard把整集的發現收束成一句話:AI能力當前被描述語言卡住,這不是說AI不夠聰明,而是說現在用來表達物理學的形式語言還不夠好。如果缺少驗證管道,AI反而會導致「溶液化」——能生成假說、能寫論文,卻沒有能力檢查理論一致性或實驗有效性,結果是假說爆炸但沒有實質理解進展。問題在工具,不在模型。
— Jonathan Gorard原話 · 已逐字校驗
The output happens more or less independently of the input or the process. And so now the justification mechanisms that exist societally don't exist anymore.
成果與投入和過程基本脫鉤了。於是社會層面那套用來正當化科研的機制也就不存在了。
Jonathan Gorard13:31
anytime you make an observation, anytime you perform a measurement, you are doing so relative to an existing theoretical framework.
任何一次觀察、任何一次測量,都是相對於某個既存的理論框架而進行的。
Jonathan Gorard46:10
the curve in AI capabilities at the moment is not coming from improvements in the transformer model. It's coming from improvements in post-training, reinforcement learning, harnesses, tools, skills, all these kinds of things.
當下AI能力的上升曲線不是來自transformer模型本身的改進,而是來自post-training、reinforcement learning、harness、tools、skills這些東西的改進。
Jonathan Gorard54:16
we're getting smarter not because our brains are getting better, but because our tools are getting better.
我們變聰明不是因為大腦變好了,而是因為工具變好了。
Jonathan Gorard56:17
the pleasure for me was in you know was in writing out the equations it was in figuring out the algorithms it was in thinking about these questions it was in reading you know other people's thoughts about these things the idea that uh reducing frictions in those areas was somehow a good was completely alien to me
我的快樂在於寫出方程、設計算法、思考這些問題、閱讀別人在這些事情上的思想。「減少這些地方的摩擦是件好事」這種想法對我來說完全陌生。
Jonathan Gorard1:46:44
數字與實體
| AI證明球堆積難題與Gorard預期時間線之差 | 約2年(提前) | 3:04 |
| 一次觀察背後隱含的理論假設層數 | 20-50層 | 47:10 |
| Gorard認為實驗物理相對安全的時間範圍 | 2年內 | 1:42:37 |
| Gorard歸納的描述語言歷史演進階段數 | 4個:自然語言、幾何、分析、計算 | 1:57:17 |
術語
- description language描述語言
- 用來表達和建模物理/數學現實的形式語言體系
- proof assistant證明助手(如Lean、Agda)
- 能機器核驗數學證明每一步是否嚴格成立的軟件工具
- Sapir-Whorf hypothesis薩丕爾-沃爾夫假設
- 語言結構會塑造使用者思維方式的假說
- slopification溶液化
- AI大量生成未經驗證的假說和論文導致研究失序的風險
- Flynn effect弗林效應
- 人類平均智力測驗得分隨時間持續上升的現象
- harnessAI工具編排框架
- 圍繞模型搭建的工具調用、技能和流程控制層,而非模型本身
收聽指南
關心AI對科研/學術體系真實衝擊的研究者、做AI產品或投資AI的人,以及想理解『AI瓶頸到底卡在哪』而非泛泛焦慮的人。
中段關於理解可傳遞性與教育哲學的討論較學術化,可快進。