室溫超導體不會被AI一次性推算出來,得靠實驗室硬試
密度泛函理論再完美也裝不下10的23次方個原子,科學發現的本質就是訓練數據之外的東西——這是為什麼連下一代大模型也得靠物理實驗室反覆試錯。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
實驗環境換了,獎勵函數不能照搬
Periodic的強化學習環境直接來自物理實驗室,數據沒有標準答案,充斥噪聲、儀器誤差和不完整的遙測——比如以為爐溫是某個數值,實際卻偏離了一截。做數學或代碼優化時精度很高,但在材料發現裡,連東西從爐子裡出來時都沒貼標籤,連標註過程本身都是隨機的。這要求一套不同於數字環境的推理策略:在高度不確定下做決策,並且極度高效地利用有限數據,因為你不能像數字環境那樣隨意增加 rollout。
— Liam Fedus物理學遠沒有被解決
Dirac當年寫完量子力學教科書後據說說過「剩下的都是化學問題」,但過去一百年證明這並不成立——氮和氧的相互作用遠不是氫原子的簡單推廣。至今仍有大片物理沒搞懂:比如銅酸鹽這類高溫超導體不遵循傳統電聲子耦合理論(可以用同位素效應驗證的那套),但沒人知道它們遵循什麼物理。密度泛函理論一旦遇到強電子關聯也會失效。這正是Periodic押注AI介入材料科學的理由:理論、計算、實驗三條線都還有大量空白要填。
— Ekin Doğuş Çubuk即便DFT完美,也替代不了實驗室
密度泛函理論(DFT)把量子力學裡指數級增長的希爾伯特空間問題,壓縮成只需計算電荷密度這個三維對象,由此可以把原本不可計算的東西變得可算。但現實中用的DFT仍是近似——交換關聯泛函和動能泛函都還沒有精確形式。更關鍵的是,就算有一天拿到了理論上完全精確的DFT,也裝不下10的23次方個原子進一臺計算機,所以實驗室依然是繞不開的。
— Ekin Doğuş Çubuk每臺儀器都要有140 IQ
隨著實驗規模擴大,靠技術員盯著電鏡圖像判斷形貌很快就跟不上節奏,一套簡單的自動取景截圖程序產出的數據也「太笨」用不上。於是Periodic把AI系統直接裝進每臺儀器,讓儀器本身知道這次實驗的意圖是什麼、想合成什麼、此前有哪些證據——在採集數據的當下就做更智能的判斷,這樣產出的數據對後續AI訓練和計算預測才更有價值。延遲也是硬約束:如果調用模型推理的速度跟不上物理過程本身的時間尺度,這套系統就不可行,有點像自動駕駛。
— Liam Fedus全自動化是非目標,人形機器人反而更慢
Periodic認為直接上人形機器人去解決實驗室自動化,反而會拖慢實現目標的速度。更現實的路徑是人機混合:哪些環節是人類擅長的高難度動作但自動化要花幾個月,就先不碰;哪些是佔用大量科學家和技術員時間、又容易自動化的常規操作,就優先拿下。實驗室真正要的是大量、高質量、多樣化的數據,完全自主運行本身從來不是目標,自動化只是服務於數據目標的手段。
— Liam Fedus文獻天生只發表正樣本,他們自己攢負樣本
訓練一個分類器,如果沒有負樣本,光有正樣本是訓練不出來的,而材料科學文獻有系統性偏差——人們發表能合成出來的晶體,幾乎不發表失敗的嘗試,而且永遠無法確定一種晶體究竟是「不可合成」還是單純「還沒找對方法」。Periodic自己跑實驗,恰恰能攢下大量帶著完整上下文的負結果,用來訓練分類模型;比起最終結果,他們更想把整個科學過程——包括一連串失敗後如何迭代出正確結果——都變成訓練數據。
— Ekin Doğuş Çubuk沒人能零次推算出室溫超導體
哪怕未來的前沿模型比今天強得多,也依然得去跑實驗才能拿到結果,原因是機器學習擅長的是它被訓練過的東西,而科學發現按定義就是你沒被訓練過的東西。正因為如此,Periodic才要建實驗室,讓開源或閉源模型都能真正「擺弄宇宙」——數學和理論計算機科學裡能看到的零樣本飛躍,不會直接搬到物理世界裡發生。
— Ekin Doğuş Çubuk合成才是真正瓶頸,不是缺理論
以二硼化鎂(MgB₂)為例:日本團隊發現它是迄今常壓下溫度最高的常規超導體,靠的不是理論預測,而是硬試了大約三萬種材料,其中三十種顯示出有意思的超導跡象——而當時BCS理論早在1957年就已經提出,這種材料也早就作為前驅物擺在貨架上幾十年沒人在意。Periodic的判斷是:能想到哪些化學空間可能孕育超導體並不難,難的是把它們真正合成出來;如果實驗室自動化規模化,相當於把一個科學家一輩子能試的次數壓縮到一個月內完成,本質上是在擴大「運氣」發生的面積。
— Ekin Doğuş Çubuk原話 · 已逐字校驗
No amount of rereading that textbook or paper, thinking, or disappearing into a room is going to allow you to think through all possible experimental outcomes, expected and unexpected, and you really need this iterative process.
把教科書或論文反覆讀多少遍、怎麼冥思苦想、把自己關進房間琢磨,都不可能讓你想清楚所有可能的實驗結果——無論是預期之內還是預期之外的,你真正需要的是這種迭代過程。
Liam Fedus0:00
It’s not enough just to do optimization against, some answers that were known in some papers or textbooks because we’re going beyond that, and I think that’s one of the biggest differences.
光針對論文或教科書裡已知的答案做優化是不夠的,因為我們要做的是超越那些已知答案,我認為這是最大的區別之一。
Liam Fedus2:49
But then higher-temperature superconductors like cuprates, like the ones that are above 77 kelvin, like 93 kelvin, turns out don’t obey that physics. But we don’t know what physics they obey. They’re just incredible superconductors.
但像銅酸鹽這樣的高溫超導體,高於77開爾文、比如93開爾文的那些,其實並不遵循那套物理規律。可我們並不知道它們到底遵循什麼物理規律,它們就是一類不可思議的超導體。
Ekin Doğuş Çubuk14:50
And then even if we had perfect DFT, I still think we’d need a lab because we. Even if we had perfect DFT, we cannot fit ten to the twenty-three atoms in a computer.
而且就算我們擁有完美的密度泛函理論,我仍然認為我們需要一個實驗室,因為——就算有完美的DFT,我們也沒法把10的23次方個原子裝進一臺計算機裡。
Ekin Doğuş Çubuk33:42
But ultimately what we want from the lab is a huge quantity of data, high-quality data, diverse data, and those are our goals. And full autonomy is a non-goal. It’s sort of in the service that we use automation in the service of achieving the goals on the data.
但歸根結底,我們想從實驗室獲得的是海量數據、高質量數據、多樣化數據,這才是我們的目標。完全自主運行本身不是目標,我們用自動化是為了服務於這些關於數據的目標。
Liam Fedus51:39
machine learning is really good at what it’s been trained on but scientific discovery is almost by definition what you haven’t been trained on.
機器學習非常擅長處理它被訓練過的東西,但科學發現幾乎從定義上來說,就是你沒有被訓練過的東西。
Ekin Doğuş Çubuk1:00:20
There’s not going to be like. No one’s going to zero shot the room-temperature superconductor.
不會有那種情況——不會有人能零樣本就直接推算出室溫超導體。
Liam Fedus1:00:20
I think they tried 30,000 different things. Thirty of them seemed to host interesting superconductivity, and MgB₂ was one of them.
他們大概嘗試了三萬種不同的材料,其中三十種顯示出有意思的超導性,二硼化鎂(MgB₂)就是其中之一。
Ekin Doğuş Çubuk1:21:59
數字與實體
| 銅酸鹽超導臨界溫度 | 約93開爾文(高於77開爾文) | 14:50 |
| 單個實驗室難以存儲的原子數量級 | 10的23次方個原子 | 33:42 |
| 日本團隊發現MgB₂前嘗試的材料數量 | 約30000種,其中30種顯示超導跡象 | 1:21:59 |
術語
- DFT (Density Functional Theory)密度泛函理論
- 用電荷密度代替波函數計算量子體系基態性質的近似方法
- XRD (X-ray Diffraction)X射線衍射
- 用X射線測量原子間距,得到晶體結構的「指紋」圖譜
- Matter Compiler物質編譯器
- 把目標材料性質編譯成具體合成路徑的系統比喻
- Landauer limit蘭道爾極限
- 刪除一比特信息理論上所需消耗的最小熱力學能量
- Synthesis Superintelligence合成超級智能
- Periodic的使命願景,強調合成能力而非單純理論推演
- Phase transition相變
- 物質結構或狀態在特定條件下發生突變的現象,如冰融化
收聽指南
關注AI for Science、材料發現、自動化實驗室與具身智能方向的工程師和投資人,想了解LLM下一個落地戰場在哪裡。
13:27-16:41 物理理論背景(DFT近似、強關聯電子、Kolmogorov複雜度類比)偏硬核,工程背景讀者可適當跳讀。