中美AI差距只有六到八個月:全面封殺蒸餾也拖不了太多
Epoch AI研究員JS Denain認為中美頂尖模型差距只有六到八個月,即便徹底禁掉蒸餾,六個月後差距也只會從六個月擴大到八九個月。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
RSI 的公開證據其實很單薄
OpenAI和Anthropic都發博客講AI加速AI研究,但JS Denain認為這些證據並不足以支持「即將出現自我持續加速的AI能力」或「AI研究員崗位被完全自動化」。最惹眼的信號是研究員用Codex的開支月增2倍,但這更像是模型可用性提升帶來的採用,而非軟件層面智能爆炸即將發生的證明。他強調,這類指標本身模糊——可能只是把之前分散在ChatGPT上的用量重新歸入Codex統計而已。
— JS DenainAI 還不會替你決定研究方向
OpenAI自己的加速度博客顯示,研究員在工程類、排障類任務上使用Codex的比例明顯上升,但無論是訪談還是會話記錄,都沒看到高層次戰略決策——比如算力分配、研究方向選擇——因AI獲得明顯提升。Nathan Lambert用類比講清楚這層區別:博士生個人產出可能真的快十倍,但導師的整個研究議程未必因此加速十倍,公司層面的瓶頸會吃掉個體效率提升。
— Nathan Lambert機器人工業爆炸:被低估的供給彈性
Nathan Lambert認為機器人產業的路徑會更像自動駕駛而非LLM——建廠難、可靠性長尾問題多,兩到五年內看不到規模化的機器人工業爆炸。JS Denain反駁:如果機器人真能替代藍領工人,潛在市場極其龐大,參考美國數據中心的建設速度,財務激勵足以撬動供給,美國某些領域缺乏大規模建設更多是需求問題而非能力瓶頸,但他也承認自己對機器人具體能力進展瞭解有限。
— JS Denain中美差距六到八個月,蒸餾也撬不動太多
綜合多種測算方法,JS Denain把中美頂尖公開模型的差距定在六到八個月(發布日期對發布日期)。即便設想「完全禁止蒸餾」這種極端情形,他估計六個月後差距也只會從六個月左右擴大到八九個月,而不是被認為的十二個月。他強調算力差距是數量級的,但差距體現在能力上卻小得多,這本身就需要解釋——蒸餾只是候選解釋之一,而不是唯一原因。
— JS Denain他為什麼改口相信蒸餾管用
JS Denain承認自己此前低估了蒸餾的作用,促成轉變的證據包括Stolen Thoughts論文——證明通過越獄API拿到模型推理軌跡相對容易,以及Claude路由器帶來的真實提示詞分布數據,這比單純用基準測試題目生成相似樣本更有價值。他也提到另一檔節目裡有人說「中訓練已經能帶來八成效果」,這類說法讓他重新評估SFT在語言軌跡上訓練的重要性,而不只是RL探索本身。
— JS Denain證明一件事可行,就是最大的助攻
除了蒸餾,Nathan Lambert提出另一種解釋中美差距縮小的機制:「四分鐘一英里效應」——只要OpenAI、Anthropic證明某條技術路線走得通,中國實驗室就不用把資源浪費在探索一堆死路上,直接抄近道復現。JS Denain認可這個思路,但也指出像推理模型(DeepSeek Math早於o1)這樣的反例不完全符合這個模式,雙方都承認這更像是組織和研發時間尺度上的差異。
— JS Denain模型護欄擋不住,連OpenAI都被黑
就在錄製前24小時,有人用公開的Claude模型攻破了OpenAI並拿到內部訪問權限。JS Denain說這類事件很難判斷該更新到「模型護欄不夠好」還是「公司安全水平不夠好」,但他承認現實是:開源模型護欄更弱但能力也更弱,閉源模型護欄稍強但更強大,兩者對誤用風險的淨影響並不明朗。Stolen Thoughts論文和這次OpenAI事件都說明,即便公司有強烈動機去防止,護欄依然會被繞過。
— JS Denain後訓練流程是行業最大的黑箱
JS Denain試著複述自己對頭部實驗室後訓練流程的心智模型:一個大的後訓練團隊下面分很多領域小組(數學、生物、金融),各自負責數據、RL環境和超參數調優,最後把各自成果打包競標進入一次大的RL訓練。Nathan Lambert認同組織結構上的分工描述,但指出真正的複雜度差異在於——是「多專家蒸餾合併」還是「順序式大RL」,這個選擇本身可能是限制進展速度的瓶頸,可惜外界幾乎拿不到任何真實流程圖。
— JS Denain原話 · 已逐字校驗
that plot, for example, just shows a 2X a month increase in Codex spending by researchers, and that does seem to me to be some evidence of they’re getting a lot of value out of this probably. I don’t think this is strong evidence that in six months we have a software intelligence explosion.
那張圖表明,研究員使用Codex的開支大約每月增長兩倍,這確實說明他們從中獲得了不少價值。但我不認為這是「六個月內出現軟件層面智能爆炸」的強證據。
JS Denain0:00
I think an analogy I have is, I think that junior PhD students will be 10X as productive, but from the advisor’s perspective, their research agenda will not proceed 10X as fast.
我的類比是:初級博士生的產出可能真的會快十倍,但從導師的角度看,整個研究議程未必會因此快十倍。
Nathan Lambert9:38
if you look at data centers in the US, there has been extremely fast build-out. If you had robots that were just literally able to substitute for blue-collar human workers, I feel like the financial incentives would be huge.
看看美國數據中心的建設速度就知道擴張有多快。如果機器人真的能直接替代藍領工人,我覺得財務上的激勵會大到足以推動建設。
JS Denain20:35
so currently if I’m saying six months gap, then in six months, it’s probably not literally 12 months, right? So, my guess is, yeah, you are at like eight or nine, something like that. You go from like six to nine maybe.
如果現在說差距是六個月,那六個月之後應該不會變成整整十二個月。我的猜測是大概會到八九個月左右,從六個月變成九個月左右。
JS Denain27:39
I think the Claude routers just give you a bunch of useful data to train on, and that will generally improve capabilities. I think that’s one explanation.
Claude的路由器能給你一大批有用的訓練數據,這本身就會普遍提升能力,我認為這是一種解釋。
JS Denain29:50
four-minute mile style effects of like, you show that something is possible at all and then people have the conviction to go down that route, don’t waste a ton of resources exploring a bunch of other things, is the thing you’re pointing at here.
這是一種「四分鐘一英里」式的效應:你先證明一件事完全可行,別人就有信心走這條路,不必再把大量資源浪費在探索其他方向上。
JS Denain38:27
there’s definitely clearly examples like this one, or really the Stolen Thoughts paper or something. It just seems like the safeguards weren’t good enough to prevent that from happening, even though there’s strong incentives for the companies to prevent it.
確實有像這次事件、或者Stolen Thoughts論文這樣明確的例子。看起來護欄並不足以阻止這些事發生,儘管公司有很強的動機去防止。
JS Denain48:46
數字與實體
| Codex 支出增長速度 | 研究員使用量約每月2倍增長 | 0:00 |
| Evan Hubinger 估計的存在風險概率 | 至少10% | 4:09 |
| 中美頂尖公開模型能力差距 | 6-8個月(發布日期對發布日期) | 24:47 |
| 禁止蒸餾情境下六個月後的差距預測 | 從約6個月擴大到8-9個月 | 27:39 |
術語
- RSI遞歸自我改進
- AI系統反過來加速AI研究本身的自我強化循環
- ECIEpoch能力指數
- Epoch AI用來衡量和比較模型能力水平的綜合指標
- distillation蒸餾
- 用強模型的輸出數據訓練弱模型,從而快速獲得部分能力
- four-minute mile effect四分鐘一英里效應
- 一旦有人證明某事可行,後來者不必再摸索就能跟進復現
- jaggedness參差前沿
- AI能力在不同任務上進步極不均勻,強弱交錯的狀態
- Goodharted古德哈特化
- 一旦指標被當作優化目標,它就不再能反映真實情況
收聽指南
關注中美AI差距和RSI風險的創業者、投資人,尤其是想要具體機制而非籠統結論的人。
41:22-47:35的招聘數據研究方法論細節,可跳過。