世界太吵,來原聲聽播客

Interconnects

開源追平閉源不是靠蒸餾:沒人知道怎麼蒸餾才有用

Nathan Lambert 逐條拆掉「中國開源模型只是蒸餾出來的」這個敘事:RL 階段用 Fable/GPT 5.6 當裁判在成本上根本跑不通,而即便白送最強模型的 reasoning traces,學界至今不知道怎麼把它變成能力提升。

開源模型蒸餾後訓練算力中美博弈網絡安全
這集給出的是判斷依據而不是結論:蒸餾的成本賬、中國實驗室的資本效率差、以及禁開源權重反而削弱美國防守方的具體案例。

核心論點 · 時間戳為按文稿位置估算

7:24

Kimi 當主 agent,GLM 當子 agent

Florian 實際用的分層很具體。Kimi K3 寫的代碼明顯更簡單、可讀性更好,但會漏邊緣情況——他的定位是 GPT 5.4 到 5.5 的水平,做法是先讓 Kimi 寫,再讓 Codex 過一遍撿漏。GLM 5.2 是 Sonnet 級別,勝在快:走內部端點或每秒兩三百 token 的 API,比在 Codex 裡挑模型、挑 reasoning effort、挑 fast 更省事,清理類和體力活直接交給它。合起來就是 Kimi K3 做主 agent、GLM 做子 agent。Kimi 的短板是牆上時間——服務器在中國加 API 擠爆,比 GPT 慢很多,但沒到不可用。

— Florian Brand
10:24

模型變大反而拖慢開源擴散

這裡有明確分歧。Nathan 認為 Kimi K3 這個量級改變了遊戲規則:過去中國模型 RL 跑完到開權重只隔幾小時到一週,生態立刻知道怎麼接;現在光加載權重就要一整個 node 的 B300,基礎設施抬升會額外吃掉一個月,閉源實驗室是在發布前把這些活幹完的,所以時間差被人為操縱了。而且 Kimi API 現在完全被擠爆,模型並沒有在擴散。Florian 不同意:開源生態過去幾個月專業化了很多,首發就帶推理夥伴、vLLM patch 提前幾週就出,day-one 可用性會還行,隨後是各家比拼速度的軍備競賽。

— Nathan Lambert
13:57

資本效率差可能是結構性的

Nathan 承認自己去年的判斷錯了:他原以為訓練的資本密集度會把開源和閉源的差距拉大,結果方向相反。他現在傾向於認為中國實驗室在把資本轉成算力、數據、人才這條鏈上更高效——如果下一代模型 Anthropic 要花 100 億美元而 Kimi 只要 40 億,隨著迭代輪數增加這會是巨大的差異。但成因不清楚:可能是教育體系產出的人才更對口,可能是算力人力成本本身低,可能是補貼。Kimi 工程師 Big Eagle 的回應給了第四種解釋——他們不是在推前沿,只是在追趕,目標範圍本身就便宜。

— Nathan Lambert
30:46

前沿正在裂成兩層

Florian 的基準判斷是能力曲線正在分叉。編碼這類任務上,開源和閉源的當前前沿都已經「夠用」,繼續提升的邊際價值在下降。而真正的前沿——找新的數學證明、找新藥、發明新東西——是另一種生物,會在相當長時間裡被最前沿壟斷。他的推論是這塊會越來越封死:Mythos 在網絡安全和生物方向已經不對所有人開放,如果 Anthropic 真在內部組建藥物研發實驗室,那連外部合作方都拿不到。結果是真前沿對所有人不可及,而近前沿能力持續商品化。

— Florian Brand
32:09

guardrail 把防守方逼去用 GLM

Hugging Face 報告他們被一個 agent 攻擊後想復盤攻擊數據,用 GPT 和 Claude 都被 guardrail 攔下來,最後只能改用 GLM——一個能力更弱但對這類防禦性分析沒有攔阻的模型。Florian 把這稱為一個糟糕的狀態:美國公司因為閉源前沿對自己不可用,反而要依賴更弱的模型。Nathan 接過去把它變成反禁令論證的核心:如果全世界都能用這些開源權重、只有美國公司被禁,那就是在結構上讓防守方停止變強、而攻擊方不受限制——這才是讓 cyber 風險從假變真的路徑。

— Florian Brand
36:41

蒸餾在 RL 階段算不過賬

Ben Thompson 在《Who's afraid of Chinese models》裡主張蒸餾隨著 RL 佔比上升而變得更重要——理由是中國實驗室可能拿 Fable、GPT 5.6 當 RL 裡的打分模型,去評判 rollout 軌跡的每一步。Nathan 的反駁是純算術:一次大規模 RL run 是數百萬到數千萬條 rollout,Thinking Machines 公布的最終 RL run 就有兩千到四千萬條。把這個量級掛到外部 API 上不只是貴到荒謬,慢也會變成時間瓶頸,而且未必比自己訓的定製 grader 效果更好。

— Nathan Lambert
40:48

拿到最強 traces 也不會用

比成本更狠的一層:即便蒸餾數據免費到手,也沒人知道怎麼用。Open Thoughts 3 和 Open Thoughts Agent 這條 scaling reasoning SFT 的主線工作,反覆得到的結論都不是「你領域內最強的模型就是最好的老師」——當下最強的開源 SFT 數據集還建立在 QwQ-32B 這種老 reasoning 模型上。為什麼不能直接用 GLM 5.2 生成 completions 做 SFT 把模型頂上去?不知道。Nathan 的猜測是 mid-training 和 reasoning SFT 糾纏太深,要一起重做。他的原話是:給他一個魔法 API 吐出 Claude/Gemini 的 reasoning traces,他也不確定拿去微調 OLMo 會不會讓 OLMo 更聰明。

— Nathan Lambert
45:38

年底可能首次有美國公司進 top cluster

兩人重做了去年的 tier list。前沿是 Kimi 和 Zhipu,DeepSeek 和 Qwen 算 close competitor。Florian 押 MiniMax 年底會有驚喜——不是 M3 那個尺寸,而是萬億參數以上的大模型;他的 wild card 是 Tencent,換了新領導層,Hunyuan 這次改成 Apache 許可(此前的自定義許可把 EU、英國、韓國全排除在外),250B 左右已經很能打。美國這邊,Nathan 猜到 11 月底大概會有一家(Nvidia、Thinking Machines 或 Reflection)擠進這個大致 top five 的集群,那會是很久以來的第一次。Florian 的理由不同:Nemotron 和 Thinking Machines 的價值在於當可微調的底座,而不是像前沿模型那樣直接用。

— Florian Brand

原話 · 已逐字校驗

the main thing I found with Kimi is its code is a lot simpler uh which makes it way more readable uh but it misses some things that Codex just or like we’re talking 56, 55 and especially 54 would be on those levels. So, I would say that Kimi K3 is like 54-55 level for these kind of tasks.

我在 Kimi 上發現的主要一點是,它的代碼簡單得多,因此可讀性好得多,但它會漏掉一些 Codex 能抓到的東西——大概是 5.6、5.5、尤其 5.4 那個水平。所以我會說,在這類任務上 Kimi K3 相當於 5.4 到 5.5 的水平。

Florian Brand7:24

And if a next generation model costs $10 billion for Anthropic but only $4 billion for Kimi like this this is like could be very huge but it’s not clear why this is the case.

如果下一代模型對 Anthropic 來說要花 100 億美元,而對 Kimi 只要 40 億,這可能是極其巨大的差異——但為什麼會這樣,並不清楚。

Nathan Lambert13:57

So they had to use GLM, a lesser capable model, but it had no guardrails for this kind of defensive action. … which is a horrible state to be in that we have US-based companies now relying on lesser models because the closed frontier is inaccessible to them.

所以他們只能用 GLM——一個能力更弱的模型,但它對這類防禦性操作沒有設護欄。……這是一個糟糕的處境:美國公司現在因為閉源前沿對自己不可用,只能依賴更弱的模型。

Florian Brand32:09

The problem is that big RL runs are millions and millions of rollouts. I think Thinking Machines blog post had like 20 to 40 million or something for their final RL run. So to do this on an API like Fable or GPT 5.6 would be insanely expensive

問題在於大規模 RL run 是數百萬上千萬條 rollout。我記得 Thinking Machines 那篇博文裡,最終 RL run 大概是兩千萬到四千萬條。所以要在 Fable 或 GPT 5.6 這種 API 上做這件事,成本會貴到荒謬。

Nathan Lambert36:41

if I had a magical API that gave me reasoning traces from Claude/Gemini. I actually don’t know if me like fine-tuning an OLMo model on that would make OLMo smarter. It’s one of the most wild unanswered research questions.

假如我有一個魔法 API,能吐出 Claude 或 Gemini 的 reasoning traces——我其實不知道拿它去微調一個 OLMo 模型會不會讓 OLMo 更聰明。這是最離譜的未解研究問題之一。

Nathan Lambert41:59

數字與實體

下一代模型訓練成本對比Anthropic 約 100 億美元 vs Kimi 約 40 億美元13:57
Kimi K3 加載權重的硬件門檻一個 node 的 B3004:03
Kimi K3 最高檔訂閱($200 計劃)上下文100 萬 token4:38
Thinking Machines Inkling 參數量1 萬億(總參數)25:12
中國實驗室研究團隊規模200-300 人,多為 25 歲上下15:21

術語

distillation蒸餾
用更強模型的輸出(尤其推理軌跡)當訓練數據,餵給自己的模型。
rollout軌跡採樣
RL 訓練中模型完整跑一遍任務產生的一條行為軌跡。
grading model / judge打分模型
RL 中負責評判 rollout 各步是否達成獎勵的模型。
mid-training中期訓練
預訓練與 SFT 之間的階段,Nathan 認為它與 reasoning SFT 難以分割。
shadow ban影子禁令
不明確立法,用法律行動或懲罰的威脅事實上禁止使用。
fine-tunability可微調性
模型作為領域微調底座的易用程度,與榜單分數不同。

收聽指南

誰該聽

在做 agentic coding 工具選型、評估開源權重模型能否替換 Claude/Codex,或需要判斷中美開源格局的創業者與後訓練工程師。

可跳過

19:47-24:08 中國廠商逐個點評,信息密度偏低。