世界太吵,來原聲聽播客

Interconnects

開源落後閉源只剩 3-5 個月,這層時間差就是全部安全邊際

Kimi K3 把開源落後閉源的差距從爭論中的 6-9 個月壓到 3-5 個月,而這層時間差正是唯一的風險緩衝——重手監管開源只會推遲不可避免的事,同時把緩衝本身作廢掉。

開源模型中美競爭資本效率MoE 架構AI 政策

原視頻在 YouTube 上放不出來,用音頻聽:

這是把 K3 當生態拐點來讀的判斷文:開源的減速主義經濟學、中國實驗室的資本效率來源、政策不對稱三條論證,都能直接用於判斷,不是模型評測。

核心論點 · 時間戳為按文稿位置估算

0:00

差距被壓到 3-5 個月

K3 是 2.8T 參數的 MoE,7 月 16 日發布、承諾 7 月 27 日放出權重。作者把整篇文章的關鍵結論定死在一個數字上:開源對閉源、或美國對中國的模型性能差距,已經從此前爭論中的 6-9 個月縮短到 3-5 個月。他給了一個穩健性說明——即使 Moonshot 最終沒兌現開源,只要中國存在同等強度的閉源模型,多數推論也只會落到中間地帶,方向不變。榜單證據是:Vals AI 綜合第二,Artificial Analysis 智能指數第三(只輸給 Claude Fable 和 GPT-5.6 Sol Max,且更便宜),Frontend Code Arena 第一。這是自 DeepSeek R1 以來開源模型離前沿最近的一次。

— Nathan Lambert
0:00

蒸餾敘事在這一集被判死

作者直接給結論:如果對抗性蒸餾對 K3 有貢獻,也只是很小的程度。理由是 R1 和 K3 性質不同——R1 是中國實驗室極快轉向推理模型的搶跑,K3 則是在數據、算法、架構、工具、環境這些已知方向上做規模化,也就是 OpenAI 和 Anthropic 的人正在解的同一批問題。另一層證據來自他的中國行:Kimi 團隊的文化是他走訪過的公司裡少數一眼就能感受到的,在 GPU 受限的環境裡仍有很強的個人執行力和表達自由;見過之後,這個結果對他反而不意外。他預判蒸餾爭論和相關壓力還會繼續,但把中國模型歸因於 IP 盜竊的觀察者會被現實打臉。

— Nathan Lambert
0:00

WAIC 講話是風險容忍度表態

此前中國幾乎沒有關於開源 AI 的國家級政策表述,作者說據他所知沒有高層公開評論過。這週變了:習近平在世界人工智能大會(WAIC)主旨演講中,非常直接地把中國 AI 生態的未來押在開源和全球擴散上。作者的解讀是,這個承諾與史上最強開源權重模型出現在同一周,等於中國對開源權重的風險容忍度做了隱含表態。最簡單的解釋是:中國政府在密切跟蹤模型風險,技術顆粒度可能比美國的「氛圍式監管」更細,若測到風險會動手——而它目前判斷前沿模型沒有實質風險。同時經濟決策者認為先把 AI 用起來是好事,做大分發之後再變現,路徑與汽車、光伏、先進製造一致。

— Nathan Lambert
0:00

開源是前沿實驗室的經濟軟肋

Dean Ball(個人支持開源,但現在在 OpenAI)說開源權重模型本質上是減速主義,作者說他是對的。傳導鏈條很具體:強開源模型大幅壓低閉源實驗室的毛利空間,一是實驗室能再投入下一代模型的利潤變少,二是市場下調這些公司的終值,從而打折未來的融資輪次。兩者合起來會推遲最具變革性模型的到來。但作者不認為這足以讓 OpenAI 和 Anthropic 掉出全球最高估值公司之列,而且他認為這對社會是淨好事:開源在擴散端是加速主義,把某一性能檔位的智能入場價壓低並鼓勵定製化,只是這條曲線起步慢得多——他的說法是起步更慢、但可能更大的指數。風險在於閉源能力跑得太遠,定製化就失去意義。

— Nathan Lambert
9:23

2.5× 效率來自哪三處改動

Kimi 的發布博客給了可核對的技術抓手:K3 基於 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)兩項架構更新,分別改善信息沿序列長度和沿模型深度的流動;同時把 MoE 稀疏度拉高到 896 個專家中實際激活 16 個,配合 Stable LatentMoE 框架。加上訓練與數據配方的精修,相對 K2 帶來約 2.5 倍的整體 scaling 效率提升。作者順手追了這條創新的擴散路徑:KDA 出自 Kimi Linear 論文,與他在 Ai2 做 Olmo Hybrid 時用的 Gated DeltaNet 同源;Gated Delta Networks 2024 年底才提出、建立在 Mamba 的想法上,到 2026 年中已經進入前沿模型,Qwen 最新模型也換到了相關架構。

— Nathan Lambert
9:23

資本效率:追趕比發明便宜

作者判斷中國實驗室明顯更資本高效,而在智能正比於有效資本(買算力、數據、人才)的世界裡,這可能是一個 AI 產業能擁有的最大優勢。他列了幾條聽說但無法證實的因素:中國研究員薪酬更低卻更擅長解 LLM 研究謎題、正在形成的數據產業(預算仍遠低於 Anthropic 的十億美元級)、通過繞過出口管制拿到有意義的訓練算力,以及推理需求小得多所以更多算力能投到訓練——不過 Moonshot 已因 K3 暫停新訂閱,API 仍在跑。他給出的機制性解釋是:美國實驗室把大量精力花在戲劇性的大跨步推進前沿,中國實驗室更聚焦追趕,而追趕本身更便宜,就像蒸餾中學生模型可以超過老師。

— Nathan Lambert
9:23

開源生態不是維持,是加碼

K3 發布後的那個週末,阿里宣布 2.4 萬億參數的 Qwen 3.8 即將以開源權重發布。作者強調這個信號的分量:歷史上阿里把最大的模型留作雲業務的 API 獨佔,這次轉向說明中國公司不只是維持開源現狀,而是在往裡加碼——即使 Qwen 3.8 在跑分上落後 K3,方向意義仍然成立。他給了一個可驗證的推論:如果 Qwen 3.8 趕在下一代 Gemini 之前發布,會把 Google 擠到最聰明模型實驗室榜單的第八位。另外 DeepSeek V4 預計會從 preview 版轉正。在他給出的各家峰值模型排序裡,DeepMind 只掛著 Gemini Flash 3.5,他形容看到 DeepMind 和幾家美國巨頭排這麼靠後令人震驚,並認為 X AI 團隊應該拿到更多認可。

— Nathan Lambert
19:54

禁開源會造出防守不對稱

作者的立場是:如果今天把 Claude Mythos 開源,負面後果相對輕微,風險被過度炒作了;但這不會永遠成立,所以最強模型比同水平開源模型早幾個月以受控閉源方式提供,是一個非常安全的均衡。危險在於監管走偏。他引 Axios 的報道:商務部去年考慮把多家中國 AI 實驗室列入實體清單;NSA 與白宮國家網絡總監辦公室考慮發布針對中國實驗室的威脅通告;白宮考慮發行政令,要求美國公司只有能保證安全並承擔洩露責任才能託管中國模型;商務部還借供應鏈安全權限草擬過針對中國開源模型的規則。結果會是高度不對稱的狀態:美國最好的模型在網絡安全任務上帶著護欄,而全球行為者拿著優秀的中國開源模型來探測美國的防線。

— Nathan Lambert

原話 · 已逐字校驗

The key fact is that either the open-to-closed or American-to-Chinese model performance gap has been reduced from the debated 6-9 months to something shorter, say 3-5 months.

關鍵事實是:無論是開源對閉源,還是美國對中國的模型性能差距,都已經從人們爭論的 6-9 個月縮短到了更短的區間,比如 3-5 個月。

Nathan Lambert0:00

Open-weight models are inherently decelerationist, and I’m continually surprised to see the so-called “accelerationists” so excited about open-weight models.

開源權重模型本質上是減速主義的,而我一直很驚訝那些所謂的「加速主義者」竟然對開源權重模型如此興奮。

Dean Ball0:00

It is becoming clear that the Chinese labs are far more capital efficient. In a world where scaling laws dictate that intelligence is proportional to effective capital – which buys compute, data, & talent – that may be the greatest strength your AI industry could ever have.

越來越清楚的是,中國實驗室的資本效率高得多。在一個由 scaling laws 決定「智能正比於有效資本」(資本用來買算力、數據和人才)的世界裡,這可能是一個 AI 產業所能擁有的最大優勢。

Nathan Lambert9:23

Just as the student model can outperform the teacher in distillation generally (not limited to the adversarial distillation of the Chinese labs), an approach of “trying to catch up” rather than “invent the next paradigm” could lead to stronger models.

正如蒸餾中學生模型普遍可以超過老師(不限於中國實驗室的對抗性蒸餾),選擇「努力追趕」而不是「發明下一個範式」這條路線,反而可能做出更強的模型。

Nathan Lambert9:23

If we regulate open-weight models heavy-handedly, I suspect much of the world will be lulled into thinking we no longer need to act. All we would’ve done is slightly delayed the inevitable — open models will continue to cross all the key capability thresholds eventually and regardless of legality.

如果我們對開源權重模型施以重手監管,我懷疑世界上很大一部分人會被哄騙成「我們不再需要行動」。而我們做到的只是把不可避免的事略微推遲——開源模型終究會跨過所有關鍵能力閾值,無論它是否合法。

Nathan Lambert19:54

數字與實體

K3 發布日 / 權重發布日7 月 16 日發布,承諾 7 月 27 日放權重0:00
開源落後閉源的時間差從爭論中的 6-9 個月縮至 3-5 個月0:00
K3 榜單位置Vals AI 第 2、Artificial Analysis 第 3、Frontend Code Arena 第 10:00
OpenAI 單個研究員可用算力(作者玩笑估計)數千臺 H100 等效機器0:00
K3 的 MoE 激活比例896 個專家中激活 16 個9:23
K3 相對 K2 的 scaling 效率提升約 2.5 倍9:23
Qwen 3.8 參數量2.4 萬億參數,將開源權重9:23

術語

Kimi Delta Attention (KDA)Kimi 德爾塔注意力
出自 Kimi Linear 論文的注意力變體,改善信息沿序列長度的流動。
Attention Residuals (AttnRes)注意力殘差
改善信息在模型深度方向流動的架構改動。
Stable LatentMoE穩定隱空間 MoE
配合極高稀疏度(896 選 16)使用的專家混合框架。
adversarial distillation對抗性蒸餾
從閉源前沿模型的輸出中反向提取能力,用於訓練自家模型。
decelerationist減速主義
指壓低前沿實驗室利潤與融資、從而拖慢 AI 投入節奏的力量。
Entity List實體清單
美國商務部管制名單,上榜方須獲許可才能獲得美方技術與服務。

收聽指南

誰該聽

關注中美模型格局的投資人、要在開源權重與閉源 API 之間做技術選型的工程負責人、以及做 AI 出口管制與開源政策研判的人。

可跳過

第 5 節美國監管動向,不關心政策可跳過。