世界太吵,來原聲聽播客

晚點聊

蒸餾是灰色地帶,但張一鳴說它只能逼近不能超越

蒸餾違反用戶協議卻未必構成侵權,是無人公開談論的灰色地帶。張一鳴拒絕字節蒸餾,理由是它只能逼近對手、無法超越,而代價是組織里走不確定路線的人得不到資源和認可。

蒸餾大模型字節跳動Anthropic後訓練

原視頻在 YouTube 上放不出來,用音頻聽:

兩位記者把無人願意公開談的蒸餾講透了:技術機制、know-how、紅線爭議,以及它如何衝擊前沿模型的商業邏輯。

核心論點 · 點時間戳可跳到原聲

2:04

蒸餾不是抄作業,是有門檻的抄作業

典型蒸餾的流程是:先有一堆問題,去問一個很強的模型(比如 Fable),得到很多回答,提問和回答構成數據對,再用這些數據訓練自己的學生模型,讓它的輸出行為逼近教師模型。但這不是「人家寫 A 你就寫 A」——它用在後訓練和中訓練,要算力、要數據、要放進模型裡訓練,中間有方法和技巧。有了推理模型之後,教師模型給出的不再只是題目和答案,還有推理過程;Agent 發達之後,還能擴展到一整個智能體在環境裡完成任務的完整軌跡。

— 曼棋
8:05

兩個節點把蒸餾從壓縮變成變強

第一個節點是 2024 年 9 月 OpenAI 發布 O1。它帶來兩個變化:一是揭示了在後訓練中做大規模強化學習可以讓模型學到推理策略,而蒸餾本來主要就用在後訓練,所以投入回報比上升;二是測試時給更多算力、讓模型生成更長的思維鏈也能持續提升性能,而思維鏈這部分是模型使用階段的產出,理論上用戶能看見,也就成了更好的蒸餾原料。第二個節點是 2025 年 1 月 DeepSeek R1 發布,同時放出六個小蒸餾模型,四個基於 Qwen 2.5、兩個基於 Meta Llama 3,都把 R1 當教師——這才是蒸餾最開始的主流目的:壓縮。

— 曼棋
13:51

張一鳴的反對理由,一半是技術一半是人性

張一鳴在 Seed 內部會議上說不允許字節做蒸餾,理由有三:蒸餾短期能改善表現,但本質是複製 Claude 已有的能力,最多只能逼近、不能超越;他希望 Seed 從更底層構建 AGI 壁壘,認為蒸餾不是長期壁壘;即使不蒸餾意味著技術上短暫落後國內競爭對手,也不走捷徑。從業者普遍認為學生模型超越教師模型在技術上並非絕無可能,比如多教師蒸餾、在特定任務上超越,但蒸餾有組織和激勵上的代價:它成本低、確定性高,重心放上去,組織里做長期探索、走不確定路線的人就得不到足夠資源和認可。

— 曼棋
28:52

蒸餾的 know-how 在賬號運營和數據管線

真正難的不是拿到幾百萬條回答,而是一整套系統工程。第一是穩定高頻訪問領先模型的賬號,以及配套的用戶運營:建很多中轉站,讓高校理工科學生、研究者、高級程序員這類真能提出高質量問題、又有真實需求的用戶去用。這裡要防被坑——有某一家模型用中轉站,結果發現自己蒸出來的是自己的。第二是數據管線:從真實提問裡篩選過濾,用模型擴增改寫,中間還要糾錯,以及決定數據的形式和配比。整套系統是否成本低、是否穩定,直接影響大規模操作的效果和效率。

— 曼棋
32:08

蒸餾藏不住,因為查的是過程不是結果

想對 Anthropic 和 OpenAI 隱藏蒸餾行為,靠不用 API、直接下載開源權重在自己機房生成數據,其實很難:部署 K3 這種接近 3T 的模型本身要很多算力,持續跑數據的電費也高,容易被監測到。更關鍵的是,對方不是從結果發現,而是從過程發現——只要你有一次大規模高頻使用它的 API,異常行為就可能被看見。Anthropic 說已建立識別蒸餾流量的分類器和行為指紋系統,能發現跨賬號協同、重複提問和套取思維鏈,還加強了對教育、研究、創業公司賬號的身份認證,這正好和「找高校學生來用」的運營方式相呼應。

— 曼棋
38:35

蒸餾是灰色地帶,但雙標爭議是真的

原罪這個詞有點嚴重,蒸餾確實違反了 Anthropic、OpenAI 的用戶協議,但違反用戶協議不一定構成法律侵權。紅線比較清楚的是黑客手段:侵入其他公司系統、破解思維鏈,這類明顯違反通行法律的做法不能被接受。至於雙標爭議,Anthropic 最近有一個 15 億美元的集體訴訟和解,案情是當年從盜版圖書網站下載了很多書、沒給這些書付費,被美國作家集體訴訟。這兩種行為不完全一樣:直接搞到書肯定是侵權,但買了書之後用來訓練模型是否侵權,加州法院有一個判例認為只要付了錢就不侵權——這留下一個有意思的迴旋鏢:如果這樣不構成侵權,其他公司用 Anthropic 的產出提升自己的模型,是否構成侵權。

— 曼棋
44:05

更便宜的智能,衝擊的是商業邏輯

蒸餾會不會衝擊投入幾百億美元訓練前沿模型的商業模式?短期市場預期是 Anthropic 和 OpenAI 的估值會受影響,甚至有人認為會衝擊 IPO 競爭,但前提是只看到此時此刻——如果 Anthropic 下一個模型又很強,預期又會改變,閉源公司可能有後手沒展示。比較明確的是它衝擊了商業邏輯:V4 和 Grok 都是性價比很高的模型,那張著名的斬殺線圖裡,V4 和 Grok 4.6 下方和右邊區域裡的模型都被斬殺。有應用公司創始人說,用戶十個任務裡八個都能被 DeepSeek V4 Flash 解決,而且 Flash 非常便宜、速度也快。這背後是更大的問題:智能的供給和需求在規模和節奏上如何匹配,對很多白領工作來說現在的模型已經夠用。

— 曼棋

原話 · 已逐字校驗

它肯定不是我們 對我們是非常 原初意義理解的那種超答案 就是你能直接有個答案就超過來 因為它還是一個訓練的過程

它肯定不是我們原初意義理解的那種抄答案,就是你能直接有個答案就抄過來,因為它還是一個訓練的過程。

曼棋3:00

他覺得蒸餾是短期內可以改善模型表現 但本質上是在複製Cloud的以後的能力 所以你這麼繼續幹下去的話 你最多只能逼近對方 你是不能實現超越的

他覺得蒸餾短期內可以改善模型表現,但本質上是在複製 Claude 已有的能力,所以這麼繼續幹下去,你最多只能逼近對方,不能實現超越。

曼棋13:51

張一鳴可能不是最懂技術的 但他大概率是最懂人性的

張一鳴可能不是最懂技術的,但他大概率是最懂人性的。

洪浩19:14

一個運動員理論上是可以既克興奮劑 又勤家訓練的 也許真的就有人是這麼幹的對吧 只是說一般而言 你如果克了興奮劑之後 你肯定是會有一些僥倖和惰性的

一個運動員理論上可以既嗑興奮劑,又勤加訓練,也許真的有人這麼幹。只是一般而言,你嗑了興奮劑之後,肯定會有一些僥倖和惰性。

曼棋20:16

他肯定是違反了 那些B原模型公司 OpenISRPG的用戶協議的 但是違反用戶協議 不一定構成法律上的侵權

它肯定違反了那些閉源模型公司 OpenAI 等的用戶協議,但違反用戶協議不一定構成法律上的侵權。

曼棋39:27

我們之前都說 coding比視頻生成大 萬一錯了了 那這個錯了的可能性 也是在於說 可能對很多白領的工作來說 就現在這模型真的已經夠用了

我們之前都說 coding 比視頻生成大,萬一錯了呢?這個錯了的可能性在於,可能對很多白領的工作來說,現在的模型真的已經夠用了。

曼棋46:31

數字與實體

Anthropic 集體訴訟和解金額15 億美元41:27
K3 模型參數量接近 3T(約 2.8T)32:26
V4 模型參數量1.6T32:26
DeepSeek R1 發布的小蒸餾模型數6 個(4 個 Qwen 2.5 底座、2 個 Meta Llama 3 底座)10:10
身份混淆研究測試的模型數27 個模型、77 個問題27:22
用戶任務被 DeepSeek V4 Flash 解決的比例十個任務裡八個45:30

術語

distillation蒸餾
用強模型的輸出或軌跡訓練自己的模型,讓兩者行為越來越接近。
reasoning model推理模型
會先生成長思維鏈再作答的模型,O1 是開啟這一範式的模型。
agent trajectory智能體軌跡
智能體在環境中完整做完一個任務的全過程數據。
multi-teacher distillation多教師蒸餾
同時向多個教師模型學習,博採眾長,也可能訓不好。
behavior fingerprint行為指紋
通過跨賬號協同、重複提問等行為模式識別蒸餾流量的手段。

收聽指南

誰該聽

關注大模型競爭格局的創業者、投資人和工程師,尤其是想判斷蒸餾能否成為長期壁壘、以及前沿模型商業邏輯會怎麼變的人。

可跳過

最後兩分鐘的主播收尾與互動引導可以跳過。