蒸餾是灰色地帶,但張一鳴說它只能逼近不能超越
蒸餾違反用戶協議卻未必構成侵權,是無人公開談論的灰色地帶。張一鳴拒絕字節蒸餾,理由是它只能逼近對手、無法超越,而代價是組織里走不確定路線的人得不到資源和認可。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
蒸餾不是抄作業,是有門檻的抄作業
典型蒸餾的流程是:先有一堆問題,去問一個很強的模型(比如 Fable),得到很多回答,提問和回答構成數據對,再用這些數據訓練自己的學生模型,讓它的輸出行為逼近教師模型。但這不是「人家寫 A 你就寫 A」——它用在後訓練和中訓練,要算力、要數據、要放進模型裡訓練,中間有方法和技巧。有了推理模型之後,教師模型給出的不再只是題目和答案,還有推理過程;Agent 發達之後,還能擴展到一整個智能體在環境裡完成任務的完整軌跡。
— 曼棋兩個節點把蒸餾從壓縮變成變強
第一個節點是 2024 年 9 月 OpenAI 發布 O1。它帶來兩個變化:一是揭示了在後訓練中做大規模強化學習可以讓模型學到推理策略,而蒸餾本來主要就用在後訓練,所以投入回報比上升;二是測試時給更多算力、讓模型生成更長的思維鏈也能持續提升性能,而思維鏈這部分是模型使用階段的產出,理論上用戶能看見,也就成了更好的蒸餾原料。第二個節點是 2025 年 1 月 DeepSeek R1 發布,同時放出六個小蒸餾模型,四個基於 Qwen 2.5、兩個基於 Meta Llama 3,都把 R1 當教師——這才是蒸餾最開始的主流目的:壓縮。
— 曼棋張一鳴的反對理由,一半是技術一半是人性
張一鳴在 Seed 內部會議上說不允許字節做蒸餾,理由有三:蒸餾短期能改善表現,但本質是複製 Claude 已有的能力,最多只能逼近、不能超越;他希望 Seed 從更底層構建 AGI 壁壘,認為蒸餾不是長期壁壘;即使不蒸餾意味著技術上短暫落後國內競爭對手,也不走捷徑。從業者普遍認為學生模型超越教師模型在技術上並非絕無可能,比如多教師蒸餾、在特定任務上超越,但蒸餾有組織和激勵上的代價:它成本低、確定性高,重心放上去,組織里做長期探索、走不確定路線的人就得不到足夠資源和認可。
— 曼棋蒸餾的 know-how 在賬號運營和數據管線
真正難的不是拿到幾百萬條回答,而是一整套系統工程。第一是穩定高頻訪問領先模型的賬號,以及配套的用戶運營:建很多中轉站,讓高校理工科學生、研究者、高級程序員這類真能提出高質量問題、又有真實需求的用戶去用。這裡要防被坑——有某一家模型用中轉站,結果發現自己蒸出來的是自己的。第二是數據管線:從真實提問裡篩選過濾,用模型擴增改寫,中間還要糾錯,以及決定數據的形式和配比。整套系統是否成本低、是否穩定,直接影響大規模操作的效果和效率。
— 曼棋蒸餾藏不住,因為查的是過程不是結果
想對 Anthropic 和 OpenAI 隱藏蒸餾行為,靠不用 API、直接下載開源權重在自己機房生成數據,其實很難:部署 K3 這種接近 3T 的模型本身要很多算力,持續跑數據的電費也高,容易被監測到。更關鍵的是,對方不是從結果發現,而是從過程發現——只要你有一次大規模高頻使用它的 API,異常行為就可能被看見。Anthropic 說已建立識別蒸餾流量的分類器和行為指紋系統,能發現跨賬號協同、重複提問和套取思維鏈,還加強了對教育、研究、創業公司賬號的身份認證,這正好和「找高校學生來用」的運營方式相呼應。
— 曼棋蒸餾是灰色地帶,但雙標爭議是真的
原罪這個詞有點嚴重,蒸餾確實違反了 Anthropic、OpenAI 的用戶協議,但違反用戶協議不一定構成法律侵權。紅線比較清楚的是黑客手段:侵入其他公司系統、破解思維鏈,這類明顯違反通行法律的做法不能被接受。至於雙標爭議,Anthropic 最近有一個 15 億美元的集體訴訟和解,案情是當年從盜版圖書網站下載了很多書、沒給這些書付費,被美國作家集體訴訟。這兩種行為不完全一樣:直接搞到書肯定是侵權,但買了書之後用來訓練模型是否侵權,加州法院有一個判例認為只要付了錢就不侵權——這留下一個有意思的迴旋鏢:如果這樣不構成侵權,其他公司用 Anthropic 的產出提升自己的模型,是否構成侵權。
— 曼棋更便宜的智能,衝擊的是商業邏輯
蒸餾會不會衝擊投入幾百億美元訓練前沿模型的商業模式?短期市場預期是 Anthropic 和 OpenAI 的估值會受影響,甚至有人認為會衝擊 IPO 競爭,但前提是只看到此時此刻——如果 Anthropic 下一個模型又很強,預期又會改變,閉源公司可能有後手沒展示。比較明確的是它衝擊了商業邏輯:V4 和 Grok 都是性價比很高的模型,那張著名的斬殺線圖裡,V4 和 Grok 4.6 下方和右邊區域裡的模型都被斬殺。有應用公司創始人說,用戶十個任務裡八個都能被 DeepSeek V4 Flash 解決,而且 Flash 非常便宜、速度也快。這背後是更大的問題:智能的供給和需求在規模和節奏上如何匹配,對很多白領工作來說現在的模型已經夠用。
— 曼棋原話 · 已逐字校驗
它肯定不是我們 對我們是非常 原初意義理解的那種超答案 就是你能直接有個答案就超過來 因為它還是一個訓練的過程
它肯定不是我們原初意義理解的那種抄答案,就是你能直接有個答案就抄過來,因為它還是一個訓練的過程。
曼棋3:00
他覺得蒸餾是短期內可以改善模型表現 但本質上是在複製Cloud的以後的能力 所以你這麼繼續幹下去的話 你最多只能逼近對方 你是不能實現超越的
他覺得蒸餾短期內可以改善模型表現,但本質上是在複製 Claude 已有的能力,所以這麼繼續幹下去,你最多只能逼近對方,不能實現超越。
曼棋13:51
張一鳴可能不是最懂技術的 但他大概率是最懂人性的
張一鳴可能不是最懂技術的,但他大概率是最懂人性的。
洪浩19:14
一個運動員理論上是可以既克興奮劑 又勤家訓練的 也許真的就有人是這麼幹的對吧 只是說一般而言 你如果克了興奮劑之後 你肯定是會有一些僥倖和惰性的
一個運動員理論上可以既嗑興奮劑,又勤加訓練,也許真的有人這麼幹。只是一般而言,你嗑了興奮劑之後,肯定會有一些僥倖和惰性。
曼棋20:16
他肯定是違反了 那些B原模型公司 OpenISRPG的用戶協議的 但是違反用戶協議 不一定構成法律上的侵權
它肯定違反了那些閉源模型公司 OpenAI 等的用戶協議,但違反用戶協議不一定構成法律上的侵權。
曼棋39:27
我們之前都說 coding比視頻生成大 萬一錯了了 那這個錯了的可能性 也是在於說 可能對很多白領的工作來說 就現在這模型真的已經夠用了
我們之前都說 coding 比視頻生成大,萬一錯了呢?這個錯了的可能性在於,可能對很多白領的工作來說,現在的模型真的已經夠用了。
曼棋46:31
數字與實體
| Anthropic 集體訴訟和解金額 | 15 億美元 | 41:27 |
| K3 模型參數量 | 接近 3T(約 2.8T) | 32:26 |
| V4 模型參數量 | 1.6T | 32:26 |
| DeepSeek R1 發布的小蒸餾模型數 | 6 個(4 個 Qwen 2.5 底座、2 個 Meta Llama 3 底座) | 10:10 |
| 身份混淆研究測試的模型數 | 27 個模型、77 個問題 | 27:22 |
| 用戶任務被 DeepSeek V4 Flash 解決的比例 | 十個任務裡八個 | 45:30 |
術語
- distillation蒸餾
- 用強模型的輸出或軌跡訓練自己的模型,讓兩者行為越來越接近。
- reasoning model推理模型
- 會先生成長思維鏈再作答的模型,O1 是開啟這一範式的模型。
- agent trajectory智能體軌跡
- 智能體在環境中完整做完一個任務的全過程數據。
- multi-teacher distillation多教師蒸餾
- 同時向多個教師模型學習,博採眾長,也可能訓不好。
- behavior fingerprint行為指紋
- 通過跨賬號協同、重複提問等行為模式識別蒸餾流量的手段。
收聽指南
關注大模型競爭格局的創業者、投資人和工程師,尤其是想判斷蒸餾能否成為長期壁壘、以及前沿模型商業邏輯會怎麼變的人。
最後兩分鐘的主播收尾與互動引導可以跳過。