世界太吵,來原聲聽播客

42章經

幾百美元做到 Hugging Face 開源榜一,真正的卡點是數據

一個人、一張 5090、幾百美元就能把模型送上 Hugging Face 開源榜一,但他 95% 的時間花在數據上——真正的門檻不是算力,是對數據的洞察力。

模型微調合成數據蒸餾Local AI開源模型AI Lab
如果你在評估要不要自己微調模型,這集給了一份帶具體數字的賬本:成本、數據配比、蒸餾路線、serving 端的坑,全都有。

核心論點 · 點時間戳可跳到原聲

3:05

幾百美元就能訓出榜一模型

逯雨鑫沒有 PhD、沒在 AI Lab 待過,當時的身份是 AI 方向的研究生,獨立微調出的模型在 Hugging Face 的開源榜上排到第一。開銷是一張 5090、QLoRA,加 200 美元的 Claude Max 訂閱用來合成數據;租卡一兩美元一小時,真實訓練也就十幾個小時,硬件成本不超過 100 美元,總計幾百美元。第一代約 5 天,第二代兩三週。他的判斷是:工業界的路子只有 SFT 和 RL 兩種,把基礎補好,每個人慢慢都能做到。

— 逯雨鑫
11:10

合成數據治不了模型的病

他的經驗是卡點只有一個:數據。infra、腳本、環境這些看書就能解決,95% 的時間都花在做數據上。合成數據「其實並不是很好」,只能用來靶向處理具體問題——比如他微調的那個小模型有過度自信的毛病,沒完成任務就宣布完成,得專門為這個病造數據;而這種事只跟 AI 說一句是做不對的,必須自己一條條審。項目裡做到小一萬條數據,自己得審 500 條左右;真實數據佔 60% 到 70%,實際可用就是幾千條的量級。

— 逯雨鑫
16:12

老師太強,學生接不住

capacity gap 指的是老師模型太強、學生模型太弱:老師體量在 3T 以上,把它的真實軌跡和作答蒸進一個 12B 的小模型,中間有非常大的能力落差,學生根本學不到。所以數據看著沒問題、AI 校對過、自己也採樣看過,訓出來照樣可能有問題。他的做法是一版一版測,看有沒有明顯提升,沒有就回頭想是不是老師太強、模型太弱。做數據的人最需要的就是這種耐心——第一版不如預期不代表方向錯了。

— 逯雨鑫
17:12

蒸餾最強,RL 只是錦上添花

他用幾臺 H200(一臺就是八卡)做過大量實驗,結論是 on-policy 蒸餾最強,OPD 和 reinforcement learning 都只是錦上添花,不是真正解決問題,所以他自己最後只選了 SFT。至於什麼叫「聰明地蒸」,他的標準不是方法而是錨點:錨點和目標不一致就是不好的蒸餾,比如為了刷 benchmark 蒸一堆衍生變體,而你真正想提升的是別的東西。他給自己的定位也很清楚:頭部那幾家 AGI 之外的玩家不承擔 AGI 的責任,用起來更好用就 OK。他錨定 Agentic 和 Coding,模型自然就有下載量。

— 逯雨鑫
20:14

真正的坑不在訓練,在 serving

成本核算上,應用公司訓一個小模型,幾千到一萬人民幣以下就能得到一個自己比較想要的模型;訓大模型卡量要上去,大概十幾萬到二十萬以內。但真正的開銷在後面:用戶真的去調用、消耗 token 的時候就很貴,serving 端的坑更多,比如 SGLang 和 vLLM 架構,得看部署什麼模型、有多少用戶去核算。他給的一個參照是,如果只是幾併發、十幾併發的需求量,一臺 H200 幾萬塊錢就能搞定十幾個員工的使用。

— 逯雨鑫
32:23

應用公司才是下一個 Neo Lab

他引的是紅杉的判斷:領先的應用公司反而可能變成新的 lab。類比推薦算法時代,最終是已有場景、商業化閉環和用戶數據的公司做出了更好的算法,沒有哪家第三方中立公司只做推薦算法。反轉的形式是 AI Lab 往上走做 research 和前訓,後訓下放給應用公司,因為應用公司不想把數據分享出去。Kimi、智譜這類公司最大的價值就是前訓——前訓一個模型可能要 128 卡到 264 卡 B300、做好幾個月。他也因此理解 AI Lab 為什麼現在砸錢買數據:像移動互聯網早期字節買用戶,用戶獲取成本一開始其實是最低的,後面會越來越高,數據可能也一樣。

— 逯雨鑫
37:29

本地 AI 的驅動力是不信任上游

他的邏輯起點很直接:你調用 API 的時候,你的數據就是可以被上游看見的。中轉站幾十塊錢包月看著便宜,但不只是灰色地帶,還會賣數據;他身邊朋友和他見過的 AI 都遇到過數據洩漏、被黑客威脅的情況。所以對數據特別敏感的領域(cyber security、生物)只能考慮 local AI。他也承認自己的 local AI 使用率目前並不高,因為還是會有錯誤,日常聊天大家更願意用大模型;但手機能跑 27B 之後邏輯會變——手機已經買了,本地問是免費的,調 API 每月還要花 20 到 30 美元。他還提到 2027、2028 年蘋果要出 2T 統一內存的電腦。

— 逯雨鑫
44:32

隱私未必是所有人的真需求

陳皮當場提出質疑:隱私聽起來是真需求,但大家用很多 APP 也是用著用著就無所謂了;而且做 cyber security 的公司加上 SOTA 模型,是不是就能替代人人本地部署。逯雨鑫的回答是,隱私確實很多人不在意,但也有很多人在意,他舉的例子是 Hugging Face 被攻擊時,最後是用中國國產模型本地部署解決的。主持人的補充是:豆包的用戶更多,你們講的還是小眾人群,大多數人最終看的是性價比;而且推動 local AI 的可能不是用戶個人的選擇,而是蘋果這樣的公司在推,因為應用公司和模型公司天然是一個競爭對立的狀態。

原話 · 已逐字校驗

被吹得很神 其實我覺得效果是沒有SFT好的 所以說我最後只選擇了SFT

它被吹得很神,其實我覺得效果沒有 SFT 好,所以我最後只選了 SFT。

逯雨鑫8:09

我覺得數據 其實我很大的一個經驗 就是合成數據 其實並不是很好

關於數據,我很大的一個經驗就是,合成數據其實並不是很好。

逯雨鑫11:10

這個審核數據 我基本上 比如說我的數據量是5000條 那麼我可能自己審 就得需要審500條 因為AI目前合成數據 還是非常差的

審核數據這一塊,比如我的數據量是 5000 條,我自己可能就得審 500 條,因為 AI 目前合成數據還是非常差的。

逯雨鑫13:10

這就認為到一個非常重點的一個知識 叫capacity gap 就是所謂的老師太強了 學生太弱了

這就引出一個非常重要的知識點,叫 capacity gap(能力差距),也就是老師太強了、學生太弱了。

逯雨鑫16:12

我是用幾臺H200 這一臺就是八卡 那這樣我去做過大量實驗 蒸餾是最強的 然後其他的話呢 包括OPD也好啊 包括reinforcement learning 都是在錦上添花 而不是說真正解決問題

我用幾臺 H200——一臺就是八卡——做過大量實驗,蒸餾是最強的。其他的,包括 OPD、包括強化學習,都只是在錦上添花,而不是真正解決問題。

逯雨鑫17:12

我覺得只有是比如說 你想做什麼 然後你真往這個模型 它的分布往這邊拉了 我覺得才是好的蒸餾 不管它Benchmark是掉分了也好 還是說任何也好 只要跟你的方向是一致的 我覺得都是好蒸餾

我覺得只有比如說,你想做什麼,然後你真的把這個模型的分布往那個方向拉,才是好的蒸餾。不管它 benchmark 掉分也好,還是別的也好,只要跟你的方向一致,我覺得都是好蒸餾。

逯雨鑫18:12

因為簡單來說 你調用API的時候 你的數據就是可以被你的上游看見

因為簡單來說,你調用 API 的時候,你的數據就是可以被你的上游看見的。

逯雨鑫37:29

就是local AI的話呢 我自己的使用率其實目前來說並不高 因為local AI還是會有一些錯誤

就 local AI 來說,我自己的使用率目前其實並不高,因為 local AI 還是會有一些錯誤。

逯雨鑫40:31

數字與實體

訓練時長第一代約 5 天,第二代兩三週3:05
訓練配置一張 5090 + QLoRA + 200 美元的 Claude Max 訂閱3:05
硬件成本不超過 100 美元4:06
Agentic benchmark 得分從 15 分提升到 55-60 分4:06
數據與訓練的時間分配第一版 3 天做數據、約 1 天訓練;第二版兩週裡 12 天做數據14:10
真實數據佔比60% 到 70%15:11
數據量總做小一萬條,實際用到幾千條15:11
應用公司自訓成本小模型幾千到一萬人民幣以下;大模型十幾萬到二十萬以內20:14
一臺 H200 的承載十幾個員工的使用21:16
前訓一個模型的算力與週期128 卡到 264 卡 B300,做好幾個月35:27

術語

Capacity Gap能力差距
老師模型太強、學生模型太弱,蒸餾時學生接不住老師的能力。
OPD (on-policy distillation)同策略蒸餾
逯雨鑫用幾臺 H200 做大量實驗後,認為最強的蒸餾方式。
Local AI本地 AI
模型跑在自己的電腦或手機上,數據不出本地。
Neo Lab新實驗室
指從應用側長出來、自己訓模型的團隊,原話是應用公司才是下一個 new lab。
主權 AI主權 AI
用自己數據訓自己的模型,而不是直接用 AI Lab 的模型。

收聽指南

誰該聽

想自己微調模型的應用公司工程師、決定要不要自建模型團隊的技術負責人,以及關心 AI Lab 與應用公司分工變化的投資人。

可跳過

開頭約兩分鐘的轉行經歷只是鋪墊,可從講成本那段直接聽。