幾百美元做到 Hugging Face 開源榜一,真正的卡點是數據
一個人、一張 5090、幾百美元就能把模型送上 Hugging Face 開源榜一,但他 95% 的時間花在數據上——真正的門檻不是算力,是對數據的洞察力。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
幾百美元就能訓出榜一模型
逯雨鑫沒有 PhD、沒在 AI Lab 待過,當時的身份是 AI 方向的研究生,獨立微調出的模型在 Hugging Face 的開源榜上排到第一。開銷是一張 5090、QLoRA,加 200 美元的 Claude Max 訂閱用來合成數據;租卡一兩美元一小時,真實訓練也就十幾個小時,硬件成本不超過 100 美元,總計幾百美元。第一代約 5 天,第二代兩三週。他的判斷是:工業界的路子只有 SFT 和 RL 兩種,把基礎補好,每個人慢慢都能做到。
— 逯雨鑫合成數據治不了模型的病
他的經驗是卡點只有一個:數據。infra、腳本、環境這些看書就能解決,95% 的時間都花在做數據上。合成數據「其實並不是很好」,只能用來靶向處理具體問題——比如他微調的那個小模型有過度自信的毛病,沒完成任務就宣布完成,得專門為這個病造數據;而這種事只跟 AI 說一句是做不對的,必須自己一條條審。項目裡做到小一萬條數據,自己得審 500 條左右;真實數據佔 60% 到 70%,實際可用就是幾千條的量級。
— 逯雨鑫老師太強,學生接不住
capacity gap 指的是老師模型太強、學生模型太弱:老師體量在 3T 以上,把它的真實軌跡和作答蒸進一個 12B 的小模型,中間有非常大的能力落差,學生根本學不到。所以數據看著沒問題、AI 校對過、自己也採樣看過,訓出來照樣可能有問題。他的做法是一版一版測,看有沒有明顯提升,沒有就回頭想是不是老師太強、模型太弱。做數據的人最需要的就是這種耐心——第一版不如預期不代表方向錯了。
— 逯雨鑫蒸餾最強,RL 只是錦上添花
他用幾臺 H200(一臺就是八卡)做過大量實驗,結論是 on-policy 蒸餾最強,OPD 和 reinforcement learning 都只是錦上添花,不是真正解決問題,所以他自己最後只選了 SFT。至於什麼叫「聰明地蒸」,他的標準不是方法而是錨點:錨點和目標不一致就是不好的蒸餾,比如為了刷 benchmark 蒸一堆衍生變體,而你真正想提升的是別的東西。他給自己的定位也很清楚:頭部那幾家 AGI 之外的玩家不承擔 AGI 的責任,用起來更好用就 OK。他錨定 Agentic 和 Coding,模型自然就有下載量。
— 逯雨鑫真正的坑不在訓練,在 serving
成本核算上,應用公司訓一個小模型,幾千到一萬人民幣以下就能得到一個自己比較想要的模型;訓大模型卡量要上去,大概十幾萬到二十萬以內。但真正的開銷在後面:用戶真的去調用、消耗 token 的時候就很貴,serving 端的坑更多,比如 SGLang 和 vLLM 架構,得看部署什麼模型、有多少用戶去核算。他給的一個參照是,如果只是幾併發、十幾併發的需求量,一臺 H200 幾萬塊錢就能搞定十幾個員工的使用。
— 逯雨鑫應用公司才是下一個 Neo Lab
他引的是紅杉的判斷:領先的應用公司反而可能變成新的 lab。類比推薦算法時代,最終是已有場景、商業化閉環和用戶數據的公司做出了更好的算法,沒有哪家第三方中立公司只做推薦算法。反轉的形式是 AI Lab 往上走做 research 和前訓,後訓下放給應用公司,因為應用公司不想把數據分享出去。Kimi、智譜這類公司最大的價值就是前訓——前訓一個模型可能要 128 卡到 264 卡 B300、做好幾個月。他也因此理解 AI Lab 為什麼現在砸錢買數據:像移動互聯網早期字節買用戶,用戶獲取成本一開始其實是最低的,後面會越來越高,數據可能也一樣。
— 逯雨鑫本地 AI 的驅動力是不信任上游
他的邏輯起點很直接:你調用 API 的時候,你的數據就是可以被上游看見的。中轉站幾十塊錢包月看著便宜,但不只是灰色地帶,還會賣數據;他身邊朋友和他見過的 AI 都遇到過數據洩漏、被黑客威脅的情況。所以對數據特別敏感的領域(cyber security、生物)只能考慮 local AI。他也承認自己的 local AI 使用率目前並不高,因為還是會有錯誤,日常聊天大家更願意用大模型;但手機能跑 27B 之後邏輯會變——手機已經買了,本地問是免費的,調 API 每月還要花 20 到 30 美元。他還提到 2027、2028 年蘋果要出 2T 統一內存的電腦。
— 逯雨鑫隱私未必是所有人的真需求
陳皮當場提出質疑:隱私聽起來是真需求,但大家用很多 APP 也是用著用著就無所謂了;而且做 cyber security 的公司加上 SOTA 模型,是不是就能替代人人本地部署。逯雨鑫的回答是,隱私確實很多人不在意,但也有很多人在意,他舉的例子是 Hugging Face 被攻擊時,最後是用中國國產模型本地部署解決的。主持人的補充是:豆包的用戶更多,你們講的還是小眾人群,大多數人最終看的是性價比;而且推動 local AI 的可能不是用戶個人的選擇,而是蘋果這樣的公司在推,因為應用公司和模型公司天然是一個競爭對立的狀態。
原話 · 已逐字校驗
被吹得很神 其實我覺得效果是沒有SFT好的 所以說我最後只選擇了SFT
它被吹得很神,其實我覺得效果沒有 SFT 好,所以我最後只選了 SFT。
逯雨鑫8:09
我覺得數據 其實我很大的一個經驗 就是合成數據 其實並不是很好
關於數據,我很大的一個經驗就是,合成數據其實並不是很好。
逯雨鑫11:10
這個審核數據 我基本上 比如說我的數據量是5000條 那麼我可能自己審 就得需要審500條 因為AI目前合成數據 還是非常差的
審核數據這一塊,比如我的數據量是 5000 條,我自己可能就得審 500 條,因為 AI 目前合成數據還是非常差的。
逯雨鑫13:10
這就認為到一個非常重點的一個知識 叫capacity gap 就是所謂的老師太強了 學生太弱了
這就引出一個非常重要的知識點,叫 capacity gap(能力差距),也就是老師太強了、學生太弱了。
逯雨鑫16:12
我是用幾臺H200 這一臺就是八卡 那這樣我去做過大量實驗 蒸餾是最強的 然後其他的話呢 包括OPD也好啊 包括reinforcement learning 都是在錦上添花 而不是說真正解決問題
我用幾臺 H200——一臺就是八卡——做過大量實驗,蒸餾是最強的。其他的,包括 OPD、包括強化學習,都只是在錦上添花,而不是真正解決問題。
逯雨鑫17:12
我覺得只有是比如說 你想做什麼 然後你真往這個模型 它的分布往這邊拉了 我覺得才是好的蒸餾 不管它Benchmark是掉分了也好 還是說任何也好 只要跟你的方向是一致的 我覺得都是好蒸餾
我覺得只有比如說,你想做什麼,然後你真的把這個模型的分布往那個方向拉,才是好的蒸餾。不管它 benchmark 掉分也好,還是別的也好,只要跟你的方向一致,我覺得都是好蒸餾。
逯雨鑫18:12
因為簡單來說 你調用API的時候 你的數據就是可以被你的上游看見
因為簡單來說,你調用 API 的時候,你的數據就是可以被你的上游看見的。
逯雨鑫37:29
就是local AI的話呢 我自己的使用率其實目前來說並不高 因為local AI還是會有一些錯誤
就 local AI 來說,我自己的使用率目前其實並不高,因為 local AI 還是會有一些錯誤。
逯雨鑫40:31
數字與實體
| 訓練時長 | 第一代約 5 天,第二代兩三週 | 3:05 |
| 訓練配置 | 一張 5090 + QLoRA + 200 美元的 Claude Max 訂閱 | 3:05 |
| 硬件成本 | 不超過 100 美元 | 4:06 |
| Agentic benchmark 得分 | 從 15 分提升到 55-60 分 | 4:06 |
| 數據與訓練的時間分配 | 第一版 3 天做數據、約 1 天訓練;第二版兩週裡 12 天做數據 | 14:10 |
| 真實數據佔比 | 60% 到 70% | 15:11 |
| 數據量 | 總做小一萬條,實際用到幾千條 | 15:11 |
| 應用公司自訓成本 | 小模型幾千到一萬人民幣以下;大模型十幾萬到二十萬以內 | 20:14 |
| 一臺 H200 的承載 | 十幾個員工的使用 | 21:16 |
| 前訓一個模型的算力與週期 | 128 卡到 264 卡 B300,做好幾個月 | 35:27 |
術語
- Capacity Gap能力差距
- 老師模型太強、學生模型太弱,蒸餾時學生接不住老師的能力。
- OPD (on-policy distillation)同策略蒸餾
- 逯雨鑫用幾臺 H200 做大量實驗後,認為最強的蒸餾方式。
- Local AI本地 AI
- 模型跑在自己的電腦或手機上,數據不出本地。
- Neo Lab新實驗室
- 指從應用側長出來、自己訓模型的團隊,原話是應用公司才是下一個 new lab。
- 主權 AI主權 AI
- 用自己數據訓自己的模型,而不是直接用 AI Lab 的模型。
收聽指南
想自己微調模型的應用公司工程師、決定要不要自建模型團隊的技術負責人,以及關心 AI Lab 與應用公司分工變化的投資人。
開頭約兩分鐘的轉行經歷只是鋪墊,可從講成本那段直接聽。