几百美元做到 Hugging Face 开源榜一,真正的卡点是数据
一个人、一张 5090、几百美元就能把模型送上 Hugging Face 开源榜一,但他 95% 的时间花在数据上——真正的门槛不是算力,是对数据的洞察力。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
几百美元就能训出榜一模型
逯雨鑫没有 PhD、没在 AI Lab 待过,当时的身份是 AI 方向的研究生,独立微调出的模型在 Hugging Face 的开源榜上排到第一。开销是一张 5090、QLoRA,加 200 美元的 Claude Max 订阅用来合成数据;租卡一两美元一小时,真实训练也就十几个小时,硬件成本不超过 100 美元,总计几百美元。第一代约 5 天,第二代两三周。他的判断是:工业界的路子只有 SFT 和 RL 两种,把基础补好,每个人慢慢都能做到。
— 逯雨鑫合成数据治不了模型的病
他的经验是卡点只有一个:数据。infra、脚本、环境这些看书就能解决,95% 的时间都花在做数据上。合成数据「其实并不是很好」,只能用来靶向处理具体问题——比如他微调的那个小模型有过度自信的毛病,没完成任务就宣布完成,得专门为这个病造数据;而这种事只跟 AI 说一句是做不对的,必须自己一条条审。项目里做到小一万条数据,自己得审 500 条左右;真实数据占 60% 到 70%,实际可用就是几千条的量级。
— 逯雨鑫老师太强,学生接不住
capacity gap 指的是老师模型太强、学生模型太弱:老师体量在 3T 以上,把它的真实轨迹和作答蒸进一个 12B 的小模型,中间有非常大的能力落差,学生根本学不到。所以数据看着没问题、AI 校对过、自己也采样看过,训出来照样可能有问题。他的做法是一版一版测,看有没有明显提升,没有就回头想是不是老师太强、模型太弱。做数据的人最需要的就是这种耐心——第一版不如预期不代表方向错了。
— 逯雨鑫蒸馏最强,RL 只是锦上添花
他用几台 H200(一台就是八卡)做过大量实验,结论是 on-policy 蒸馏最强,OPD 和 reinforcement learning 都只是锦上添花,不是真正解决问题,所以他自己最后只选了 SFT。至于什么叫「聪明地蒸」,他的标准不是方法而是锚点:锚点和目标不一致就是不好的蒸馏,比如为了刷 benchmark 蒸一堆衍生变体,而你真正想提升的是别的东西。他给自己的定位也很清楚:头部那几家 AGI 之外的玩家不承担 AGI 的责任,用起来更好用就 OK。他锚定 Agentic 和 Coding,模型自然就有下载量。
— 逯雨鑫真正的坑不在训练,在 serving
成本核算上,应用公司训一个小模型,几千到一万人民币以下就能得到一个自己比较想要的模型;训大模型卡量要上去,大概十几万到二十万以内。但真正的开销在后面:用户真的去调用、消耗 token 的时候就很贵,serving 端的坑更多,比如 SGLang 和 vLLM 架构,得看部署什么模型、有多少用户去核算。他给的一个参照是,如果只是几并发、十几并发的需求量,一台 H200 几万块钱就能搞定十几个员工的使用。
— 逯雨鑫应用公司才是下一个 Neo Lab
他引的是红杉的判断:领先的应用公司反而可能变成新的 lab。类比推荐算法时代,最终是已有场景、商业化闭环和用户数据的公司做出了更好的算法,没有哪家第三方中立公司只做推荐算法。反转的形式是 AI Lab 往上走做 research 和前训,后训下放给应用公司,因为应用公司不想把数据分享出去。Kimi、智谱这类公司最大的价值就是前训——前训一个模型可能要 128 卡到 264 卡 B300、做好几个月。他也因此理解 AI Lab 为什么现在砸钱买数据:像移动互联网早期字节买用户,用户获取成本一开始其实是最低的,后面会越来越高,数据可能也一样。
— 逯雨鑫本地 AI 的驱动力是不信任上游
他的逻辑起点很直接:你调用 API 的时候,你的数据就是可以被上游看见的。中转站几十块钱包月看着便宜,但不只是灰色地带,还会卖数据;他身边朋友和他见过的 AI 都遇到过数据泄漏、被黑客威胁的情况。所以对数据特别敏感的领域(cyber security、生物)只能考虑 local AI。他也承认自己的 local AI 使用率目前并不高,因为还是会有错误,日常聊天大家更愿意用大模型;但手机能跑 27B 之后逻辑会变——手机已经买了,本地问是免费的,调 API 每月还要花 20 到 30 美元。他还提到 2027、2028 年苹果要出 2T 统一内存的电脑。
— 逯雨鑫隐私未必是所有人的真需求
陈皮当场提出质疑:隐私听起来是真需求,但大家用很多 APP 也是用着用着就无所谓了;而且做 cyber security 的公司加上 SOTA 模型,是不是就能替代人人本地部署。逯雨鑫的回答是,隐私确实很多人不在意,但也有很多人在意,他举的例子是 Hugging Face 被攻击时,最后是用中国国产模型本地部署解决的。主持人的补充是:豆包的用户更多,你们讲的还是小众人群,大多数人最终看的是性价比;而且推动 local AI 的可能不是用户个人的选择,而是苹果这样的公司在推,因为应用公司和模型公司天然是一个竞争对立的状态。
原话 · 已逐字校验
被吹得很神 其实我觉得效果是没有SFT好的 所以说我最后只选择了SFT
它被吹得很神,其实我觉得效果没有 SFT 好,所以我最后只选了 SFT。
逯雨鑫8:09
我觉得数据 其实我很大的一个经验 就是合成数据 其实并不是很好
关于数据,我很大的一个经验就是,合成数据其实并不是很好。
逯雨鑫11:10
这个审核数据 我基本上 比如说我的数据量是5000条 那么我可能自己审 就得需要审500条 因为AI目前合成数据 还是非常差的
审核数据这一块,比如我的数据量是 5000 条,我自己可能就得审 500 条,因为 AI 目前合成数据还是非常差的。
逯雨鑫13:10
这就认为到一个非常重点的一个知识 叫capacity gap 就是所谓的老师太强了 学生太弱了
这就引出一个非常重要的知识点,叫 capacity gap(能力差距),也就是老师太强了、学生太弱了。
逯雨鑫16:12
我是用几台H200 这一台就是八卡 那这样我去做过大量实验 蒸馏是最强的 然后其他的话呢 包括OPD也好啊 包括reinforcement learning 都是在锦上添花 而不是说真正解决问题
我用几台 H200——一台就是八卡——做过大量实验,蒸馏是最强的。其他的,包括 OPD、包括强化学习,都只是在锦上添花,而不是真正解决问题。
逯雨鑫17:12
我觉得只有是比如说 你想做什么 然后你真往这个模型 它的分布往这边拉了 我觉得才是好的蒸馏 不管它Benchmark是掉分了也好 还是说任何也好 只要跟你的方向是一致的 我觉得都是好蒸馏
我觉得只有比如说,你想做什么,然后你真的把这个模型的分布往那个方向拉,才是好的蒸馏。不管它 benchmark 掉分也好,还是别的也好,只要跟你的方向一致,我觉得都是好蒸馏。
逯雨鑫18:12
因为简单来说 你调用API的时候 你的数据就是可以被你的上游看见
因为简单来说,你调用 API 的时候,你的数据就是可以被你的上游看见的。
逯雨鑫37:29
就是local AI的话呢 我自己的使用率其实目前来说并不高 因为local AI还是会有一些错误
就 local AI 来说,我自己的使用率目前其实并不高,因为 local AI 还是会有一些错误。
逯雨鑫40:31
数字与实体
| 训练时长 | 第一代约 5 天,第二代两三周 | 3:05 |
| 训练配置 | 一张 5090 + QLoRA + 200 美元的 Claude Max 订阅 | 3:05 |
| 硬件成本 | 不超过 100 美元 | 4:06 |
| Agentic benchmark 得分 | 从 15 分提升到 55-60 分 | 4:06 |
| 数据与训练的时间分配 | 第一版 3 天做数据、约 1 天训练;第二版两周里 12 天做数据 | 14:10 |
| 真实数据占比 | 60% 到 70% | 15:11 |
| 数据量 | 总做小一万条,实际用到几千条 | 15:11 |
| 应用公司自训成本 | 小模型几千到一万人民币以下;大模型十几万到二十万以内 | 20:14 |
| 一台 H200 的承载 | 十几个员工的使用 | 21:16 |
| 前训一个模型的算力与周期 | 128 卡到 264 卡 B300,做好几个月 | 35:27 |
术语
- Capacity Gap能力差距
- 老师模型太强、学生模型太弱,蒸馏时学生接不住老师的能力。
- OPD (on-policy distillation)同策略蒸馏
- 逯雨鑫用几台 H200 做大量实验后,认为最强的蒸馏方式。
- Local AI本地 AI
- 模型跑在自己的电脑或手机上,数据不出本地。
- Neo Lab新实验室
- 指从应用侧长出来、自己训模型的团队,原话是应用公司才是下一个 new lab。
- 主权 AI主权 AI
- 用自己数据训自己的模型,而不是直接用 AI Lab 的模型。
收听指南
想自己微调模型的应用公司工程师、决定要不要自建模型团队的技术负责人,以及关心 AI Lab 与应用公司分工变化的投资人。
开头约两分钟的转行经历只是铺垫,可从讲成本那段直接听。