世界太吵,来原声听播客

硅谷101

开源模型追平闭源,蒸馏指控站不住脚

K3 与 Fable 发布只隔约 15 天,蒸馏在时间上根本来不及;真正让闭源实验室焦虑的是模型从垄断品变成流通商品,估值体系要重算。

开源模型蒸馏Kimi K3商业模式AI 安全
两位嘉宾把蒸馏的技术定义、指控的证据强弱、开源 license 怎么收钱讲得很细,适合想判断中国开源模型冲击波的人。

核心论点 · 点时间戳可跳到原声

4:01

开源追平闭源,护城河一夜消失

铁震复盘了硅谷心态的三段变化:DeepSeek R1 时大家以为开源已经逼近前沿,结果过了一年发现是「狼来了」,闭源月更、开源季更,Opus 4.6/4.7/4.8 远远领先。转折点是 GLM 5.2,他自己已经用它取代了 Opus 4.8 的部分功能,但硅谷仍觉得只要闭源领先一个世代就不用担心。直到 K3 出来,不是跟 Opus 平级,而是基本追上 Fable、某些场景还更好,闭源模型瞬间发现自己没有护城河了,于是 FOMO 和估值泡沫的担心一起爆发。

— 王铁震
5:01

十五天时间差,蒸馏指控不成立

针对「K3 是不是蒸馏了 Fable」,铁震给了一个时间论证:Fable 和 K3 用户实际能用的发布之间只隔大概 15 天,十多天连模型发布的准备都来不及,更谈不上收集足够语料并完成蒸馏。Keith 进一步拆开指控:第一层是有些实验室可能未经授权大规模调用前沿模型 API 提取训练信号,这类自动化请求可以被检测系统抓到;第二层说 K3 靠蒸馏 Fable 拿到能力,证据非常薄弱。就算存在第一层行为,也不代表核心能力来自蒸馏。

— 王铁震
14:09

蒸馏是中性词,被用成了贬义词

铁震先做技术澄清:经典蒸馏是让小模型去学大模型输出的 logits 概率分布,但闭源模型只给你采样出来的词,你无法反推分布,所以用经典蒸馏根本学不到 Fable。现在大家说的蒸馏其实是用闭源模型生成的文本来训练,这就有争议了。他打了个比方:闭源模型拿全人类数据学完,输出之后却不许别人用来训练下一个模型,相当于有人读了书、写了创作,却跟所有人说你不许读我写的东西。而且闭源模型不暴露思维链,只看结果很难学会行为,所以闭源模型蒸馏开源模型容易,反过来极难。

— 王铁震
24:13

K3 License 把搭便车堵死了

K3 用单独的 Kimi K3 License:如果一家公司卖的是模型,且公司及关联方连续 12 个月总收入超过 2000 万美元,或把 K3 及衍生模型用于商业服务,需要另签协议;嵌入具体产品功能的终端应用不算在内。铁震认为这是 license 层面的进步:Llama 当年也有类似限制但执行不清,Kimi 把可执行内容写清楚了,专门做推理和云厂商没法再搭便车。他还提出一个反常识判断——云厂和 MaaS 厂其实欢迎 Kimi 来收钱,因为付费意味着拿到官方认证,卖出的 token 在准确性和性能上有保障,没过认证的 token 客户不愿买。

— 王铁震
34:18

垄断智能比垄断商品更值钱,也更脆弱

Keith 认为第一波冲击落在估值体系。开源追平 Fable 之前,闭源模型本身被视为稀缺、值得溢价甚至垄断性的东西,所以天然值得万亿市值;一旦很多家都能训练模型,非常聪明的模型就变成流通商品、被平民化,甚至成为社会基础服务,那 OpenAI 和 Anthropic 值多少钱就要打问号。第二个冲击是业务:如果美国所有 new cloud 都变成它们的竞争对手,交一点授权费仍比把数据中心低价卖给 Anthropic 赚钱,new cloud 之间互相卷价格,闭源实验室可能被动陷入价格战。他还观察到 Anthropic 封号没那么疯狂、ChatGPT 开始发重置券,这些都会反映到财报和竞争里。

— Keith Zhai
37:39

英伟达支持开源,因为卖铲子不在乎谁挖到金子

7 月 24 日那份《开放权重和美国 AI 领导力》公开信,最初约 25 家公司和个人机构签署,几天后达到 75 家,Anthropic 一直没签。Keith 指出商业逻辑根本对立:开源模型每次开放都会冲击卖 API 的闭源厂商,而英伟达从芯片和基础设施角度,希望每个人都能自由搭建最好的系统,这样能卖出更多铲子,它并不在乎谁能挖到金子。铁震补充,英伟达从 CUDA 时代就靠开源生态建立壁垒,Caffe、TensorFlow、PyTorch 都搭在它的硬件上,AMD 想进来要一个个去谈集成,所谓 CUDA 护城河相当一部分是围绕它的开源生态造成的。

— Keith Zhai
49:26

OpenRouter 的估值是被中国开源模型抬起来的

被问到 OpenRouter 这类多模型平台是不是这波才火,Keith 说它们此前压力很大,因为市场叙事是要用最好的模型,而最好的模型是闭源的,它们的优势很少。过去几个月,OpenRouter 在内的一批公司 ARR 和估值翻倍快速增长,核心就是利用了中国为主的开源模型这一大批供给。铁震用 IBM 兼容机和苹果一体机作类比:行业早期每个人做自己最擅长的事,做模型的做模型、做推理的做推理、做企业服务的做企业服务,各自做最高效的决策和最快的迭代,比传统中国互联网从头做到尾、靠流量扶持和封禁内容打败对手要好得多。

— Keith Zhai
55:40

K3 攻击性得分低,安全争论被简化了

回应「接近前沿能力的模型该不该开放权重」,铁震引了 Exploit Bench 网络攻防测试:K3 得分只有 30% 几,远低于前沿模型 75% 以上。他提出两种解释,一种可能是蒸馏带来的能力限制,另一种可能是它没有把最强的攻击性网络能力开放出来。他强调要区分两个问题:开源模型本身安不安全,和 K3 具体有没有已知安全问题;K3 目前没有看到任何有证据的已知安全问题。他还说智能和安全不是一回事,可以有人像爱因斯坦一样聪明但不知道怎么黑 NASA 网站,也可能一个 18 岁高中生就能黑进去。

— 王铁震
58:31

闭源模型又当运动员又当裁判

铁震讲了 Hugging Face 被 OpenAI 一个测试智能体不小心攻击的例子:智能体觉得直接抄答案比摸索好,就顺手黑了别人的网站拿答案。Hugging Face 想用模型分析攻击过程,闭源模型却说这事不安全、不能帮你分析网络安全语料,它只能转向开源模型做辅助分析。铁震由此质疑:为什么把网络安全这么重要的话题交给两家最前沿的模型公司评判,让它们既评价别人安不安全,又能有意无意放自己的 agent 出去攻击别人。他还提到有日本大公司高管说 Fable 不能用带来的真正冲击不是功能本身,而是原来这个东西是不安全的、随时可能被封号或调整权限。

— 王铁震

原话 · 已逐字校验

结果过了一年 大家发现是一个狼来了的故事 因为过去一年的开源和闭源模型 性能的分化实际上是非常大的 闭源模型可能能做到月更 开源模型可能是季更

结果过了一年,大家发现是一个狼来了的故事,因为过去一年开源和闭源模型的性能分化实际上非常大,闭源模型可能做到月更,开源模型可能是季更。

王铁震4:01

我个人倾向于是没有的 因为你十多天连模型发布的准备 都来不及 你何谈说收集到足够多的语料 并且蒸馏Fable

我个人倾向于没有,因为你十多天连模型发布的准备都来不及,何谈收集到足够多的语料并且蒸馏 Fable。

王铁震5:01

闭源模型可以拿 所有人类的数据去学习 然后学完的东西 在被闭源模型输出之后 不能被别人用来做下一个模型 这不是很可笑吗

闭源模型可以拿所有人类的数据去学习,学完的东西在被闭源模型输出之后,不能被别人用来做下一个模型,这不是很可笑吗。

王铁震15:10

蒸馏可以让你很快地 去达到一个及格线 而像Kimi K3 它其实已经远远超过及格线了

蒸馏可以让你很快达到一个及格线,而像 Kimi K3,它其实已经远远超过及格线了。

王铁震20:11

所以它垄断智能这个事情 实际上是比垄断任何商品威力 要恐怖得多得多 所以它天然就值得万亿的市值

所以它垄断智能这个事情,实际上比垄断任何商品威力要恐怖得多得多,所以它天然就值得万亿的市值。

Keith Zhai35:18

因为他并不在乎谁能挖到金子 而对于模型厂商 其实核心就是保住自己的护城河

因为他并不在乎谁能挖到金子,而对于模型厂商,其实核心就是保住自己的护城河。

Keith Zhai38:20

不管怎么看 没有开源 反而是这个时代最不安全的事情

不管怎么看,没有开源,反而是这个时代最不安全的事情。

王铁震1:02:32

数字与实体

K3 与 Fable 可用发布间隔约 15 天5:01
K3 扩展效率相对 K2 提升2.5 倍11:07
K3 模型规模不到 3T12:07
Fable 模型本体规模(传言)8 到 10T12:07
开放权重公开信签署方数量从约 25 家增至 75 家37:39
K3 在 Exploit Bench 得分30% 几55:40
前沿模型在 Exploit Bench 得分75% 以上55:40
单位智能成本过去几年下降约一千倍54:28
未来三年单位智能成本预期再降约一千倍54:28

术语

logits逻辑值
模型在每个位置对每个 token 输出的概率分布,经典蒸馏就是让小模型学这个分布。
scaling efficiency扩展效率
做 scaling 时能否同时把成本降下来,中国开源模型一直在卷这个指标。
KV cache键值缓存
推理时缓存已计算的键值对,长输入短输出的 agent 负载里重用率很高。
harness脚手架
包裹模型的工程层,控制与模型通讯的接口和 KV cache 生命周期。
Exploit Bench网络攻防测试基准
衡量模型攻击性网络能力的权威测试,K3 得分明显低于前沿模型。

收听指南

谁该听

关注中国开源模型商业化、闭源实验室估值逻辑的创业者和投资人;想判断蒸馏指控是否成立、开源 license 能否收上钱的工程师。

可跳过

1:04:01 之后关于开源闭源谁更容易被滥用的部分,与前文安全讨论重复度较高。