世界太吵,来原声听播客

晚点聊

蒸馏是灰色地带,但张一鸣说它只能逼近不能超越

蒸馏违反用户协议却未必构成侵权,是无人公开谈论的灰色地带。张一鸣拒绝字节蒸馏,理由是它只能逼近对手、无法超越,而代价是组织里走不确定路线的人得不到资源和认可。

蒸馏大模型字节跳动Anthropic后训练

原视频在 YouTube 上放不出来,用音频听:

两位记者把无人愿意公开谈的蒸馏讲透了:技术机制、know-how、红线争议,以及它如何冲击前沿模型的商业逻辑。

核心论点 · 点时间戳可跳到原声

2:04

蒸馏不是抄作业,是有门槛的抄作业

典型蒸馏的流程是:先有一堆问题,去问一个很强的模型(比如 Fable),得到很多回答,提问和回答构成数据对,再用这些数据训练自己的学生模型,让它的输出行为逼近教师模型。但这不是「人家写 A 你就写 A」——它用在后训练和中训练,要算力、要数据、要放进模型里训练,中间有方法和技巧。有了推理模型之后,教师模型给出的不再只是题目和答案,还有推理过程;Agent 发达之后,还能扩展到一整个智能体在环境里完成任务的完整轨迹。

— 曼棋
8:05

两个节点把蒸馏从压缩变成变强

第一个节点是 2024 年 9 月 OpenAI 发布 O1。它带来两个变化:一是揭示了在后训练中做大规模强化学习可以让模型学到推理策略,而蒸馏本来主要就用在后训练,所以投入回报比上升;二是测试时给更多算力、让模型生成更长的思维链也能持续提升性能,而思维链这部分是模型使用阶段的产出,理论上用户能看见,也就成了更好的蒸馏原料。第二个节点是 2025 年 1 月 DeepSeek R1 发布,同时放出六个小蒸馏模型,四个基于 Qwen 2.5、两个基于 Meta Llama 3,都把 R1 当教师——这才是蒸馏最开始的主流目的:压缩。

— 曼棋
13:51

张一鸣的反对理由,一半是技术一半是人性

张一鸣在 Seed 内部会议上说不允许字节做蒸馏,理由有三:蒸馏短期能改善表现,但本质是复制 Claude 已有的能力,最多只能逼近、不能超越;他希望 Seed 从更底层构建 AGI 壁垒,认为蒸馏不是长期壁垒;即使不蒸馏意味着技术上短暂落后国内竞争对手,也不走捷径。从业者普遍认为学生模型超越教师模型在技术上并非绝无可能,比如多教师蒸馏、在特定任务上超越,但蒸馏有组织和激励上的代价:它成本低、确定性高,重心放上去,组织里做长期探索、走不确定路线的人就得不到足够资源和认可。

— 曼棋
28:52

蒸馏的 know-how 在账号运营和数据管线

真正难的不是拿到几百万条回答,而是一整套系统工程。第一是稳定高频访问领先模型的账号,以及配套的用户运营:建很多中转站,让高校理工科学生、研究者、高级程序员这类真能提出高质量问题、又有真实需求的用户去用。这里要防被坑——有某一家模型用中转站,结果发现自己蒸出来的是自己的。第二是数据管线:从真实提问里筛选过滤,用模型扩增改写,中间还要纠错,以及决定数据的形式和配比。整套系统是否成本低、是否稳定,直接影响大规模操作的效果和效率。

— 曼棋
32:08

蒸馏藏不住,因为查的是过程不是结果

想对 Anthropic 和 OpenAI 隐藏蒸馏行为,靠不用 API、直接下载开源权重在自己机房生成数据,其实很难:部署 K3 这种接近 3T 的模型本身要很多算力,持续跑数据的电费也高,容易被监测到。更关键的是,对方不是从结果发现,而是从过程发现——只要你有一次大规模高频使用它的 API,异常行为就可能被看见。Anthropic 说已建立识别蒸馏流量的分类器和行为指纹系统,能发现跨账号协同、重复提问和套取思维链,还加强了对教育、研究、创业公司账号的身份认证,这正好和「找高校学生来用」的运营方式相呼应。

— 曼棋
38:35

蒸馏是灰色地带,但双标争议是真的

原罪这个词有点严重,蒸馏确实违反了 Anthropic、OpenAI 的用户协议,但违反用户协议不一定构成法律侵权。红线比较清楚的是黑客手段:侵入其他公司系统、破解思维链,这类明显违反通行法律的做法不能被接受。至于双标争议,Anthropic 最近有一个 15 亿美元的集体诉讼和解,案情是当年从盗版图书网站下载了很多书、没给这些书付费,被美国作家集体诉讼。这两种行为不完全一样:直接搞到书肯定是侵权,但买了书之后用来训练模型是否侵权,加州法院有一个判例认为只要付了钱就不侵权——这留下一个有意思的回旋镖:如果这样不构成侵权,其他公司用 Anthropic 的产出提升自己的模型,是否构成侵权。

— 曼棋
44:05

更便宜的智能,冲击的是商业逻辑

蒸馏会不会冲击投入几百亿美元训练前沿模型的商业模式?短期市场预期是 Anthropic 和 OpenAI 的估值会受影响,甚至有人认为会冲击 IPO 竞争,但前提是只看到此时此刻——如果 Anthropic 下一个模型又很强,预期又会改变,闭源公司可能有后手没展示。比较明确的是它冲击了商业逻辑:V4 和 Grok 都是性价比很高的模型,那张著名的斩杀线图里,V4 和 Grok 4.6 下方和右边区域里的模型都被斩杀。有应用公司创始人说,用户十个任务里八个都能被 DeepSeek V4 Flash 解决,而且 Flash 非常便宜、速度也快。这背后是更大的问题:智能的供给和需求在规模和节奏上如何匹配,对很多白领工作来说现在的模型已经够用。

— 曼棋

原话 · 已逐字校验

它肯定不是我们 对我们是非常 原初意义理解的那种超答案 就是你能直接有个答案就超过来 因为它还是一个训练的过程

它肯定不是我们原初意义理解的那种抄答案,就是你能直接有个答案就抄过来,因为它还是一个训练的过程。

曼棋3:00

他觉得蒸馏是短期内可以改善模型表现 但本质上是在复制Cloud的以后的能力 所以你这么继续干下去的话 你最多只能逼近对方 你是不能实现超越的

他觉得蒸馏短期内可以改善模型表现,但本质上是在复制 Claude 已有的能力,所以这么继续干下去,你最多只能逼近对方,不能实现超越。

曼棋13:51

张一鸣可能不是最懂技术的 但他大概率是最懂人性的

张一鸣可能不是最懂技术的,但他大概率是最懂人性的。

洪浩19:14

一个运动员理论上是可以既克兴奋剂 又勤家训练的 也许真的就有人是这么干的对吧 只是说一般而言 你如果克了兴奋剂之后 你肯定是会有一些侥幸和惰性的

一个运动员理论上可以既嗑兴奋剂,又勤加训练,也许真的有人这么干。只是一般而言,你嗑了兴奋剂之后,肯定会有一些侥幸和惰性。

曼棋20:16

他肯定是违反了 那些B原模型公司 OpenISRPG的用户协议的 但是违反用户协议 不一定构成法律上的侵权

它肯定违反了那些闭源模型公司 OpenAI 等的用户协议,但违反用户协议不一定构成法律上的侵权。

曼棋39:27

我们之前都说 coding比视频生成大 万一错了了 那这个错了的可能性 也是在于说 可能对很多白领的工作来说 就现在这模型真的已经够用了

我们之前都说 coding 比视频生成大,万一错了呢?这个错了的可能性在于,可能对很多白领的工作来说,现在的模型真的已经够用了。

曼棋46:31

数字与实体

Anthropic 集体诉讼和解金额15 亿美元41:27
K3 模型参数量接近 3T(约 2.8T)32:26
V4 模型参数量1.6T32:26
DeepSeek R1 发布的小蒸馏模型数6 个(4 个 Qwen 2.5 底座、2 个 Meta Llama 3 底座)10:10
身份混淆研究测试的模型数27 个模型、77 个问题27:22
用户任务被 DeepSeek V4 Flash 解决的比例十个任务里八个45:30

术语

distillation蒸馏
用强模型的输出或轨迹训练自己的模型,让两者行为越来越接近。
reasoning model推理模型
会先生成长思维链再作答的模型,O1 是开启这一范式的模型。
agent trajectory智能体轨迹
智能体在环境中完整做完一个任务的全过程数据。
multi-teacher distillation多教师蒸馏
同时向多个教师模型学习,博采众长,也可能训不好。
behavior fingerprint行为指纹
通过跨账号协同、重复提问等行为模式识别蒸馏流量的手段。

收听指南

谁该听

关注大模型竞争格局的创业者、投资人和工程师,尤其是想判断蒸馏能否成为长期壁垒、以及前沿模型商业逻辑会怎么变的人。

可跳过

最后两分钟的主播收尾与互动引导可以跳过。