世界太吵,来原声听播客

Interconnects

开闭源差距只剩 3-5 个月,这层时间差就是全部的安全边际

Kimi K3 把开源落后闭源的差距从争论中的 6-9 个月压到 3-5 个月,而这层时间差正是唯一的风险缓冲——重手监管开源只会推迟不可避免的事,同时把缓冲本身作废掉。

开源模型中美竞争资本效率MoE 架构AI 政策
这是把 K3 当生态拐点来读的判断文:开源的减速主义经济学、中国实验室的资本效率来源、政策不对称三条论证,都能直接用于判断,不是模型评测。

核心论点 · 时间戳为按文稿位置估算

0:00

差距被压到 3-5 个月

K3 是 2.8T 参数的 MoE,7 月 16 日发布、承诺 7 月 27 日放出权重。作者把整篇文章的关键结论定死在一个数字上:开源对闭源、或美国对中国的模型性能差距,已经从此前争论中的 6-9 个月缩短到 3-5 个月。他给了一个稳健性说明——即使 Moonshot 最终没兑现开源,只要中国存在同等强度的闭源模型,多数推论也只会落到中间地带,方向不变。榜单证据是:Vals AI 综合第二,Artificial Analysis 智能指数第三(只输给 Claude Fable 和 GPT-5.6 Sol Max,且更便宜),Frontend Code Arena 第一。这是自 DeepSeek R1 以来开源模型离前沿最近的一次。

— Nathan Lambert
0:00

蒸馏叙事在这一集被判死

作者直接给结论:如果对抗性蒸馏对 K3 有贡献,也只是很小的程度。理由是 R1 和 K3 性质不同——R1 是中国实验室极快转向推理模型的抢跑,K3 则是在数据、算法、架构、工具、环境这些已知方向上做规模化,也就是 OpenAI 和 Anthropic 的人正在解的同一批问题。另一层证据来自他的中国行:Kimi 团队的文化是他走访过的公司里少数一眼就能感受到的,在 GPU 受限的环境里仍有很强的个人执行力和表达自由;见过之后,这个结果对他反而不意外。他预判蒸馏争论和相关压力还会继续,但把中国模型归因于 IP 盗窃的观察者会被现实打脸。

— Nathan Lambert
0:00

WAIC 讲话是风险容忍度表态

此前中国几乎没有关于开源 AI 的国家级政策表述,作者说据他所知没有高层公开评论过。这周变了:习近平在世界人工智能大会(WAIC)主旨演讲中,非常直接地把中国 AI 生态的未来押在开源和全球扩散上。作者的解读是,这个承诺与史上最强开源权重模型出现在同一周,等于中国对开源权重的风险容忍度做了隐含表态。最简单的解释是:中国政府在密切跟踪模型风险,技术颗粒度可能比美国的「氛围式监管」更细,若测到风险会动手——而它目前判断前沿模型没有实质风险。同时经济决策者认为先把 AI 用起来是好事,做大分发之后再变现,路径与汽车、光伏、先进制造一致。

— Nathan Lambert
0:00

开源是前沿实验室的经济软肋

Dean Ball(个人支持开源,但现在在 OpenAI)说开源权重模型本质上是减速主义,作者说他是对的。传导链条很具体:强开源模型大幅压低闭源实验室的毛利空间,一是实验室能再投入下一代模型的利润变少,二是市场下调这些公司的终值,从而打折未来的融资轮次。两者合起来会推迟最具变革性模型的到来。但作者不认为这足以让 OpenAI 和 Anthropic 掉出全球最高估值公司之列,而且他认为这对社会是净好事:开源在扩散端是加速主义,把某一性能档位的智能入场价压低并鼓励定制化,只是这条曲线起步慢得多——他的说法是起步更慢、但可能更大的指数。风险在于闭源能力跑得太远,定制化就失去意义。

— Nathan Lambert
9:23

2.5× 效率来自哪三处改动

Kimi 的发布博客给了可核对的技术抓手:K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)两项架构更新,分别改善信息沿序列长度和沿模型深度的流动;同时把 MoE 稀疏度拉高到 896 个专家中实际激活 16 个,配合 Stable LatentMoE 框架。加上训练与数据配方的精修,相对 K2 带来约 2.5 倍的整体 scaling 效率提升。作者顺手追了这条创新的扩散路径:KDA 出自 Kimi Linear 论文,与他在 Ai2 做 Olmo Hybrid 时用的 Gated DeltaNet 同源;Gated Delta Networks 2024 年底才提出、建立在 Mamba 的想法上,到 2026 年中已经进入前沿模型,Qwen 最新模型也换到了相关架构。

— Nathan Lambert
9:23

资本效率:追赶比发明便宜

作者判断中国实验室明显更资本高效,而在智能正比于有效资本(买算力、数据、人才)的世界里,这可能是一个 AI 产业能拥有的最大优势。他列了几条听说但无法证实的因素:中国研究员薪酬更低却更擅长解 LLM 研究谜题、正在形成的数据产业(预算仍远低于 Anthropic 的十亿美元级)、通过绕过出口管制拿到有意义的训练算力,以及推理需求小得多所以更多算力能投到训练——不过 Moonshot 已因 K3 暂停新订阅,API 仍在跑。他给出的机制性解释是:美国实验室把大量精力花在戏剧性的大跨步推进前沿,中国实验室更聚焦追赶,而追赶本身更便宜,就像蒸馏中学生模型可以超过老师。

— Nathan Lambert
9:23

开源生态不是维持,是加码

K3 发布后的那个周末,阿里宣布 2.4 万亿参数的 Qwen 3.8 即将以开源权重发布。作者强调这个信号的分量:历史上阿里把最大的模型留作云业务的 API 独占,这次转向说明中国公司不只是维持开源现状,而是在往里加码——即使 Qwen 3.8 在跑分上落后 K3,方向意义仍然成立。他给了一个可验证的推论:如果 Qwen 3.8 赶在下一代 Gemini 之前发布,会把 Google 挤到最聪明模型实验室榜单的第八位。另外 DeepSeek V4 预计会从 preview 版转正。在他给出的各家峰值模型排序里,DeepMind 只挂着 Gemini Flash 3.5,他形容看到 DeepMind 和几家美国巨头排这么靠后令人震惊,并认为 X AI 团队应该拿到更多认可。

— Nathan Lambert
19:54

禁开源会造出防守不对称

作者的立场是:如果今天把 Claude Mythos 开源,负面后果相对轻微,风险被过度炒作了;但这不会永远成立,所以最强模型比同水平开源模型早几个月以受控闭源方式提供,是一个非常安全的均衡。危险在于监管走偏。他引 Axios 的报道:商务部去年考虑把多家中国 AI 实验室列入实体清单;NSA 与白宫国家网络总监办公室考虑发布针对中国实验室的威胁通告;白宫考虑发行政令,要求美国公司只有能保证安全并承担泄露责任才能托管中国模型;商务部还借供应链安全权限草拟过针对中国开源模型的规则。结果会是高度不对称的状态:美国最好的模型在网络安全任务上带着护栏,而全球行为者拿着优秀的中国开源模型来探测美国的防线。

— Nathan Lambert

原话 · 已逐字校验

The key fact is that either the open-to-closed or American-to-Chinese model performance gap has been reduced from the debated 6-9 months to something shorter, say 3-5 months.

关键事实是:无论是开源对闭源,还是美国对中国的模型性能差距,都已经从人们争论的 6-9 个月缩短到了更短的区间,比如 3-5 个月。

Nathan Lambert0:00

Open-weight models are inherently decelerationist, and I’m continually surprised to see the so-called “accelerationists” so excited about open-weight models.

开源权重模型本质上是减速主义的,而我一直很惊讶那些所谓的「加速主义者」竟然对开源权重模型如此兴奋。

Dean Ball0:00

It is becoming clear that the Chinese labs are far more capital efficient. In a world where scaling laws dictate that intelligence is proportional to effective capital – which buys compute, data, & talent – that may be the greatest strength your AI industry could ever have.

越来越清楚的是,中国实验室的资本效率高得多。在一个由 scaling laws 决定「智能正比于有效资本」(资本用来买算力、数据和人才)的世界里,这可能是一个 AI 产业所能拥有的最大优势。

Nathan Lambert9:23

Just as the student model can outperform the teacher in distillation generally (not limited to the adversarial distillation of the Chinese labs), an approach of “trying to catch up” rather than “invent the next paradigm” could lead to stronger models.

正如蒸馏中学生模型普遍可以超过老师(不限于中国实验室的对抗性蒸馏),选择「努力追赶」而不是「发明下一个范式」这条路线,反而可能做出更强的模型。

Nathan Lambert9:23

If we regulate open-weight models heavy-handedly, I suspect much of the world will be lulled into thinking we no longer need to act. All we would’ve done is slightly delayed the inevitable — open models will continue to cross all the key capability thresholds eventually and regardless of legality.

如果我们对开源权重模型施以重手监管,我怀疑世界上很大一部分人会被哄骗成「我们不再需要行动」。而我们做到的只是把不可避免的事略微推迟——开源模型终究会跨过所有关键能力阈值,无论它是否合法。

Nathan Lambert19:54

数字与实体

K3 发布日 / 权重发布日7 月 16 日发布,承诺 7 月 27 日放权重0:00
开源落后闭源的时间差从争论中的 6-9 个月缩至 3-5 个月0:00
K3 榜单位置Vals AI 第 2、Artificial Analysis 第 3、Frontend Code Arena 第 10:00
OpenAI 单个研究员可用算力(作者玩笑估计)数千台 H100 等效机器0:00
K3 的 MoE 激活比例896 个专家中激活 16 个9:23
K3 相对 K2 的 scaling 效率提升约 2.5 倍9:23
Qwen 3.8 参数量2.4 万亿参数,将开源权重9:23

术语

Kimi Delta Attention (KDA)Kimi 德尔塔注意力
出自 Kimi Linear 论文的注意力变体,改善信息沿序列长度的流动。
Attention Residuals (AttnRes)注意力残差
改善信息在模型深度方向流动的架构改动。
Stable LatentMoE稳定隐空间 MoE
配合极高稀疏度(896 选 16)使用的专家混合框架。
adversarial distillation对抗性蒸馏
从闭源前沿模型的输出中反向提取能力,用于训练自家模型。
decelerationist减速主义
指压低前沿实验室利润与融资、从而拖慢 AI 投入节奏的力量。
Entity List实体清单
美国商务部管制名单,上榜方须获许可才能获得美方技术与服务。

收听指南

谁该听

关注中美模型格局的投资人、要在开源权重与闭源 API 之间做技术选型的工程负责人、以及做 AI 出口管制与开源政策研判的人。

可跳过

第 5 节美国监管动向,不关心政策可跳过。