世界太吵,来原声听播客

TechTechPotato

超大规模自研芯片:不只为省钱,更怕被 Nvidia 绑架

超大规模厂商自研芯片的真正动机不是省钱,而是控制权:避免被 Nvidia 的代际节奏绑架,同时靠规模压缩网络和计算成本。Broadcom 税比 Nvidia 税更便宜,但只有最大玩家玩得起。

超大规模厂商自研芯片AI 硬件NvidiaArm
信息密度高,用 Meta 拆数据中心、Amazon Nitro 等具体案例和规模数字讲透超大规模自研芯片的动机与成本结构,纠正「为了省钱」的简单认知。

核心论点 · 点时间戳可跳到原声

1:30

控制权:不想被 Nvidia 绑定

超大规模厂商自研芯片的第一个理由不是省钱,而是控制权。他们不想把对业务至关重要的东西完全交给 Nvidia。自研可以控制自己的硅片垂直整合、运行自己的优化、决定优化方向,也避免对单一供应商长期采购承诺。Nvidia 芯片每代变化大,采购方必须提前很久承诺大量订单,这构成了战略风险。自研本质上是一种对供应链和产品路线图的主动掌控。

2:30

Meta 拆掉 10 亿美元数据中心

芯片代际变化太大,Meta 曾经把一栋正在建设中的数据中心直接拆除重建。当时已经投入约 10 亿美元,但芯片的变化迫使数据中心架构整体重新设计。这是一个极端案例:在通用芯片路线图上,采购方只能被动跟随。如果自己掌握硅片设计,就能提前知道芯片规格,避免这种全盘推倒重来的浪费。这个例子把「代际不可控」变成了自研芯片的核心理由。

3:30

Google 与 Amazon 路径差异

Google 是自研芯片最典型的案例,TPU 迭代多代,大量基础设施运行在自己的硅片上,但仍然买很多 Nvidia。Google 与 Amazon 的差异在于:Google 的 TPU 主要用于内部工作负载,整个系统围绕内部需求设计;Amazon 则把自研芯片做成对外可租用的实例,走的是不同商业模式。Google 还有 Gemini 这类顶级大模型,TPU 也承载这些模型。OpenAI 未来用 TPU 也已有传闻。所以同样是自研,盈利模式和服务对象完全不同。

7:00

自研 CPU:Arm 与控制整个栈

除了 AI 加速器,超大规模厂商也开始自研 CPU。这背后的逻辑与加速器一致:将通用 CPU 针对自身工作负载做专门化。几乎所有的自研 CPU 都是 Arm 架构。Arm 的数据中心机会突然爆发,正是由超大规模厂商驱动。与传统的 x86 通用芯片模式不同,这些厂商要的是从指令集到硅片的全部控制权。像 Broadcom、Marvell 这类物理设计公司承接具体实现,而 Arm 提供计算子系统(CSS),形成一条不同于 Nvidia 供应链的新链条。

10:30

Broadcom 税 vs Nvidia 税

自研芯片能否省钱?关键看谁来做。超大规模厂商并不直接与代工厂打交道,而是由 Broadcom 这类设计公司对接台积电。Broadcom 因为手握多个客户,能压低价格,所以即使要付「Broadcom 税」,也比「Nvidia 税」便宜。这是一个反直觉的结论:在 AI 芯片上 Nvidia 的利润率极高,自研通过设计公司反而能挤出这部分溢价。但这也意味着超大规模厂商并没有完全去中介化,只是换了一个更便宜的中间人。

15:30

Nitro:网络压缩驱动的自研

Amazon 的自研始于网络而非 AI。早期服务器每台都要配一个网络芯片,再连到 top-of-rack 交换机,但网络利用率不高。Amazon 先用 FPGA 实现 Nitro,让多个 CPU 共享一个网络接口;后来决定把 FPGA 换成 ASIC,于是收购了芯片公司 Annapurna。这一决策的根本是规模:在大量微服务实例下,网络活动率不足以支撑每 CPU 一个网络芯片,压缩网络连接能省下巨额成本。Nitro 后来演化成弹性 fabric 架构,并衍生出 Graviton、Trainium 等芯片。

18:30

规模:1.2M 服务器的压缩数学

为什么不自己造芯片?因为规模太大。举例:如果有 120 万台服务器,把网络连接按 4:1 压缩,只需要 30 万个网络适配器,省下 90 万套适配器及其交换机与基础设施。省下的钱足以支撑自研一个 CPU 或 AI 芯片。这解释了为什么只有最大玩家才能做这种事——规模决定了自研的盈亏平衡点。普通公司没有足够部署量,无法摊薄研发成本,所以只能买通用芯片。

27:30

规模直观化:10k 服务器服务 5M 人

人类很难想象超大规模数字。给出一个换算:服务 500 万人需要 1 万台服务器;美国有约 3 亿到 3.3 亿人口,所以需要 60 个这种规模的仓库,即 60 万台服务器;这还只是美国。全球人口约 80 多亿,即使他国人均需求低,总量也极其庞大。正是这样的数量级,让自研芯片的一切专用优化都能在大规模部署中变成真实收益,也构成了超大规模厂商自研的经济基础。

原话 · 已逐字校验

they don't want to be beholden entirely to Nvidia for something that is so, so important to their business, right?

他们不想在对自己业务如此重要的事情上完全受制于 Nvidia,对吧?

Facebook um demolished a data center they were in the process of building because the chips had changed so much gen on gen that they had to redesign the architecture of their deployment.

Facebook 拆除了一栋正在建设中的数据中心,因为芯片每一代变化太大,他们不得不重新设计部署架构。

A general chip has to be general for everyone.

通用芯片必须对所有人都是通用的。

It turns out Broadcom is cheaper as weird as it is to say.

事实证明 Broadcom 更便宜,尽管说起来很奇怪。

having your own in-house silicon design team can be really beneficial if you want to optimize every cent.

如果你想优化每一分钱,那么拥有自己的内部芯片设计团队会非常有益。

So, if you turn around and say, "Well, I've got 1.2 million servers deployed." Like yeah, I can't picture that number.

所以,如果你说「我有 120 万台服务器部署了」,我根本没法想象那个数字。

if you can identify patterns, you can increase watch time on your platform.

如果你能识别出模式,你就能提高你平台上的观看时长。

数字与实体

AI 加速器市场份额(含 TPU)约 85:1511:09
Annapurna 收购时间约 2015-2016 年15:12
示例部署规模120 万台服务器18:13
网络压缩比4:118:13
美国人口对应仓库数60 个27:17

术语

TPU张量处理单元
Google 为加速神经网络训练/推理设计的专用芯片。
Nitro(AWS 网络虚拟化硬件)
AWS 自研的网络与 I/O 卸载硬件,最初基于 FPGA,后转 ASIC,可让多个 CPU 共享网络接口。
RISC-V开源指令集架构
任何公司可免费使用来设计处理器,被视为 Arm 的潜在替代。
Arm CSSArm 计算子系统
Arm 提供的预集成计算子系统,包含 CPU 核心和互连,缩短定制芯片设计周期。

收听指南

谁该听

关注算力供应链的创业者、投资人,云厂商基础设施工程师,以及想理解 Nvidia 竞争格局的芯片从业者。

可跳过

开头和 14:10 起的 Arteris 广告可跳过,其余信息密度高。