世界太吵,來原聲聽播客

TechTechPotato

自研芯片不為省錢,為擺脫 Nvidia 的代際綁架

超大規模廠商自研芯片的真正動機不是省錢,而是控制權:避免被 Nvidia 的代際節奏綁架,同時靠規模壓縮網絡和計算成本。Broadcom 稅比 Nvidia 稅更便宜,但只有最大玩家玩得起。

超大規模廠商自研芯片AI 硬件NvidiaArm
信息密度高,用 Meta 拆數據中心、Amazon Nitro 等具體案例和規模數字講透超大規模自研芯片的動機與成本結構,糾正「為了省錢」的簡單認知。

核心論點 · 點時間戳可跳到原聲

1:30

控制權:不想被 Nvidia 綁定

超大規模廠商自研芯片的第一個理由不是省錢,而是控制權。他們不想把對業務至關重要的東西完全交給 Nvidia。自研可以控制自己的硅片垂直整合、運行自己的優化、決定優化方向,也避免對單一供應商長期採購承諾。Nvidia 芯片每代變化大,採購方必須提前很久承諾大量訂單,這構成了戰略風險。自研本質上是一種對供應鏈和產品路線圖的主動掌控。

2:30

Meta 拆掉 10 億美元數據中心

芯片代際變化太大,Meta 曾經把一棟正在建設中的數據中心直接拆除重建。當時已經投入約 10 億美元,但芯片的變化迫使數據中心架構整體重新設計。這是一個極端案例:在通用芯片路線圖上,採購方只能被動跟隨。如果自己掌握硅片設計,就能提前知道芯片規格,避免這種全盤推倒重來的浪費。這個例子把「代際不可控」變成了自研芯片的核心理由。

3:30

Google 與 Amazon 路徑差異

Google 是自研芯片最典型的案例,TPU 迭代多代,大量基礎設施運行在自己的硅片上,但仍然買很多 Nvidia。Google 與 Amazon 的差異在於:Google 的 TPU 主要用於內部工作負載,整個系統圍繞內部需求設計;Amazon 則把自研芯片做成對外可租用的實例,走的是不同商業模式。Google 還有 Gemini 這類頂級大模型,TPU 也承載這些模型。OpenAI 未來用 TPU 也已有傳聞。所以同樣是自研,盈利模式和服務對象完全不同。

7:00

自研 CPU:Arm 與控制整個棧

除了 AI 加速器,超大規模廠商也開始自研 CPU。這背後的邏輯與加速器一致:將通用 CPU 針對自身工作負載做專門化。幾乎所有的自研 CPU 都是 Arm 架構。Arm 的數據中心機會突然爆發,正是由超大規模廠商驅動。與傳統的 x86 通用芯片模式不同,這些廠商要的是從指令集到硅片的全部控制權。像 Broadcom、Marvell 這類物理設計公司承接具體實現,而 Arm 提供計算子系統(CSS),形成一條不同於 Nvidia 供應鏈的新鏈條。

10:30

Broadcom 稅 vs Nvidia 稅

自研芯片能否省錢?關鍵看誰來做。超大規模廠商並不直接與代工廠打交道,而是由 Broadcom 這類設計公司對接臺積電。Broadcom 因為手握多個客戶,能壓低價格,所以即使要付「Broadcom 稅」,也比「Nvidia 稅」便宜。這是一個反直覺的結論:在 AI 芯片上 Nvidia 的利潤率極高,自研通過設計公司反而能擠出這部分溢價。但這也意味著超大規模廠商並沒有完全去中介化,只是換了一個更便宜的中間人。

15:30

Nitro:網絡壓縮驅動的自研

Amazon 的自研始於網絡而非 AI。早期服務器每臺都要配一個網絡芯片,再連到 top-of-rack 交換機,但網絡利用率不高。Amazon 先用 FPGA 實現 Nitro,讓多個 CPU 共享一個網絡接口;後來決定把 FPGA 換成 ASIC,於是收購了芯片公司 Annapurna。這一決策的根本是規模:在大量微服務實例下,網絡活動率不足以支撐每 CPU 一個網絡芯片,壓縮網絡連接能省下鉅額成本。Nitro 後來演化成彈性 fabric 架構,並衍生出 Graviton、Trainium 等芯片。

18:30

規模:1.2M 服務器的壓縮數學

為什麼不自己造芯片?因為規模太大。舉例:如果有 120 萬臺服務器,把網絡連接按 4:1 壓縮,只需要 30 萬個網絡適配器,省下 90 萬套適配器及其交換機與基礎設施。省下的錢足以支撐自研一個 CPU 或 AI 芯片。這解釋了為什麼只有最大玩家才能做這種事——規模決定了自研的盈虧平衡點。普通公司沒有足夠部署量,無法攤薄研發成本,所以只能買通用芯片。

27:30

規模直觀化:10k 服務器服務 5M 人

人類很難想像超大規模數字。給出一個換算:服務 500 萬人需要 1 萬臺服務器;美國有約 3 億到 3.3 億人口,所以需要 60 個這種規模的倉庫,即 60 萬臺服務器;這還只是美國。全球人口約 80 多億,即使他國人均需求低,總量也極其龐大。正是這樣的數量級,讓自研芯片的一切專用優化都能在大規模部署中變成真實收益,也構成了超大規模廠商自研的經濟基礎。

原話 · 已逐字校驗

they don't want to be beholden entirely to Nvidia for something that is so, so important to their business, right?

他們不想在對自己業務如此重要的事情上完全受制於 Nvidia,對吧?

Facebook um demolished a data center they were in the process of building because the chips had changed so much gen on gen that they had to redesign the architecture of their deployment.

Facebook 拆除了一棟正在建設中的數據中心,因為芯片每一代變化太大,他們不得不重新設計部署架構。

A general chip has to be general for everyone.

通用芯片必須對所有人都是通用的。

It turns out Broadcom is cheaper as weird as it is to say.

事實證明 Broadcom 更便宜,儘管說起來很奇怪。

having your own in-house silicon design team can be really beneficial if you want to optimize every cent.

如果你想優化每一分錢,那麼擁有自己的內部芯片設計團隊會非常有益。

So, if you turn around and say, "Well, I've got 1.2 million servers deployed." Like yeah, I can't picture that number.

所以,如果你說「我有 120 萬臺服務器部署了」,我根本沒法想像那個數字。

if you can identify patterns, you can increase watch time on your platform.

如果你能識別出模式,你就能提高你平臺上的觀看時長。

數字與實體

AI 加速器市場份額(含 TPU)約 85:1511:09
Annapurna 收購時間約 2015-2016 年15:12
示例部署規模120 萬臺服務器18:13
網絡壓縮比4:118:13
美國人口對應倉庫數60 個27:17

術語

TPU張量處理單元
Google 為加速神經網絡訓練/推理設計的專用芯片。
Nitro(AWS 網絡虛擬化硬件)
AWS 自研的網絡與 I/O 卸載硬件,最初基於 FPGA,後轉 ASIC,可讓多個 CPU 共享網絡接口。
RISC-V開源指令集架構
任何公司可免費使用來設計處理器,被視為 Arm 的潛在替代。
Arm CSSArm 計算子系統
Arm 提供的預集成計算子系統,包含 CPU 核心和互連,縮短定製芯片設計週期。

收聽指南

誰該聽

關注算力供應鏈的創業者、投資人,雲廠商基礎設施工程師,以及想理解 Nvidia 競爭格局的芯片從業者。

可跳過

開頭和 14:10 起的 Arteris 廣告可跳過,其餘信息密度高。