世界太吵,來原聲聽播客

20VC

反數據中心幾乎全是中國的心理戰

美國左右兩派同時反對建數據中心,Thomas Sohmers 認為這幾乎全是中國的心理戰——中國自己在大建特建,卻讓西方在監管裡自我拖慢。

AI 基礎設施推理經濟學數據中心地緣政治KV cache

原視頻在 YouTube 上放不出來,用音頻聽:

前半段是反數據中心、能源與債務的宏觀判斷,後半段是 KV cache、量化與上下文長度的硬核機制,信息密度高但需要一點耐心。

核心論點 · 點時間戳可跳到原聲

5:06

訓練是算力受限,推理是內存受限

Thomas 把訓練和推理的根本差異講得很清楚:訓練時你已經有全部語料,可以把 token 輸入大規模並行,本質是算力受限問題,所以出口管制框架也主要盯 FLOPS。但推理是生成式的,你不知道五個詞之後的 token 是什麼,必須一個一個按順序生成,每生成一個 token 都要把權重讀一遍,於是變成極度內存受限的問題,沒法像訓練那樣並行。這個差異決定了推理硬件的設計邏輯和訓練芯片完全不同。

— Thomas Sohmers
7:08

算力漲了 120 倍,內存帶寬只漲了 17 倍

2014 到 2024 這十年,單塊 NVIDIA GPU 的 FLOPS 提升了約 120 倍,但內存帶寬只提升了 17 倍。Thomas 說這就是 memory wall 的真正體現:算力和內存帶寬的比率出現了巨大分化,越到後面,內存受限的問題越嚴重。原因之一是 SRAM 單元在過去十五年的微縮速度遠慢於普通晶體管,架構上三四十年沒怎麼變。另一個原因是動機問題——2010 年代的 CNN 時代模型本質是算力受限,扔更多 FLOPS 就行,沒人有動力去解決內存帶寬。

— Thomas Sohmers
11:16

賣緩存 token 的利潤率是「離譜」的

Thomas 說,處理一個緩存 token 的成本大約是重新計算生成那個 token 的千分之一,所以賣緩存 token 的利潤率高得離譜。幾乎所有提供商都按比普通輸入 token 更高的費率收緩存費,讀的時候再收一個更低的費率,用戶覺得便宜,但提供商在緩存讀取上賺的是「obscene margin」。他提到 Anthropic 的 API 業務被報道有 80 個點的毛利率,他並不驚訝——在任何行業拿到 80 個點都很難。他認為這些利潤率會隨著競爭壓縮,而且如果 OpenAI、Anthropic 停止訓練,它們一夜之間就會大幅盈利。

— Thomas Sohmers
21:45

反數據中心幾乎全是中國的心理戰

Thomas 說,現在左右兩派幾乎在反數據中心這件事上達成共識,這是他眼中政治上最可怕的事,他認為這幾乎完全是中國的心理戰。他反駁了水電消耗的說法:一個 in-and-out 漢堡用的水比美國最大的數據中心還多,高爾夫球場更是高出幾個數量級,而且這些數據中心是閉環液冷系統,很多情況下根本不想用水。他的論點是:中國自己在大建特建、增加數吉瓦的發電容量、為了訓練容量推平民居和拉閘限電,而西方卻在基於虛假信息自我拖慢。

— Thomas Sohmers
25:54

數據中心不會搶走居民的電

Thomas 說,電力公司必須提供一種能源可用性的報價,這個報價已經烘焙進所有人的成本和能力裡,所以數據中心不可能從已經分配給居民的電裡抽電,這是不可能的。而且現在在建的數據中心都自帶覆蓋自身使用甚至更多的發電容量,只是不被允許接入電網——如果接進去,反而會降低所有人的電價。他還指出,電力公司那邊在遊說反對新增發電容量,因為市場力量會讓更多容量壓低價格,這對消費者是好事,但對電力公司不是。

— Thomas Sohmers
35:21

KV cache 把二次方成本變成線性存儲

Thomas 解釋了 KV cache 的機制:Transformer 最初對每個生成的 token 都要重算之前所有 token 的計算,後來發現不需要重做已經處理過的部分,於是把 K 和 V 兩個矩陣存下來。關鍵在於,attention 機制下每個 token 的計算量隨序列長度二次方增長,而存儲 K 和 V 只是線性增長。所以 KV cache 是用存儲換掉了快速變貴的計算。但存儲本身也是複雜度:每個用戶都有獨特的 KV cache,要決定保留多久、怎麼在大系統裡管理。

— Thomas Sohmers
38:31

96% 的 agentic coding token 都是緩存命中

Thomas 提到 SemiAnalysis 的 agent X benchmark,基於大量 cloud code 會話,有幾十到幾百輪,還有子 agent。他們發現,在這些真實追蹤的代碼生成、agentic coding 會話中,大約 96% 的 token 都是緩存命中。這意味著如果知道工作負載有極高的緩存率,緩存檢索的重要性會急劇上升,因為這些緩存會變得非常大。他舉例:GPT-4 被洩露為 1.8 萬億參數模型,量化後約 900 GB 模型權重;如果 Claude 是 10 萬億參數,約 5 TB 權重。但在長上下文下,單個用戶會話可能達到 100 GB 量級,50 個用戶的上下文就超過模型權重本身。

— Thomas Sohmers
57:17

中國實驗室用算法繞開了內存出口管制

Thomas 說,上下文長度從今天的百萬 token 往 10 倍甚至更多走,在二次方內存成本下非常難。過去一年算法上的進展很有意思,能進一步降低上下文所需的存儲和計算,而中國模型實驗室在這方面創新很多。他舉了 DeepSeek V3 的例子:因為出口管制限制了最高內存容量和 FLOPS 的芯片,他們創新出不需要那些芯片的方法,用 multi-head latent attention 大幅減小 KV cache 尺寸,代價是花更多 FLOPS。他說美國主要實驗室據他所知都沒用 MLA,但這種情況未來會變。

— Thomas Sohmers

原話 · 已逐字校驗

You make all of your money on selling cashed input and output tokens.

你所有的錢都是靠賣緩存過的輸入和輸出 token 賺的。

Thomas Sohmers11:16

Like if they stop training, they'd be massively profitable overnight.

如果他們停止訓練,一夜之間就會大幅盈利。

Thomas Sohmers12:17

The scariest thing to me on the political spectrum and the way all of this being treated is that it's now become a almost unifying issue on left and right about being anti-data centers. I think that is almost entirely a Chinese psyop.

政治上最讓我害怕的是,現在左右兩派幾乎在反數據中心這件事上達成共識。我認為這幾乎完全是中國的心理戰。

Thomas Sohmers21:45

Like, you know, a single in and out uses, you know, more more water than, you know, the largest data centers in the United States.

一個 in-and-out 漢堡用的水比美國最大的數據中心還多。

Thomas Sohmers22:49

about 96% of all the tokens that go through these entire sessions are cached.

整個會話中大約 96% 的 token 都是緩存命中。

Thomas Sohmers39:37

the value per unit of intelligence is probably closer to 1,000 fold, not just the 60 fold you're talking about.

單位智能的價值可能接近 1000 倍,而不只是你說的 60 倍。

Thomas Sohmers1:02:26

數字與實體

Positron Series C 融資額8.75 億美元0:00
Positron 估值50 億美元0:00
2014-2024 單塊 NVIDIA GPU FLOPS 提升約 120 倍7:08
2014-2024 內存帶寬提升17 倍7:08
Anthropic API 業務毛利率80 個點11:16
agentic coding 會話緩存命中率約 96%38:31
GPT-4 洩露參數量1.8 萬億38:31
GPT-6 Astra 在 Ruler 長上下文基準上的準確率超過 95%59:19
GPT 5.6 在 Ruler 長上下文基準上的準確率約 70%59:19

術語

KV cache鍵值緩存
存儲 attention 中 K 和 V 矩陣,避免重複計算已處理 token。
memory wall內存牆
算力提升遠快於內存帶寬,導致內存受限問題加劇。
MLA多頭潛在注意力
DeepSeek 提出的壓縮 KV cache 的注意力機制,用更多 FLOPS 換更小緩存。
quantization量化
降低數值精度(如 FP16 到 FP4)以壓縮模型和緩存,可能損失精度。
RulerRuler 基準
測試模型在長上下文中找回隨機插入信息的能力。

收聽指南

誰該聽

關注 AI 基礎設施、推理經濟學和地緣政治的創業者和投資人,尤其是做芯片、雲服務或 agent 產品的團隊。

可跳過

開頭 4 分鐘的主持人介紹和廣告可跳過。