世界太吵,來原聲聽播客

老石談芯

智能體時代GPU常年堵車,CPU才是那套紅綠燈系統

智能體把AI工作方式從並行概率預測變成串行任務執行,GPU因為缺乏分支預測和亂序執行能力而頻繁空轉,CPU的邏輯調度能力因此成了數據中心新的稀缺資源。

CPU智能體AI基礎設施英特爾x86生態推理算力
三層邏輯環環相扣:智能體的串行需求、AI工廠供給側重構、x86生態護城河,信息密度高,但中段有兩段轉寫亂碼需要跳過。

核心論點 · 點時間戳可跳到原聲

1:01

聊天像點餐,智能體像辦一桌席

聊天AI的流程是一問一答:輸入提示詞,模型預測下一個詞,整個過程像食堂點餐——說要牛肉麵,阿姨直接盛一碗。這種單步並行的概率計算,正好是GPU用上百個計算核心和TensorCore做矩陣乘法的強項。但智能體不一樣:給它一個調研任務,它要自己拆解步驟、上網搜資料、寫代碼、查bug、改方案,複雜時還會派生子智能體分工——像讓阿姨自己列菜單、指揮後廚做一桌麻辣香鍋加燒烤。工作方式從單步並行變成了多步串行。

— 老石
3:03

GPU堵車了,CPU才是紅綠燈

智能體的任務裡充滿條件判斷和異常處理,需要不斷切換邏輯、一環扣一環地串行執行,這恰恰戳中GPU的架構短板——GPU天生擅長同時做成千上萬件簡單重複的事,卻缺少處理複雜邏輯的能力,流水線一旦被打斷,海量計算單元就只能閒置等待,這被稱為「算力交通管制」。CPU核心數量雖少,但每個核心都有龐大的分支預測電路和亂序執行引擎,專門處理這種條件判斷和任務調度,甚至能提前預測下一步走向。

— 老石
6:03

餵飽GPU,靠堆CPU核心密度

當成千上萬個智能體同時工作、需要無縫給GPU喂數據時,算力提供商的解法是在數據中心大幅增加CPU核心密度——相當於多僱些人備菜,讓GPU這個大廚一直有活幹。英特爾至強6 Clearwater Forest單顆芯片集成最多288個能效核,一臺兩路服務器能提供2304個核心,單機櫃算力密度可達46080個核心;雲箭科技的整機櫃(36U,每U最多裝6顆CPU)配合至強6 Plus能支持六萬多個核,理論上可同時運行24萬個輕量級Agent。

— 老石
8:05

推理超過訓練後,CPU成瓶頸

2025年大模型推理帶來的算力需求已佔AI算力總需求的半壁江山,2026年這一比例還會提升到2/3。但推理階段單個請求的運算量其實不大,真正的性能瓶頸轉移到了時延敏感的雜活上——序列化反序列化、KV cache緩存管理、提示詞組裝、檢索增強生成的路由調度,這些髒活累活全部靠CPU完成。Gary把這個差異總結為:GPU解決的是「智能的程度」,CPU解決的是「智能的密度」。

— Gary
11:08

AI工廠不是一臺機器,是三臺

AI基礎設施正從粗放堆硬件的算力倉庫,重構成以CPU為調度大腦的「智能工廠」:一臺是GPU服務器負責生成Token;一臺是高密度CPU集群,專門承載成千上萬甚至上百萬個跑在CPU上的智能體;還有一臺高性能存儲服務器,負責暫存GPU推理產生的KV cache——下次遇到類似問題可以直接調出已經算好的結果,不用重新計算。三臺機器的公約數,都是強大的處理器。

— Gary
12:09

算力存力連接力保障力,CPU全佔

Gary把AI工廠的硬指標拆成四塊:算力——CPU要做機頭給GPU喂數據,至強6 Plus靠AMX直接做AI數據預處理和向量加速;存力——KV cache膨脹後HBM顯存裝不下,就要卸載到CPU內存或存儲系統,這個過程被比作《哈利波特》裡鄧布利多把記憶抽出來存進冥想盆;保障力——CPU的RAS特性能在內存顆粒出故障前預警、甚至修復比特錯誤;連接力——新一代E835網卡提供200G的RDMA連接,讓CPU集群訪問GPU和存儲集群時速度最快。

— Gary
18:12

CPU:GPU配比正逼近1比1

把算力、存力、連接力、保障力合在一起看,結論很直接:AI越複雜、智能體越多,CPU要乾的活就越多。這也是為什麼數據中心裡CPU和GPU的比例正在從1比8,進化到1比4、1比2,甚至接近1比1——不是CPU變強到能替代GPU,而是為了維持整個數據通路不被GPU空轉卡住,需要成倍增加CPU去配合。

— 老石
19:12

企業換架構,怕的不是性能是遷移

到2030年全球存量服務器裡x86佔比仍將高達80%,數量從2025年的6300萬臺漲到7600萬臺。Gary提到一個容易被忽略的事實:英特爾在PCIe 5.0這類新標準出來後,總是最先把和SSD、網卡的兼容性適配做完,系統廠商用x86做設計常常事半功倍,換其他架構則要在多個廠家之間反覆溝通。對企業來說,換底層架構不是換個芯片那麼簡單,而是要讓十幾年積累的業務系統、開源組件、私有數據庫全部重新編譯測試,這個試錯成本才是x86生態幾十年積累下來的真正護城河。

— Gary

原話 · 已逐字校驗

但你有沒有想過 這智能體帶來的這波CPU的爆發 到底是真趨勢還是美需求呢

但你有沒有想過,這智能體帶來的這波CPU的爆發,到底是真趨勢還是偽需求呢?

老石0:00

就好像一個城市只有極寬的高速公路 卻沒有紅綠燈和交通指揮系統 當遇到複雜的交叉口的時候 所有的車輛都會死死的堵在路上 我們就把它叫做智能體時代出現的算力交通管制現象

就好像一個城市只有極寬的高速公路,卻沒有紅綠燈和交通指揮系統,當遇到複雜的交叉口時,所有車輛都會死死地堵在路上——我們就把它叫做智能體時代出現的「算力交通管制」現象。

老石3:03

那麼為了產生Token 在這個抽機工廠裡頭 你可以想像有三臺機器 三臺巨大的機器 一臺機器就是我們傳統的 所謂GPU的服務器

那麼為了產生Token,在這個「抽機」工廠裡頭,你可以想像有三臺機器,三臺巨大的機器:一臺機器就是我們傳統的、所謂GPU的服務器。

Gary11:08

這有點像哈利波特里 鄧比利多總會把一些記憶從腦子裡給抽出來 然後放到小瓶子裡 需要的時候再把它放到冥想盆裡去查看

這有點像《哈利波特》裡,鄧布利多總會把一些記憶從腦子裡抽出來,放到小瓶子裡,需要的時候再放到冥想盆裡去查看。

Gary14:11

企業真正購買的從來都不只是一塊冷冰冰的芯片 而是一整套能夠確保業務穩定運行的生產環境

企業真正購買的從來都不只是一塊冷冰冰的芯片,而是一整套能夠確保業務穩定運行的生產環境。

老石20:14

數字與實體

IDC預測2031年活躍智能體數量3.5億個5:03
IDC預測2026-2027年中國活躍智能體數量增速200%5:03
至強6 Clearwater Forest單芯片能效核數288個6:03
英特爾方案單機櫃CPU算力密度46,080個核心6:03
雲箭科技機櫃CPU核心數6萬多個核7:05
雲箭科技機櫃可運行輕量Agent數量24萬個7:05
2026年大模型推理算力需求佔比2/38:05
數據中心CPU:GPU配比演變從1:8到1:4、1:2,甚至接近1:118:12

術語

KV CacheKV緩存
大模型推理時緩存的中間計算結果,相當於模型的短期工作記憶或小抄。
RAS可靠可用可維護性
英特爾CPU的可靠性特性,即高可靠、高可用、高可維護。
AMX高級矩陣擴展
英特爾CPU內置的指令集,用於加速AI相關的矩陣運算。
PD分離預填充-解碼分離
大模型推理中把輸入處理和生成輸出兩個階段拆開部署的架構方式。
RDMA遠程直接內存訪問
服務器間繞過CPU直接讀寫內存的高速數據傳輸技術。

收聽指南

誰該聽

關注AI基礎設施、半導體投資或數據中心架構的人,想理解智能體熱潮如何反向帶動CPU需求的從業者。

可跳過

4:03-6:03、9:05-10:07附近有大段轉寫亂碼(重複詞句堆疊),13:11附近一段中英混雜亂碼,可直接跳過不影響理解。