智能體時代GPU常年堵車,CPU才是那套紅綠燈系統
智能體把AI工作方式從並行概率預測變成串行任務執行,GPU因為缺乏分支預測和亂序執行能力而頻繁空轉,CPU的邏輯調度能力因此成了數據中心新的稀缺資源。
核心論點 · 點時間戳可跳到原聲
聊天像點餐,智能體像辦一桌席
聊天AI的流程是一問一答:輸入提示詞,模型預測下一個詞,整個過程像食堂點餐——說要牛肉麵,阿姨直接盛一碗。這種單步並行的概率計算,正好是GPU用上百個計算核心和TensorCore做矩陣乘法的強項。但智能體不一樣:給它一個調研任務,它要自己拆解步驟、上網搜資料、寫代碼、查bug、改方案,複雜時還會派生子智能體分工——像讓阿姨自己列菜單、指揮後廚做一桌麻辣香鍋加燒烤。工作方式從單步並行變成了多步串行。
— 老石GPU堵車了,CPU才是紅綠燈
智能體的任務裡充滿條件判斷和異常處理,需要不斷切換邏輯、一環扣一環地串行執行,這恰恰戳中GPU的架構短板——GPU天生擅長同時做成千上萬件簡單重複的事,卻缺少處理複雜邏輯的能力,流水線一旦被打斷,海量計算單元就只能閒置等待,這被稱為「算力交通管制」。CPU核心數量雖少,但每個核心都有龐大的分支預測電路和亂序執行引擎,專門處理這種條件判斷和任務調度,甚至能提前預測下一步走向。
— 老石餵飽GPU,靠堆CPU核心密度
當成千上萬個智能體同時工作、需要無縫給GPU喂數據時,算力提供商的解法是在數據中心大幅增加CPU核心密度——相當於多僱些人備菜,讓GPU這個大廚一直有活幹。英特爾至強6 Clearwater Forest單顆芯片集成最多288個能效核,一臺兩路服務器能提供2304個核心,單機櫃算力密度可達46080個核心;雲箭科技的整機櫃(36U,每U最多裝6顆CPU)配合至強6 Plus能支持六萬多個核,理論上可同時運行24萬個輕量級Agent。
— 老石推理超過訓練後,CPU成瓶頸
2025年大模型推理帶來的算力需求已佔AI算力總需求的半壁江山,2026年這一比例還會提升到2/3。但推理階段單個請求的運算量其實不大,真正的性能瓶頸轉移到了時延敏感的雜活上——序列化反序列化、KV cache緩存管理、提示詞組裝、檢索增強生成的路由調度,這些髒活累活全部靠CPU完成。Gary把這個差異總結為:GPU解決的是「智能的程度」,CPU解決的是「智能的密度」。
— GaryAI工廠不是一臺機器,是三臺
AI基礎設施正從粗放堆硬件的算力倉庫,重構成以CPU為調度大腦的「智能工廠」:一臺是GPU服務器負責生成Token;一臺是高密度CPU集群,專門承載成千上萬甚至上百萬個跑在CPU上的智能體;還有一臺高性能存儲服務器,負責暫存GPU推理產生的KV cache——下次遇到類似問題可以直接調出已經算好的結果,不用重新計算。三臺機器的公約數,都是強大的處理器。
— Gary算力存力連接力保障力,CPU全佔
Gary把AI工廠的硬指標拆成四塊:算力——CPU要做機頭給GPU喂數據,至強6 Plus靠AMX直接做AI數據預處理和向量加速;存力——KV cache膨脹後HBM顯存裝不下,就要卸載到CPU內存或存儲系統,這個過程被比作《哈利波特》裡鄧布利多把記憶抽出來存進冥想盆;保障力——CPU的RAS特性能在內存顆粒出故障前預警、甚至修復比特錯誤;連接力——新一代E835網卡提供200G的RDMA連接,讓CPU集群訪問GPU和存儲集群時速度最快。
— GaryCPU:GPU配比正逼近1比1
把算力、存力、連接力、保障力合在一起看,結論很直接:AI越複雜、智能體越多,CPU要乾的活就越多。這也是為什麼數據中心裡CPU和GPU的比例正在從1比8,進化到1比4、1比2,甚至接近1比1——不是CPU變強到能替代GPU,而是為了維持整個數據通路不被GPU空轉卡住,需要成倍增加CPU去配合。
— 老石企業換架構,怕的不是性能是遷移
到2030年全球存量服務器裡x86佔比仍將高達80%,數量從2025年的6300萬臺漲到7600萬臺。Gary提到一個容易被忽略的事實:英特爾在PCIe 5.0這類新標準出來後,總是最先把和SSD、網卡的兼容性適配做完,系統廠商用x86做設計常常事半功倍,換其他架構則要在多個廠家之間反覆溝通。對企業來說,換底層架構不是換個芯片那麼簡單,而是要讓十幾年積累的業務系統、開源組件、私有數據庫全部重新編譯測試,這個試錯成本才是x86生態幾十年積累下來的真正護城河。
— Gary原話 · 已逐字校驗
但你有沒有想過 這智能體帶來的這波CPU的爆發 到底是真趨勢還是美需求呢
但你有沒有想過,這智能體帶來的這波CPU的爆發,到底是真趨勢還是偽需求呢?
老石0:00
就好像一個城市只有極寬的高速公路 卻沒有紅綠燈和交通指揮系統 當遇到複雜的交叉口的時候 所有的車輛都會死死的堵在路上 我們就把它叫做智能體時代出現的算力交通管制現象
就好像一個城市只有極寬的高速公路,卻沒有紅綠燈和交通指揮系統,當遇到複雜的交叉口時,所有車輛都會死死地堵在路上——我們就把它叫做智能體時代出現的「算力交通管制」現象。
老石3:03
那麼為了產生Token 在這個抽機工廠裡頭 你可以想像有三臺機器 三臺巨大的機器 一臺機器就是我們傳統的 所謂GPU的服務器
那麼為了產生Token,在這個「抽機」工廠裡頭,你可以想像有三臺機器,三臺巨大的機器:一臺機器就是我們傳統的、所謂GPU的服務器。
Gary11:08
這有點像哈利波特里 鄧比利多總會把一些記憶從腦子裡給抽出來 然後放到小瓶子裡 需要的時候再把它放到冥想盆裡去查看
這有點像《哈利波特》裡,鄧布利多總會把一些記憶從腦子裡抽出來,放到小瓶子裡,需要的時候再放到冥想盆裡去查看。
Gary14:11
企業真正購買的從來都不只是一塊冷冰冰的芯片 而是一整套能夠確保業務穩定運行的生產環境
企業真正購買的從來都不只是一塊冷冰冰的芯片,而是一整套能夠確保業務穩定運行的生產環境。
老石20:14
數字與實體
| IDC預測2031年活躍智能體數量 | 3.5億個 | 5:03 |
| IDC預測2026-2027年中國活躍智能體數量增速 | 200% | 5:03 |
| 至強6 Clearwater Forest單芯片能效核數 | 288個 | 6:03 |
| 英特爾方案單機櫃CPU算力密度 | 46,080個核心 | 6:03 |
| 雲箭科技機櫃CPU核心數 | 6萬多個核 | 7:05 |
| 雲箭科技機櫃可運行輕量Agent數量 | 24萬個 | 7:05 |
| 2026年大模型推理算力需求佔比 | 2/3 | 8:05 |
| 數據中心CPU:GPU配比演變 | 從1:8到1:4、1:2,甚至接近1:1 | 18:12 |
術語
- KV CacheKV緩存
- 大模型推理時緩存的中間計算結果,相當於模型的短期工作記憶或小抄。
- RAS可靠可用可維護性
- 英特爾CPU的可靠性特性,即高可靠、高可用、高可維護。
- AMX高級矩陣擴展
- 英特爾CPU內置的指令集,用於加速AI相關的矩陣運算。
- PD分離預填充-解碼分離
- 大模型推理中把輸入處理和生成輸出兩個階段拆開部署的架構方式。
- RDMA遠程直接內存訪問
- 服務器間繞過CPU直接讀寫內存的高速數據傳輸技術。
收聽指南
關注AI基礎設施、半導體投資或數據中心架構的人,想理解智能體熱潮如何反向帶動CPU需求的從業者。
4:03-6:03、9:05-10:07附近有大段轉寫亂碼(重複詞句堆疊),13:11附近一段中英混雜亂碼,可直接跳過不影響理解。