智能体时代GPU常年堵车,CPU才是那套红绿灯系统
智能体把AI工作方式从并行概率预测变成串行任务执行,GPU因为缺乏分支预测和乱序执行能力而频繁空转,CPU的逻辑调度能力因此成了数据中心新的稀缺资源。
核心论点 · 点时间戳可跳到原声
聊天像点餐,智能体像办一桌席
聊天AI的流程是一问一答:输入提示词,模型预测下一个词,整个过程像食堂点餐——说要牛肉面,阿姨直接盛一碗。这种单步并行的概率计算,正好是GPU用上百个计算核心和TensorCore做矩阵乘法的强项。但智能体不一样:给它一个调研任务,它要自己拆解步骤、上网搜资料、写代码、查bug、改方案,复杂时还会派生子智能体分工——像让阿姨自己列菜单、指挥后厨做一桌麻辣香锅加烧烤。工作方式从单步并行变成了多步串行。
— 老石GPU堵车了,CPU才是红绿灯
智能体的任务里充满条件判断和异常处理,需要不断切换逻辑、一环扣一环地串行执行,这恰恰戳中GPU的架构短板——GPU天生擅长同时做成千上万件简单重复的事,却缺少处理复杂逻辑的能力,流水线一旦被打断,海量计算单元就只能闲置等待,这被称为「算力交通管制」。CPU核心数量虽少,但每个核心都有庞大的分支预测电路和乱序执行引擎,专门处理这种条件判断和任务调度,甚至能提前预测下一步走向。
— 老石喂饱GPU,靠堆CPU核心密度
当成千上万个智能体同时工作、需要无缝给GPU喂数据时,算力提供商的解法是在数据中心大幅增加CPU核心密度——相当于多雇些人备菜,让GPU这个大厨一直有活干。英特尔至强6 Clearwater Forest单颗芯片集成最多288个能效核,一台两路服务器能提供2304个核心,单机柜算力密度可达46080个核心;云箭科技的整机柜(36U,每U最多装6颗CPU)配合至强6 Plus能支持六万多个核,理论上可同时运行24万个轻量级Agent。
— 老石推理超过训练后,CPU成瓶颈
2025年大模型推理带来的算力需求已占AI算力总需求的半壁江山,2026年这一比例还会提升到2/3。但推理阶段单个请求的运算量其实不大,真正的性能瓶颈转移到了时延敏感的杂活上——序列化反序列化、KV cache缓存管理、提示词组装、检索增强生成的路由调度,这些脏活累活全部靠CPU完成。Gary把这个差异总结为:GPU解决的是「智能的程度」,CPU解决的是「智能的密度」。
— GaryAI工厂不是一台机器,是三台
AI基础设施正从粗放堆硬件的算力仓库,重构成以CPU为调度大脑的「智能工厂」:一台是GPU服务器负责生成Token;一台是高密度CPU集群,专门承载成千上万甚至上百万个跑在CPU上的智能体;还有一台高性能存储服务器,负责暂存GPU推理产生的KV cache——下次遇到类似问题可以直接调出已经算好的结果,不用重新计算。三台机器的公约数,都是强大的处理器。
— Gary算力存力连接力保障力,CPU全占
Gary把AI工厂的硬指标拆成四块:算力——CPU要做机头给GPU喂数据,至强6 Plus靠AMX直接做AI数据预处理和向量加速;存力——KV cache膨胀后HBM显存装不下,就要卸载到CPU内存或存储系统,这个过程被比作《哈利波特》里邓布利多把记忆抽出来存进冥想盆;保障力——CPU的RAS特性能在内存颗粒出故障前预警、甚至修复比特错误;连接力——新一代E835网卡提供200G的RDMA连接,让CPU集群访问GPU和存储集群时速度最快。
— GaryCPU:GPU配比正逼近1比1
把算力、存力、连接力、保障力合在一起看,结论很直接:AI越复杂、智能体越多,CPU要干的活就越多。这也是为什么数据中心里CPU和GPU的比例正在从1比8,进化到1比4、1比2,甚至接近1比1——不是CPU变强到能替代GPU,而是为了维持整个数据通路不被GPU空转卡住,需要成倍增加CPU去配合。
— 老石企业换架构,怕的不是性能是迁移
到2030年全球存量服务器里x86占比仍将高达80%,数量从2025年的6300万台涨到7600万台。Gary提到一个容易被忽略的事实:英特尔在PCIe 5.0这类新标准出来后,总是最先把和SSD、网卡的兼容性适配做完,系统厂商用x86做设计常常事半功倍,换其他架构则要在多个厂家之间反复沟通。对企业来说,换底层架构不是换个芯片那么简单,而是要让十几年积累的业务系统、开源组件、私有数据库全部重新编译测试,这个试错成本才是x86生态几十年积累下来的真正护城河。
— Gary原话 · 已逐字校验
但你有没有想过 这智能体带来的这波CPU的爆发 到底是真趋势还是美需求呢
但你有没有想过,这智能体带来的这波CPU的爆发,到底是真趋势还是伪需求呢?
老石0:00
就好像一个城市只有极宽的高速公路 却没有红绿灯和交通指挥系统 当遇到复杂的交叉口的时候 所有的车辆都会死死的堵在路上 我们就把它叫做智能体时代出现的算力交通管制现象
就好像一个城市只有极宽的高速公路,却没有红绿灯和交通指挥系统,当遇到复杂的交叉口时,所有车辆都会死死地堵在路上——我们就把它叫做智能体时代出现的「算力交通管制」现象。
老石3:03
那么为了产生Token 在这个抽机工厂里头 你可以想象有三台机器 三台巨大的机器 一台机器就是我们传统的 所谓GPU的服务器
那么为了产生Token,在这个「抽机」工厂里头,你可以想象有三台机器,三台巨大的机器:一台机器就是我们传统的、所谓GPU的服务器。
Gary11:08
这有点像哈利波特里 邓比利多总会把一些记忆从脑子里给抽出来 然后放到小瓶子里 需要的时候再把它放到冥想盆里去查看
这有点像《哈利波特》里,邓布利多总会把一些记忆从脑子里抽出来,放到小瓶子里,需要的时候再放到冥想盆里去查看。
Gary14:11
企业真正购买的从来都不只是一块冷冰冰的芯片 而是一整套能够确保业务稳定运行的生产环境
企业真正购买的从来都不只是一块冷冰冰的芯片,而是一整套能够确保业务稳定运行的生产环境。
老石20:14
数字与实体
| IDC预测2031年活跃智能体数量 | 3.5亿个 | 5:03 |
| IDC预测2026-2027年中国活跃智能体数量增速 | 200% | 5:03 |
| 至强6 Clearwater Forest单芯片能效核数 | 288个 | 6:03 |
| 英特尔方案单机柜CPU算力密度 | 46,080个核心 | 6:03 |
| 云箭科技机柜CPU核心数 | 6万多个核 | 7:05 |
| 云箭科技机柜可运行轻量Agent数量 | 24万个 | 7:05 |
| 2026年大模型推理算力需求占比 | 2/3 | 8:05 |
| 数据中心CPU:GPU配比演变 | 从1:8到1:4、1:2,甚至接近1:1 | 18:12 |
术语
- KV CacheKV缓存
- 大模型推理时缓存的中间计算结果,相当于模型的短期工作记忆或小抄。
- RAS可靠可用可维护性
- 英特尔CPU的可靠性特性,即高可靠、高可用、高可维护。
- AMX高级矩阵扩展
- 英特尔CPU内置的指令集,用于加速AI相关的矩阵运算。
- PD分离预填充-解码分离
- 大模型推理中把输入处理和生成输出两个阶段拆开部署的架构方式。
- RDMA远程直接内存访问
- 服务器间绕过CPU直接读写内存的高速数据传输技术。
收听指南
关注AI基础设施、半导体投资或数据中心架构的人,想理解智能体热潮如何反向带动CPU需求的从业者。
4:03-6:03、9:05-10:07附近有大段转写乱码(重复词句堆叠),13:11附近一段中英混杂乱码,可直接跳过不影响理解。