世界太吵,来原声听播客

科技早知道

国产超节点总算力反超英伟达,但功耗翻五倍换不来生态

华为 CloudMatrix 384 以约 560 千瓦功耗换来 1.7 倍于 NVL72 的总算力,但决定国产超节点命运的不是参数,而是产能和软件生态。

算力超节点国产芯片AI 基础设施英伟达
这集把超节点的技术、商业、产能三层拆开讲,能帮你判断国产算力供应链上真正卡脖子的环节在哪里。

核心论点 · 点时间戳可跳到原声

5:28

超节点成展会标配

今年 WAIC 上展示超节点产品超过 10 个,华为、阿里、百度,以及壁仞、摩尔线程、沐曦、燧原等芯片厂商,甚至中兴、曙光等服务器厂商,都把超节点放在展台最显眼的位置。券商把 2026 年叫作国产超节点元年。这种同质化竞争背后是强烈的 FOMO:没有超节点,就像不好意思来参展。超节点从 8 卡机演变成几十到上百卡的机柜形态,核心是为了解决模型训练和推理中的通信墙问题。

— 雅贤
11:51

单芯片追不上,系统层面补

国产 AI 芯片与海外在单芯片技术上差距明显,短时间难以弥补,必须从系统层面提升性能。Kimi 的 K3 模型总参数量 2.8T,896 个专家,每个 token 选择 16 个专家,官方建议使用 64 颗以上加速器组成的超节点,以解决容量、带宽和延迟问题。同时,互联技术已经能让超节点产品化,厂商也愿意卖整个机柜而非单卡,因为价值量完全不同。这些因素叠加,让超节点成为国产算力追赶的必选路径。

— 张海军
15:56

割裂的 Scale-up 生态

全球超节点的 scale-up 协议几乎都是私有的:英伟达有 NVLink,华为有 UB,阿里和国产芯片公司各有自己的一套。海外 UALink 由 AMD、Marvell、博通等发起,但 AMD 是主要推动者,Marvell 做交换芯片却动力不足,博通则退出自己搞协议,导致开放协议松散。华为 UB 能把 scale-up 和 scale-out 统一,而英伟达的 NVLink 只做机柜内互联,机柜间用 IB。协议割裂意味着生态绑定,国产替代不只是硬件问题。

— 张海军
21:35

标杆对比:NV72 与华为 384

NVIDIA NVL72 由 18 个 compute tray 和 9 个 NVSwitch tray 组成,共 72 个 B200,整机功耗超过 120 千瓦,且 GB200 前期出货以风冷为主,并非全液冷。华为 CloudMatrix 384 是国内首个超节点,16 个机柜共 384 个 910C。单芯片 BF16 算力只有 B200 的 30%,但系统总算力是 NVL72 的 1.7 倍。代价是整机功耗约 560 千瓦,接近 NV 的 5 倍。这是用堆料换总算力,也解释了为什么中国必须走系统级创新。

— 张海军
27:33

整机厂商不甘只做组装

中兴、华三这类传统服务器 OEM 这次也推出了超节点方案。中兴利用网络领域技术自研交换芯片,协议名为 Olink,官方称能兼容国内多家芯片,但未公布细节。曦智科技则押注光互连,定位是提供光通信和光交换组件。目前国内真正量产使用的超节点只有华为和曙光两家,华为客户分散在运营商和云厂商,曙光与海光绑定主攻信创。其他厂商的「零适配」宣称距离大规模商用还有很长的路。

— 雅贤
32:54

国产超节点能超英伟达吗

张海军认为,国产超节点在系统参数上已经超过英伟达:CM384 总算力是 NVL72 的 1.7 倍。但他定义的「超过」是:如果 NV 放开市场,云厂商在同等条件下宁愿选国产超节点,那才算赢。目前很难,因为 CUDA 生态太深,国内工程师习惯用 CUDA,DeepSeek 甚至能发现英伟达芯片的 bug,切换到国产软硬件要重学;NV 稳定性也更好。但英伟达下一代产品 delay 给了国产机会,加上软件生态一年来明显改善,差距在缩小。从 0 到 1 国产弱,从 1 到 100 国产更强。

— 张海军
37:02

产能才是真瓶颈

芯片厂商多不代表产能大,真正的卡点是 AI 芯片产能。B300 8 卡机价格从去年 Q3 的 370-380 万涨到今年 1200-1300 万,说明海外货进不来且稀缺。互联网大厂今年比去年采购更多国产芯片,一个重要原因就是国产产能相对可靠。由于各家软件生态不互通,大厂不可能同时适配所有芯片,因此如果到明年还没拿到大厂订单,二线厂商后面就很难了。行业格局可能像自动驾驶一样洗牌,最后只剩五六家。华为和寒武纪地位稳定,大厂自研如平头哥、燧原也有机会。

— 张海军
43:19

超节点带动供电、液冷、交换芯片

超节点功率大增,英伟达从去年开始推 800V 高压直流供电;液冷从可选变成标配,GB200 后来改用液冷,GB300 全液冷,谷歌的数据显示 2027 年液冷需求价值量是此前的 4 倍。网络侧,国内之前以博通交换芯片为主,如今国产交换芯片已能媲美博通。scale-out 主流仍是博通,scale-up 各家私有协议割裂。这些配套技术的升级,很可能比超节点本身更早释放商业机会。

— 张海军

原话 · 已逐字校验

从巴卡机到超节点,它的一个主要变化,其实是为了解决通信墙的问题。

从 8 卡机到超节点,它的一个主要变化,其实是为了解决通信墙的问题。

张海军6:35

单片算力是可能只有它的多少30分之1。但是合在一起会做成超点点以后,其实总算力是它大概两倍。

单片算力可能只有它的 30%,但合在一起做成超节点以后,总算力大概是它的两倍。

张海军23:21

我们超NV是有可能的。因为我们的特点是说,我们可能从0到1可能会比美国那边要弱一些。但是我们从1到100,我觉得肯定是要强于美国那边的。

我们超越 NVIDIA 是有可能的。因为我们的特点是,从 0 到 1 可能比美国弱一些,但从 1 到 100,我觉得肯定强于美国。

张海军32:54

现在产能会是一个瓶颈,就是说谁油产能,可能谁的优势就会更大一些。

现在产能会是一个瓶颈,谁有产能,谁的优势可能就更大。

张海军37:02

你还没有从这几家大的互联网厂商拿到一个大的订单的话,那我觉得后面可能就比较难了。

如果还没有从几家大互联网厂商拿到一个大订单,那我觉得后面可能就比较难了。

张海军41:06

数字与实体

超节点产品数量(WAIC 2025)超过 10 个4:26
K3 总参数量2.8T11:51
K3 专家数896 个11:51
NVL72 机架功耗超过 120 千瓦22:10
910CA BF16 算力对比 B200约 30%23:21
CM384 总算力对比 NVL721.7 倍23:21
B300 8 卡机价格(去年 Q3)370-380 万元38:02
谷歌 2027 年液冷需求价值量此前的 4 倍44:23

术语

Scale-up纵向扩展
把多张芯片组合成一台巨型 GPU,提升单任务算力。
Scale-out横向扩展
通过增加机柜或节点数量来扩展集群规模。
UALinkUltra Accelerator Link
AMD、博通等发起的加速器互连开放协议,目前参与者松散。
CloudMatrix华为超节点系列
华为推出的多机柜互连超节点,如 384 芯片方案。

收听指南

谁该听

关注国产 AI 算力替代的云厂商采购、芯片创业公司和算力板块投资人,需要判断技术路线和订单拐点。

可跳过

开场逛展吐槽(0:00-4:30)可跳,从 5:28 超节点厂商梳理开始听。