国产超节点总算力反超英伟达,但功耗翻五倍换不来生态
华为 CloudMatrix 384 以约 560 千瓦功耗换来 1.7 倍于 NVL72 的总算力,但决定国产超节点命运的不是参数,而是产能和软件生态。
核心论点 · 点时间戳可跳到原声
超节点成展会标配
今年 WAIC 上展示超节点产品超过 10 个,华为、阿里、百度,以及壁仞、摩尔线程、沐曦、燧原等芯片厂商,甚至中兴、曙光等服务器厂商,都把超节点放在展台最显眼的位置。券商把 2026 年叫作国产超节点元年。这种同质化竞争背后是强烈的 FOMO:没有超节点,就像不好意思来参展。超节点从 8 卡机演变成几十到上百卡的机柜形态,核心是为了解决模型训练和推理中的通信墙问题。
— 雅贤单芯片追不上,系统层面补
国产 AI 芯片与海外在单芯片技术上差距明显,短时间难以弥补,必须从系统层面提升性能。Kimi 的 K3 模型总参数量 2.8T,896 个专家,每个 token 选择 16 个专家,官方建议使用 64 颗以上加速器组成的超节点,以解决容量、带宽和延迟问题。同时,互联技术已经能让超节点产品化,厂商也愿意卖整个机柜而非单卡,因为价值量完全不同。这些因素叠加,让超节点成为国产算力追赶的必选路径。
— 张海军割裂的 Scale-up 生态
全球超节点的 scale-up 协议几乎都是私有的:英伟达有 NVLink,华为有 UB,阿里和国产芯片公司各有自己的一套。海外 UALink 由 AMD、Marvell、博通等发起,但 AMD 是主要推动者,Marvell 做交换芯片却动力不足,博通则退出自己搞协议,导致开放协议松散。华为 UB 能把 scale-up 和 scale-out 统一,而英伟达的 NVLink 只做机柜内互联,机柜间用 IB。协议割裂意味着生态绑定,国产替代不只是硬件问题。
— 张海军标杆对比:NV72 与华为 384
NVIDIA NVL72 由 18 个 compute tray 和 9 个 NVSwitch tray 组成,共 72 个 B200,整机功耗超过 120 千瓦,且 GB200 前期出货以风冷为主,并非全液冷。华为 CloudMatrix 384 是国内首个超节点,16 个机柜共 384 个 910C。单芯片 BF16 算力只有 B200 的 30%,但系统总算力是 NVL72 的 1.7 倍。代价是整机功耗约 560 千瓦,接近 NV 的 5 倍。这是用堆料换总算力,也解释了为什么中国必须走系统级创新。
— 张海军整机厂商不甘只做组装
中兴、华三这类传统服务器 OEM 这次也推出了超节点方案。中兴利用网络领域技术自研交换芯片,协议名为 Olink,官方称能兼容国内多家芯片,但未公布细节。曦智科技则押注光互连,定位是提供光通信和光交换组件。目前国内真正量产使用的超节点只有华为和曙光两家,华为客户分散在运营商和云厂商,曙光与海光绑定主攻信创。其他厂商的「零适配」宣称距离大规模商用还有很长的路。
— 雅贤国产超节点能超英伟达吗
张海军认为,国产超节点在系统参数上已经超过英伟达:CM384 总算力是 NVL72 的 1.7 倍。但他定义的「超过」是:如果 NV 放开市场,云厂商在同等条件下宁愿选国产超节点,那才算赢。目前很难,因为 CUDA 生态太深,国内工程师习惯用 CUDA,DeepSeek 甚至能发现英伟达芯片的 bug,切换到国产软硬件要重学;NV 稳定性也更好。但英伟达下一代产品 delay 给了国产机会,加上软件生态一年来明显改善,差距在缩小。从 0 到 1 国产弱,从 1 到 100 国产更强。
— 张海军产能才是真瓶颈
芯片厂商多不代表产能大,真正的卡点是 AI 芯片产能。B300 8 卡机价格从去年 Q3 的 370-380 万涨到今年 1200-1300 万,说明海外货进不来且稀缺。互联网大厂今年比去年采购更多国产芯片,一个重要原因就是国产产能相对可靠。由于各家软件生态不互通,大厂不可能同时适配所有芯片,因此如果到明年还没拿到大厂订单,二线厂商后面就很难了。行业格局可能像自动驾驶一样洗牌,最后只剩五六家。华为和寒武纪地位稳定,大厂自研如平头哥、燧原也有机会。
— 张海军超节点带动供电、液冷、交换芯片
超节点功率大增,英伟达从去年开始推 800V 高压直流供电;液冷从可选变成标配,GB200 后来改用液冷,GB300 全液冷,谷歌的数据显示 2027 年液冷需求价值量是此前的 4 倍。网络侧,国内之前以博通交换芯片为主,如今国产交换芯片已能媲美博通。scale-out 主流仍是博通,scale-up 各家私有协议割裂。这些配套技术的升级,很可能比超节点本身更早释放商业机会。
— 张海军原话 · 已逐字校验
从巴卡机到超节点,它的一个主要变化,其实是为了解决通信墙的问题。
从 8 卡机到超节点,它的一个主要变化,其实是为了解决通信墙的问题。
张海军6:35
单片算力是可能只有它的多少30分之1。但是合在一起会做成超点点以后,其实总算力是它大概两倍。
单片算力可能只有它的 30%,但合在一起做成超节点以后,总算力大概是它的两倍。
张海军23:21
我们超NV是有可能的。因为我们的特点是说,我们可能从0到1可能会比美国那边要弱一些。但是我们从1到100,我觉得肯定是要强于美国那边的。
我们超越 NVIDIA 是有可能的。因为我们的特点是,从 0 到 1 可能比美国弱一些,但从 1 到 100,我觉得肯定强于美国。
张海军32:54
现在产能会是一个瓶颈,就是说谁油产能,可能谁的优势就会更大一些。
现在产能会是一个瓶颈,谁有产能,谁的优势可能就更大。
张海军37:02
你还没有从这几家大的互联网厂商拿到一个大的订单的话,那我觉得后面可能就比较难了。
如果还没有从几家大互联网厂商拿到一个大订单,那我觉得后面可能就比较难了。
张海军41:06
数字与实体
| 超节点产品数量(WAIC 2025) | 超过 10 个 | 4:26 |
| K3 总参数量 | 2.8T | 11:51 |
| K3 专家数 | 896 个 | 11:51 |
| NVL72 机架功耗 | 超过 120 千瓦 | 22:10 |
| 910CA BF16 算力对比 B200 | 约 30% | 23:21 |
| CM384 总算力对比 NVL72 | 1.7 倍 | 23:21 |
| B300 8 卡机价格(去年 Q3) | 370-380 万元 | 38:02 |
| 谷歌 2027 年液冷需求价值量 | 此前的 4 倍 | 44:23 |
术语
- Scale-up纵向扩展
- 把多张芯片组合成一台巨型 GPU,提升单任务算力。
- Scale-out横向扩展
- 通过增加机柜或节点数量来扩展集群规模。
- UALinkUltra Accelerator Link
- AMD、博通等发起的加速器互连开放协议,目前参与者松散。
- CloudMatrix华为超节点系列
- 华为推出的多机柜互连超节点,如 384 芯片方案。
收听指南
关注国产 AI 算力替代的云厂商采购、芯片创业公司和算力板块投资人,需要判断技术路线和订单拐点。
开场逛展吐槽(0:00-4:30)可跳,从 5:28 超节点厂商梳理开始听。