國產超節點總算力反超英偉達,但功耗翻五倍換不來生態
華為 CloudMatrix 384 以約 560 千瓦功耗換來 1.7 倍於 NVL72 的總算力,但決定國產超節點命運的不是參數,而是產能和軟件生態。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
超節點成展會標配
今年 WAIC 上展示超節點產品超過 10 個,華為、阿里、百度,以及壁仞、摩爾線程、沐曦、燧原等芯片廠商,甚至中興、曙光等服務器廠商,都把超節點放在展臺最顯眼的位置。券商把 2026 年叫作國產超節點元年。這種同質化競爭背後是強烈的 FOMO:沒有超節點,就像不好意思來參展。超節點從 8 卡機演變成幾十到上百卡的機櫃形態,核心是為了解決模型訓練和推理中的通信牆問題。
— 雅賢單芯片追不上,系統層面補
國產 AI 芯片與海外在單芯片技術上差距明顯,短時間難以彌補,必須從系統層面提升性能。Kimi 的 K3 模型總參數量 2.8T,896 個專家,每個 token 選擇 16 個專家,官方建議使用 64 顆以上加速器組成的超節點,以解決容量、帶寬和延遲問題。同時,互聯技術已經能讓超節點產品化,廠商也願意賣整個機櫃而非單卡,因為價值量完全不同。這些因素疊加,讓超節點成為國產算力追趕的必選路徑。
— 張海軍割裂的 Scale-up 生態
全球超節點的 scale-up 協議幾乎都是私有的:英偉達有 NVLink,華為有 UB,阿里和國產芯片公司各有自己的一套。海外 UALink 由 AMD、Marvell、博通等發起,但 AMD 是主要推動者,Marvell 做交換芯片卻動力不足,博通則退出自己搞協議,導致開放協議鬆散。華為 UB 能把 scale-up 和 scale-out 統一,而英偉達的 NVLink 只做機櫃內互聯,機櫃間用 IB。協議割裂意味著生態綁定,國產替代不只是硬件問題。
— 張海軍標杆對比:NV72 與華為 384
NVIDIA NVL72 由 18 個 compute tray 和 9 個 NVSwitch tray 組成,共 72 個 B200,整機功耗超過 120 千瓦,且 GB200 前期出貨以風冷為主,並非全液冷。華為 CloudMatrix 384 是國內首個超節點,16 個機櫃共 384 個 910C。單芯片 BF16 算力只有 B200 的 30%,但系統總算力是 NVL72 的 1.7 倍。代價是整機功耗約 560 千瓦,接近 NV 的 5 倍。這是用堆料換總算力,也解釋了為什麼中國必須走系統級創新。
— 張海軍整機廠商不甘只做組裝
中興、華三這類傳統服務器 OEM 這次也推出了超節點方案。中興利用網絡領域技術自研交換芯片,協議名為 Olink,官方稱能兼容國內多家芯片,但未公布細節。曦智科技則押注光互連,定位是提供光通信和光交換組件。目前國內真正量產使用的超節點只有華為和曙光兩家,華為客戶分散在運營商和雲廠商,曙光與海光綁定主攻信創。其他廠商的「零適配」宣稱距離大規模商用還有很長的路。
— 雅賢國產超節點能超英偉達嗎
張海軍認為,國產超節點在系統參數上已經超過英偉達:CM384 總算力是 NVL72 的 1.7 倍。但他定義的「超過」是:如果 NV 放開市場,雲廠商在同等條件下寧願選國產超節點,那才算贏。目前很難,因為 CUDA 生態太深,國內工程師習慣用 CUDA,DeepSeek 甚至能發現英偉達芯片的 bug,切換到國產軟硬件要重學;NV 穩定性也更好。但英偉達下一代產品 delay 給了國產機會,加上軟件生態一年來明顯改善,差距在縮小。從 0 到 1 國產弱,從 1 到 100 國產更強。
— 張海軍產能才是真瓶頸
芯片廠商多不代表產能大,真正的卡點是 AI 芯片產能。B300 8 卡機價格從去年 Q3 的 370-380 萬漲到今年 1200-1300 萬,說明海外貨進不來且稀缺。互聯網大廠今年比去年採購更多國產芯片,一個重要原因就是國產產能相對可靠。由於各家軟件生態不互通,大廠不可能同時適配所有芯片,因此如果到明年還沒拿到大廠訂單,二線廠商後面就很難了。行業格局可能像自動駕駛一樣洗牌,最後只剩五六家。華為和寒武紀地位穩定,大廠自研如平頭哥、燧原也有機會。
— 張海軍超節點帶動供電、液冷、交換芯片
超節點功率大增,英偉達從去年開始推 800V 高壓直流供電;液冷從可選變成標配,GB200 後來改用液冷,GB300 全液冷,谷歌的數據顯示 2027 年液冷需求價值量是此前的 4 倍。網絡側,國內之前以博通交換芯片為主,如今國產交換芯片已能媲美博通。scale-out 主流仍是博通,scale-up 各傢俬有協議割裂。這些配套技術的升級,很可能比超節點本身更早釋放商業機會。
— 張海軍原話 · 已逐字校驗
從巴卡機到超節點,它的一個主要變化,其實是為了解決通信牆的問題。
從 8 卡機到超節點,它的一個主要變化,其實是為了解決通信牆的問題。
張海軍6:35
單片算力是可能只有它的多少30分之1。但是合在一起會做成超點點以後,其實總算力是它大概兩倍。
單片算力可能只有它的 30%,但合在一起做成超節點以後,總算力大概是它的兩倍。
張海軍23:21
我們超NV是有可能的。因為我們的特點是說,我們可能從0到1可能會比美國那邊要弱一些。但是我們從1到100,我覺得肯定是要強於美國那邊的。
我們超越 NVIDIA 是有可能的。因為我們的特點是,從 0 到 1 可能比美國弱一些,但從 1 到 100,我覺得肯定強於美國。
張海軍32:54
現在產能會是一個瓶頸,就是說誰油產能,可能誰的優勢就會更大一些。
現在產能會是一個瓶頸,誰有產能,誰的優勢可能就更大。
張海軍37:02
你還沒有從這幾家大的互聯網廠商拿到一個大的訂單的話,那我覺得後面可能就比較難了。
如果還沒有從幾家大互聯網廠商拿到一個大訂單,那我覺得後面可能就比較難了。
張海軍41:06
數字與實體
| 超節點產品數量(WAIC 2025) | 超過 10 個 | 4:26 |
| K3 總參數量 | 2.8T | 11:51 |
| K3 專家數 | 896 個 | 11:51 |
| NVL72 機架功耗 | 超過 120 千瓦 | 22:10 |
| 910CA BF16 算力對比 B200 | 約 30% | 23:21 |
| CM384 總算力對比 NVL72 | 1.7 倍 | 23:21 |
| B300 8 卡機價格(去年 Q3) | 370-380 萬元 | 38:02 |
| 谷歌 2027 年液冷需求價值量 | 此前的 4 倍 | 44:23 |
術語
- Scale-up縱向擴展
- 把多張芯片組合成一臺巨型 GPU,提升單任務算力。
- Scale-out橫向擴展
- 通過增加機櫃或節點數量來擴展集群規模。
- UALinkUltra Accelerator Link
- AMD、博通等發起的加速器互連開放協議,目前參與者鬆散。
- CloudMatrix華為超節點系列
- 華為推出的多機櫃互連超節點,如 384 芯片方案。
收聽指南
關注國產 AI 算力替代的雲廠商採購、芯片創業公司和算力板塊投資人,需要判斷技術路線和訂單拐點。
開場逛展吐槽(0:00-4:30)可跳,從 5:28 超節點廠商梳理開始聽。