世界太吵,來原聲聽播客

All-In

AI 三年內會撞上能源牆,解法是造一臺不像計算機的計算機

Google 一家公司每月消耗 3.2 千萬億 token,按每 token 10 焦耳算就是 12 吉瓦,而全美數據中心總功率約 40 吉瓦。Naveen Rao 認為這個缺口只能靠換掉計算機的底層範式來填。

算力芯片架構能源數據中心動力學系統

原視頻在 YouTube 上放不出來,用音頻聽:

前半段是能源賬,後半段是他首次公開的物理動力學計算機原型和實測能效數據,屬於少見的硬信息。中間一段生物學類比可以快進。

核心論點 · 點時間戳可跳到原聲

4:45

能源不是成本項,是入場券

Naveen 給出的賬是:Google 每月跨過 3.2 千萬億 token,按每 token 10 焦耳這個偏低值算,就是 12 吉瓦。美國今天投進數據中心的能源約 40 吉瓦,全球不到 100 吉瓦。也就是說一家公司的 AI 服務就吃掉全球數據中心能源的十分之一以上。他的判斷是三年左右就會撞上能源上限。更關鍵的是數據中心的稀缺資源排序變了:過去是地板面積、機架、網絡設備、GPU,今天是能源——先拿到電力合同,再想怎麼把它填滿。而能源佔服務一個 token 成本的 50%,剩下才是硬件 capex 和場地。

— Naveen Rao
7:04

松鼠用 8 毫瓦完成的事,GPU 要幾瓦

人腦約 20 瓦。按神經元數量線性縮到猴子腦是一瓦,正好等於你口袋裡的手機。再往下,老鼠和蝙蝠是毫瓦級。松鼠在樹枝間跳躍,一千次裡一千次精準,靠的是 8 毫瓦的腦。也就是說你手機的電量能跑一百多個松鼠腦。Naveen 的結論是生物學已經造出了適合智能的物理基底,而合成系統走的是另一條路:人腦皮層每秒只搬約 160 億比特,一塊高端 GPU 每秒進出內存接近 30 萬億比特,芯片內部還要再高 10 到 100 倍。能量幾乎全花在搬信息上,而不是算上。

— Naveen Rao
10:06

摩爾定律停了,抽象層還在收稅

晶體管數量還在漲,但頻率早就不能跟著漲,單線程性能也不能,現在連能效都不再隨製程縮小而改善——Naveen 直接說摩爾定律基本結束了。他的診斷是抽象層的問題:數字本身就是對物理世界的抽象,晶體管實際有中間態,是被工程成 0 和 1 的。每一層抽象都是有損的,都不考慮底下的複雜度。所以他們的做法是把半導體的物理抽象直接接到神經網絡上,跳過中間那些層。他舉的直覺例子是鳥群和蟻群:個體只做極簡單的動作,整體湧現出複雜行為,這門學問叫 dynamical systems theory。

— Naveen Rao
12:07

節拍器放在木板上會自己同步

把多個節拍器放在一塊能前後滾動的剛性木板上,它們會自己同步到完全相同的相位,只因為每個節拍器都輕輕推了木板一下。這是純物理的動力學系統。他們問的是:這種系統能不能拿來做計算。答案是能——他們開源了一個叫 UNO 的圖像生成模型,建立在這樣一組振盪器上,可以訓練、可以出圖。把系統狀態定義為所有振盪器的相位,再按輸出做條件,生成飛機、汽車、鳥時會走不同的 state space trajectory。這是第一次證明這類系統能規模化訓練併產出有用結果。

— Naveen Rao
14:08

扔掉連接反而讓系統更好訓練

全連接是 n 平方:10 個元素 100 條連接還行,1000 個元素就是 100 萬條,根本不可擴展。他們提出的 sparsity 是主動扔掉一部分連接,然後看能不能把整體行為救回來。結果不只是能扔,扔掉之後系統行為更好、更可訓練,而且這個結論在仿真和真實物理系統裡都成立。Naveen 說這是罕見的「更高效、更可擴展、性能還更好」三件事同時成立的情況,是長期沒人解開的 holy grail,前提是得先把問題框對。

— Naveen Rao
15:09

第一臺物理動力學計算機已經跑出圖了

這是 Naveen 首次公開:他們造出了第一臺物理動力學計算機。公司今年一月才正式開始,當時連團隊都沒有,六月一日把設計送去流片,芯片已經回到實驗室並跑出了結果——第一批由這種計算機生成的圖像。能效上,生成一張圖約 500 納焦耳,而普通 GPU 是毫焦耳量級,納焦耳是 10 的負 9 次方,差了好幾個數量級。原因就是它根本不搬信息。架構上它和 CPU、GPU 都不同:那些都是 von Neumann 架構,內存和計算分離、來回搬數據;這臺機器計算和存儲是同一個東西,沒有內存接口,每個計算單元本身就是存儲器。

— Naveen Rao
17:09

4D 計算:三個空間維度加一個時間維度

他們把這套東西叫 4D computing:物理上用 die stacking 在垂直和平面方向用滿三個維度,第四個維度是動力學裡的時間。目標函數是 intelligence per watt。存在一個熱力學極限永遠無法突破,動物腦距離這個極限只有一到兩個數量級,而今天的計算系統離它大約差 100 億倍。他們的計劃是三年半內觸到 2D 光刻的極限,公司的總目標是 beat biology。Naveen 預期結果是形態變化:從吉瓦級的大數據中心,轉向散布各處的小數據中心,更本地、更自適應,並支撐起能動態組合解決問題的數十億機器人。

— Naveen Rao
19:12

便宜一千倍,消耗會超過一千倍

Naveen 用 Jevons paradox 收尾:當一項資產的底層成本下降,消費量的增長會超過價格下降的幅度。價格減半,消費增長超過兩倍;價格降到千分之一,消費增長超過一千倍。所以他不認為能效提升會讓市場縮小,反而會造出人類歷史上最大的市場。Chamath 隨後追問生態問題——流片、封裝這些環節需要一整套人配合。Naveen 的回答是兩年內做到完整產品,形態是一整個機架,作為新的數據中心產品,tokens in、tokens out 走網線,但內部結構和現有計算機完全不同。

— Naveen Rao
20:12

移植的是模型層,不是算子層

Chamath 問現有模型家族和架構能不能搬過來,畢竟整個行業都圍著 KV cache 這類機制建起來的。Naveen 說存在一個滑動尺度:一樣東西好多少,決定別人願意忍受多少遷移痛苦,他的策略是讓遷移的收益足夠大。移植發生在模型層而不是算子層,現有模型能用,但遷移本身需要相當多算力。他特別指出像 matmul 這種基本元素在這臺機器上並不存在——你可以把它刻畫成矩陣乘法,但它不是以矩陣乘法的形式實現的,而是以隨時間變化的行為實現的,每個時間步可以分析成當前狀態矩陣乘以轉移矩陣。團隊構成上,動力學系統理論已經存在一百年,他們從那個圈子招人,也招真正做芯片的人,而這兩撥人彼此不說話,協調是這家公司最難的部分。

— Naveen Rao

原話 · 已逐字校驗

So, you can imagine if models get bigger that that energy goes up and if demand grows, which it is, that energy goes up. So, we're going to run out of energy pretty fast in like 3 years or so is my estimate.

所以你可以想像,如果模型變大,能源消耗就上升;如果需求增長——它確實在增長——能源消耗也上升。我的估計是我們會很快耗盡能源,大概三年左右。

Naveen Rao5:04

Their brain runs on 8 mill of energy. You could run over a 100 squirrel brains on your phone and it it has very precise and accurate behavior.

它們的腦只消耗 8 毫瓦。你手機的電量能跑一百多個松鼠腦,而它有著非常精確準確的行為。

Naveen Rao7:04

Moore's law, if you may have heard of this, it's like making transistors smaller has largely ended.

摩爾定律,你可能聽說過,也就是把晶體管做小這件事,基本上已經結束了。

Naveen Rao10:06

This is actually the first physical dynamical computer ever built.

這實際上是有史以來第一臺物理動力學計算機。

Naveen Rao15:09

So it's many orders of magnitude more efficient than a standard computer and it's because it just doesn't move information around.

所以它的能效比標準計算機高出好幾個數量級,原因就是它根本不搬運信息。

Naveen Rao16:09

So, if you make something half the price, you'll consume more than 2x. If you cons you make something 1,000th the price, you'll consume more than 1/ 1,000th of it.

所以,如果你把某樣東西的價格減半,你的消費會增長超過兩倍。如果你把價格降到千分之一,你的消費會增長超過一千倍。

Naveen Rao19:12

數字與實體

按每 token 10 焦耳折算的 Google AI 服務功率12 吉瓦5:04
美國數據中心總功率約 40 吉瓦5:04
全球數據中心總功率不到 100 吉瓦5:04
能源佔服務一個 token 成本的比例約 50%6:04
人腦功率約 20 瓦7:04
松鼠腦功率8 毫瓦7:04
人腦皮層信息傳輸速率約每秒 160 億比特8:05
高端 GPU 每秒進出內存的比特數接近 30 萬億8:05
動力學計算機生成一張圖像的能耗約 500 納焦耳16:09

術語

dynamical systems theory動力系統理論
研究簡單個體規則如何湧現出整體複雜行為的數學框架,已存在約一百年。
von Neumann architecture馮·諾依曼架構
內存與計算分離、數據在兩者間來回搬運的計算機結構,CPU 和 GPU 都屬此類。
sparsity稀疏化
主動丟棄系統中部分連接,反而讓整體行為更好、更可訓練、更可擴展。
Jevons paradox傑文斯悖論
某項資源的使用效率提高後,總消費量不降反升。
4D computing4D 計算
Naveen 提出的概念:物理上用滿三個空間維度,第四個維度是動力學中的時間。
state space trajectory狀態空間軌跡
把系統所有振盪器的相位定義為狀態,觀察它隨時間演化出的路徑。

收聽指南

誰該聽

關注 AI 算力成本、數據中心電力約束和新型芯片架構的創業者、投資人與硬件工程師。

可跳過

07:04 到 10:06 的生物學與計算機史類比,信息密度偏低,可跳到 12:07。