世界太吵,來原聲聽播客

張小珺·商業訪談錄

AGI 是馬拉松:物理硬件成了最大瓶頸

去年以為加 GPU 加數據就能到 AGI,今年發現單數據中心加到 3.2 萬卡就撞牆,美國能源基建還是四五十年前規劃的——AGI 時間表被物理世界拖長了。

AGI算力大基建Scaling Law機器人
一位一線投資人把算力、能源、模型、產品、結盟串成一張 AGI 大基建地圖,數字密度高,適合想快速校準判斷的人。

核心論點 · 點時間戳可跳到原聲

6:32

AGI 從百米衝刺變成馬拉松

去年初大家覺得 AGI 是百米衝刺,都沒做好準備;今年變成馬拉松,都有充足時間準備。變化來自一個具體發現:去年以為可以無限加 GPU 加數據就能到 AGI,但突然發現 GPU 的數據中心和物理硬件是很大的瓶頸——單體數據中心現在加到 3.2 萬卡,再往上就要突破很多;美國能源基建是四五十年前規劃的,能源結構也大不相同,突然新增很多用電量確實跟不上。所以今年最大的感受是物理硬件成為阻礙 AGI 時間表的最大因素。

— 李廣密
23:41

經濟社會突然被加了兩道稅

一個判斷是:模型公司可能是價值沉澱最厚的地方,就像移動互聯網的價值沉澱在設備廠商和廣告平臺。於是出現兩道稅——老黃的 GPU 收算力稅,模型收智能稅,突然給經濟社會加了兩道稅。但李廣密也給出反方說法:如果大模型是電,燈泡不一定由電廠做出來。他更傾向於大模型公司是一個基礎發現的 research lab,有的 lab 有商業能力會做出頭部應用,但這比較考驗組織能力。

— 李廣密
26:34

GPT-4 的入場券是三億美金

把訓練成本拆成電和卡:假設 GPT-3.5 用 500 張 H100 訓練 15 天,約 25 萬度電,是三峽或上海用電量的 0.05%;GPT-4 用 8000 張 H100 訓練 100 天,約 2600 萬度電,是三峽或上海一天用電量的 5%、德州的 2%;GPT-5 若用 3.2 萬張 H100 訓練 100 天,約是三峽或上海一天用電量的 20%。錢上:每張 H100 售價 3 萬美金,加周邊設備,8000 卡就是三億多美金——三億美金是 GPT-4 的入場券;3.2 萬卡集群意味著 12 到 13 億美金。

— 李廣密
28:28

萬卡集群的瓶頸不在錢上

萬卡集群是標配,但有錢也不夠。每張卡都要連起來,互聯難度很大,網絡拓撲結構不是一層而是三層。影響難度的因素包括:找到適合 GPU 數據中心的土地、穩定且便宜的電力、數據中心的互聯通信、降溫運維的可靠性。資源越來越集中收斂,能建大集群的客戶很少,會收斂到只有四五家大客戶。物理世界的東西比數字世界改造得慢。

— 李廣密
40:38

Scaling Law 沒減速,是算力沒懟夠

GPT-4 公開的是 1.8T 參數、MOE 架構、約 13T 數據、2.5 萬張 A100 訓練 100 天。假設下一代三倍參數三倍數據就是 9 倍 compute,老黃公布的 3.2 萬張 H100 集群加上優化效率提升剛好匹配;想 10 倍參數 10 倍數據就是 100 倍 compute,明顯不夠用。結論是 Scaling Law 沒有減速,如果說變慢了,就是算力和數據沒懟夠——GPT-3.5 到 GPT-4 大概用了二三十倍算力提升,GPT-4 走向下一代今天還沒懟夠二三十倍有效算力。

— 李廣密
45:43

今年必須超過 GPT-4,否則出局

2024 年是大模型公司的收斂之年。技術上的生死線是今年內必須超過 GPT-4,背後需要一個很強的團隊;二三線模型公司包括國內的,得超過最好的開源模型,不然商業價值也比較小。算力上今年必須用上萬卡集群,而能做好萬卡集群的公司還是比較少的。未來 12 個月就看能不能有 10 萬張 H100 集群,大概三五十億美金投入。全球最後能留下的:美國可能是 OpenAI、Anthropic、Google、馬斯克的 xAI 四家;歐洲 Mistral 不錯但不確定歐洲是不是獨立市場。

— 李廣密
57:40

OpenAI 做產品是被逼出來的

對 OpenAI 的新認知有三點:AGI 時間表可能拉長;AGI 公司一開始不應該太激進做產品,但 OpenAI 現在很激進;開始理解漸進式解鎖。為什麼激進做應用?李廣密猜:如果 AGI 有 10 年,每年都需要幾個幣甚至 10 個幣的投入,就需要商業化,需要持續健康的現金流來支持 AGI,純靠融資很難融到那麼多錢,也不能只依賴微軟。他還判斷 OpenAI 在 2B 企業側更難,因為企業客戶講信任,而微軟在企業客戶信任太深,OpenAI 的 2B 價值可能被微軟拿掉很大一部分。

— 李廣密
1:07:20

硅谷 VC 三大件:coding、agent、機器人

硅谷 VC 今年的投資主題是三大件:coding、agent 和機器人。但李廣密對三大件都有懷疑:coding 一定在大模型公司和微軟的核心射程以內,核心能力來自模型公司,這些 coding 創業公司不會自己訓大模型,不確定上面優化層的價值有多大;模型公司可能會很激進地做 agent,因為附加值高,是模型級能力、模型級應用、模型級 agent。他傾向於短期價值還是沉澱在模型本身。機器人則是很多 researcher 創業的首選,因為比較容易講故事。

— 李廣密

原話 · 已逐字校驗

今年最大的一個感受就是 物理硬件成為阻礙AGI的一個時間表的最大因素了

今年最大的一個感受就是,物理硬件成為阻礙 AGI 時間表的最大因素了。

李廣密6:45

就一個是老黃的GPU收稅 對吧 一個是模型收一個智能稅 突然給經濟社會又加了兩道稅吧

一個是老黃的 GPU 收稅,一個是模型收一個智能稅,突然給經濟社會又加了兩道稅。

李廣密23:41

它的平均不在錢上 對 萬卡集群這個是個 嗯 標配 標配 它是有錢是不夠的 很難的

它的瓶頸不在錢上。萬卡集群是個標配,有錢是不夠的,很難的。

李廣密28:28

就是人的預期可以飛得很快 但是物理世界我覺得是跟不上的

人的預期可以飛得很快,但物理世界是跟不上的。

李廣密32:34

如果非要說一個結論 我覺得Skill up是沒有減速的 如果說變慢了 我覺得就是算力和數據沒對夠

如果非要說一個結論,我覺得 Scaling Law 是沒有減速的;如果說變慢了,我覺得就是算力和數據沒懟夠。

李廣密41:40

探機肉身 還是有很多侷限的 你比如說 相比大猛星來講 人的吞吐量是有限的 記憶也是比較短的 也沒辦法長時間工作 精力也有問題

碳基肉身還是有很多侷限的。相比大模型來講,人的吞吐量是有限的,記憶也比較短,沒辦法長時間工作,精力也有問題。

李廣密1:15:47

人類又多了兩個 收稅的人類基石公司 一個是芯片算力水 一個是模型智能水

人類又多了兩個收稅的人類基石公司,一個是芯片算力稅,一個是模型智能稅。

李廣密1:20:09

數字與實體

單體數據中心卡數3.2 萬卡6:32
GPT-3.5 訓練用電約 25 萬度電(500 張 H100 訓練 15 天)26:34
H100 售價每張 3 萬美金27:28
GPT-4 入場券3 億美金27:28
微軟對 OpenAI 投資130 億美金30:33
英偉達 GPU 年出貨量今年可能 400 萬片30:33

術語

Scaling Law規模定律
模型能力隨參數、數據、算力規模增長而提升的規律。
Agent智能體
能自主調用工具、完成多步任務的模型應用形態。
主權 AI主權 AI
各國政府用國防等預算採購 GPU 建本國 AI 能力。
T5TT5T
英偉達內部每雙週由每個大組發出最重要的五件事的習慣。
Killer App殺手級應用
能帶來大規模用戶和收入、定義平臺價值的應用。

收聽指南

誰該聽

關注 AGI 進展的創業者、投資人和工程師,想用一集時間校準算力、能源、模型與產品判斷的人。

可跳過

1:15:47 之後關於碳基硅基的閒聊可跳過。