後臺Agent將吃掉90%算力,推理優化該為吞吐犧牲延遲
AI推理的下一波不在聊天而在後臺Agent,後者將吃掉90%算力。Sale Research為此優化吞吐而非延遲,甚至接受80%可用性,以換取價格降幾個數量級,並認為Nvidia每瓦優勢被高估。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
推理公司都在拼延遲,agent 要的是耐力
將 Sale Research 定位為「token 工廠」:以市場上無法匹敵的價格提供開源大語言模型的 token,並支持構建 agent。他們還提供 Sale Box——雲端長期運行的 agent 虛擬機,專為運行數小時、數天甚至數週的 agent 設計。公司主題是「富足」,即以可持續成本向儘可能多的人提供智能。開源模型崛起是重要順風,客戶希望擁有智能的控制權和主權。現有推理公司都專注低延遲推理,但 agent 需要更持久、更長週期的任務。
— Neil Movva後臺任務終將佔九成,因為沒有人在迴路
預測到今年年底,後臺任務和實時任務的工作負載各佔 50%,但長期來看後臺任務將佔 90%。原因是後臺任務沒有人在迴路,token 消耗無界,而人類注意力有限。例如深度研究、網絡安全等任務更適合後臺運行,Parallel Web Systems 想要索引整個互聯網並實時監控變化,這是需要大規模智能的任務。後臺市場是無界的,這是決定性優勢。
— Neil Movva聊天機器人在逼 GPU 偏離最佳路徑
GPU 是吞吐機器,喜歡滿負荷運行,但交互式聊天機器人需要低延遲,迫使 GPU 偏離最佳路徑。未來一年最深刻的變化是從聊天機器人轉向主動或後臺 agent,屆時構建以吞吐為中心的棧更有意義。最好的延遲就是沒有延遲——當你醒來時工作已在夜間完成。這一轉變會改變整個推理系統的優化目標。
— Neil Movva互聯網是一次性補貼,數據不再免費
互聯網是一次性數據補貼,高質量文本約 30 萬億 token,寬泛定義下約 300 萬億,模型已多次看過整個互聯網。未來數據來自模型在可驗證任務上的自我改進,通過強化學習環境(如編碼、數學問題)讓模型自主迭代。隨機人類反饋已無價值,因為模型已超越普通人類,需要專家級反饋。數據不再免費,是擴展性的新瓶頸。
— Neil Movva推理不需要巨型數據中心,1MW 就夠
建 10 萬 GPU 的數據中心比建 1 萬 GPU 難得多。美國建 100MW 數據中心已困難,1GW 幾乎不可能,10MW 勉強可行,1MW 則充足。市場仍假設需要集中式大型數據中心,但推理工作負載適合分布式 1MW 數據中心,他願意購買這些小型算力池。他甚至接受 95% 甚至 80% 可用性,因為後臺代理對延遲不敏感,通過健壯控制平面遷移單點故障,換來的卻是極致性價比。
— Neil Movva蒸餾擋不住,護城河只剩領先的速度
如果用戶擁有與 AI 交互的輸出併發布到 GitHub,長期來看蒸餾不可避免。信息擴散無法阻止,問題只是速度。因此領先 3 到 6 個月的價值能持續多久是關鍵。企業採用速度慢,很多還在用 Opus 4.6 或 4.7,不會快速採用最前沿技術。這意味著模型的護城河在於持續領先的速度,而非絕對能力。
— Neil Movva繞開 HBM,把 KV cache 卸到閃存
最讓朋友覺得「有三頭六臂」的觀點是繞開 HBM,更極端地卸載到閃存。他熱衷於改變模型架構,使 KV cache 卸載到閃存更高效。推理社區圍繞每秒 1 到 10 token 的 serving 設計系統,這是北極星。以 OpenAI 定價,一萬億 token 至少花 500 萬美元,需要 3 到 6 個數量級的成本改進。世界對智能的需求永遠存在,挑戰在於產品社區如何提供入口。
— Neil Movva丟掉臺積電,最差也就 2 倍每瓦差距
從 Hopper 到 Blackwell 再到 Rubin,Bfloat16 乘法的每瓦性能提升並不大;從臺積電 5nm 到 4nm 再到 3nm,每瓦性能變化也不顯著。即使失去臺積電,西方最好工藝(如 Intel)最差也就 2 倍每瓦差距,遠沒有想像的嚴重。芯片創業者必須理解 3 到 5 個供應鏈瓶頸:臺積電晶圓產能、HBM 產能、先進封裝,可能還有電力。設計要 spiky,選擇 Nvidia 未重視的方向,比如押注 HBM 短缺。
— Neil Movva原話 · 已逐字校驗
I love this market because it's unbounded. There's no human in the loop. So you can consume as many tokens as you like in the background versus human attention span.
我喜歡這個市場,因為它是無界的。沒有人類在迴路中,所以你可以隨心所欲地在後臺消耗 token,而人類的注意力是有限的。
Neil Movva8:00
I like the phrase that Internet was a one time subsidy on data. We got it for free. It's extremely high quality about 30 trillion tokens of high quality text, 300 trillion tokens. if you take a wider view on what qualifies as a good text and we've basically looked at it all already.
我喜歡這個說法:互聯網是一次性的數據補貼。我們免費獲得了它。高質量文本大約 30 萬億 token,如果對好文本的定義更寬泛,則是 300 萬億 token,而我們已經基本上看完了所有這些。
Neil Movva36:48
I like to say we write kernels in the whiteboard we go to the whiteboard, we describe what we think the machine should be doing then we succcly describe that in the natural language to a model and then the model is able to do the execution
我喜歡說我們在白板上寫內核:我們去白板,描述我們認為機器應該做什麼,然後用自然語言簡潔地描述給模型,模型就能執行。
Neil Movva41:05
I will buy like5% up time. And the reason for that is because it's background engine thing is things running in the background. You don't care.
我會購買 95% 的正常運行時間。原因在於這是後臺引擎,是後臺運行的東西,你並不在意。
Neil Movva54:14
I want abundant tokens and diverse harnesses. I want everyone to build their own harness, every company, every user, even make the agent your own.
我想要豐富的 token 和多樣化的 harness。我希望每個人都能構建自己的 harness,每家公司、每個用戶,甚至讓 agent 成為你自己的。
Neil Movva1:08:23
There is always demand for intelligence in the world. The on ramps to that intelligence are our challenge as a product community.
世界上對智能的需求永遠存在。通往智能的入口是我們作為產品社區的挑戰。
Neil Movva1:10:31
數字與實體
| 後臺任務與實時任務佔比預測 | 今年底50/50,長期90/10 | 8:00 |
| 互聯網文本 token 數 | 高質量約30萬億,寬泛約300萬億 | 36:48 |
| NVL72 芯片單元數 | 72 | 43:15 |
| Nvidia 今年 Blackwell 芯片產量 | 500 萬 | 1:00:44 |
| OpenAI 定價下萬億 token 成本 | 至少 500 萬美元 | 1:10:31 |
| 所需成本改進數量級 | 3 到 6 個數量級 | 1:10:31 |
| Intel 與臺積電每瓦性能差距 | 最差約 2 倍 | 1:11:34 |
術語
- KV cache鍵值緩存
- Transformer 注意力中緩存 key 和 value 的內存,避免生成時重複計算。
- HBM高帶寬內存
- 與 GPU 封裝在一起,提供極高的內存帶寬,但容量有限。
- SRAM靜態隨機存取存儲器
- 速度極快但容量小,通常作為芯片上的緩存。
- Tensor Core張量核心
- GPU 上專門加速矩陣乘法運算的硬件單元,是深度學習的計算核心。
- Harness智能體框架
- 圍繞模型構建的 Agent 框架或工具鏈,這裡指用戶自定義的智能體工作流。
收聽指南
AI 基礎設施創業者、算力投資者、模型部署工程師,以及關注推理成本與 AI 產品化的產品負責人。