AI 工廠的中間層:模型正在變成一種需要管理的資源
五層蛋糕裡最不起眼的一層,正在決定誰能把 AI 賣給受監管的大企業——因為模型權重和企業數據,兩邊都不想讓對方看見。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
模型不再是應用,是資源
Hallak 說五層蛋糕裡模型其實並不住在軟件基礎設施之上——隨著時間推移,模型已經變成一種資源,就像 GPU 是資源、SSD 是資源一樣,而資源需要被管理。所以這次發布做的是模型管理:作為操作系統,要知道哪個模型擅長寫代碼、哪個擅長生成圖像、哪個貴哪個便宜,從而把任務路由到對的模型。現在只有四五個模型時還好,一旦強化學習和微調規模化、成百上千個 agent 跑起來、模型不斷衍生出新版本,這件事會變得難得多。
— Renen Hallak機密計算讓兩邊都不必交出底牌
模型開發者不願交出權重,受監管的大企業不願交出數據,這是 AI 進入金融、醫療這類行業的死結。VAST 的做法是讓推理發生在企業自己的環境裡(物理機房或企業自有的 VPC),而不是模型方的雲上;權重全程加密,藉助 Nvidia 的加密內存能力,加密數據從內存傳到 GPU 全程保持加密,只有推理程序能訪問。Hallak 說底層技術並不新,處理器上的機密計算已經存在十多年,新的是它現在能用在 GPU 上,加上生態裡多方配合才湊成完整方案。
— Renen Hallak共享一切,而不是分片
老式可擴展系統基於分片:每個節點負責一塊,節點越多性能越強,但節點間連接數按平方增長,超過一百個節點就開始收益遞減,而且一個部件壞掉所有人都要參與恢復。VAST 的 DASE 架構反過來做——SSD 不直連本機處理器,而是放在網絡另一側,靠 NVMe over Fabrics 這類新協議和新介質,讓每個節點都能像本地直連一樣看到全部數據,節點之間不再需要互相通信。Hallak 說他們有個客戶單集群已經做到數 EB、每秒數十 TB,今天就有上萬個節點。
— Renen Hallak存儲是創業公司去死的地方
2016 年拿一個存儲公司去融 VC 是逆風局,存儲當時被認為是整條棧裡最沒吸引力的部分。Hallak 說這反而成了今天的護城河:他們 2016 年動手時,架構依賴的基礎部件還不存在,要到 2017、2018、2019 年才陸續可用,所以早期董事會反覆問他「如果這個部件最後沒出現怎麼辦」,他的回答是沒有 plan B,對方並不喜歡這個答案。比他們早 30 年或 3 年的競爭對手沒法做這種對未來的下注,而今天這個層級幾乎沒有別的公司,部分原因就是它不夠性感——做模型公司或應用公司比做系統吸引人得多。
— Renen Hallak零流失靠的是能隨時搬走
被問到數據引力會不會讓客戶擔心被鎖定,Hallak 的回答是:因為所有接口都是標準的,客戶搬離我們和搬進來一樣容易,所以我們的工作就是讓他們滿意。他每天早上只看一張圖——客戶滿意度圖,只有綠黃紅三色,公司裡任何人都能把客戶從綠推到黃、從黃推到紅,但很少有人能把他們推回來,而唯一真正有效的指標是客戶自己說「我們現在滿意了」。他給出的結果是:沒有客戶主動決定停用 VAST,毛留存不是 100% 只是因為有些客戶破產了,客戶平均每年放在他們系統裡的數據量翻倍甚至翻三倍。
— Renen Hallakagent 繼承人的權限,也繼承人的風險
企業數據要能被模型用,路徑有三條:上下文窗口、KV cache(模型的內存)、RAG。VAST 的做法是接上企業已有的認證授權機制——Active Directory、訪問控制列表,先搞清楚人誰能看什麼,再把這套屬性延伸到 agent 上:agent 的權限繼承自部署它的人,或繼承自生成它的另一個 agent。除了數據訪問,還要管工具調用和 agent 之間、agent 與人之間的通信,這些對話流經他們提供的流式服務,因此可以被查詢和審計。Hallak 說大多數模型方不允許你在自己環境裡做推理,只能把數據發過去然後祈禱,這顯著拖慢了 AI 的採用。
— Renen Hallak需求大到讓他害怕
Hallak 說他不是被需求說服,而是有時被需求嚇到。有個 AI 雲客戶一個季度前來做三年規劃,說大概需要 500 PB,上週回來說還要再加 2 EB;他預計再過一兩個季度對方會回來說需要兩位數 EB。他看到的是全線超預期:中小環境和大環境都在從「以為要幾十 EB」變成「在談三位數」。他認為當前限制因素是物理的——土地、電力、芯片,建設速度遠慢於需求,有些 AI 雲已經停止賣容量,因為未來一年半都賣光了。他不確定這能持續多久,但認為大多數行業向 AI 遷移才剛開始,按現在的勢頭至少還能跑五到十年。
— Renen Hallakneocloud 贏在提前建,不是提前融
被問到幾百家 neocloud 裡誰會活下來,Hallak 給的三個條件是:拿到電、拿到設備、拿到錢。但真正區分勝負的是建產能的時機——最成功的是那些預判需求提前建好的人,而不是落後於需求、靠租賃補產能的人。他的理由很直接:終端用戶要的是立刻拿到算力,你有他們就付錢,你說「我們一起建,明年給你」,他們就走去找別人。至於「neocloud 本質是 Nvidia GPU 的金融工具、hyperscaler 靠更低資金成本最終會贏」這個流行論點,他認為現實正好相反:hyperscaler 至今沒超越它們,這是創新者窘境;真正下場幹活的 AI 雲每天都在學,而坐在便宜資金上還沒幹這活的一方沒在學,技能差距只會越拉越大。
— Renen Hallak原話 · 已逐字校驗
Over time, models have become a resource, just like a GPU is a resource or a solid state drive is a resource, and resources need to be managed.
隨著時間推移,模型已經變成一種資源,就像 GPU 是資源、固態硬盤是資源一樣,而資源需要被管理。
Renen Hallak13:16
You cannot have more than 100 nodes in one of these systems. Uh, to build AI, we need systems with many millions of nodes.
這類系統裡你不可能超過 100 個節點。而要構建 AI,我們需要的是有數百萬節點的系統。
Renen Hallak23:13
I kept telling them that we didn't have a plan B, that they didn't like it, and so, um, I wasn't their favorite person at the time.
我一直告訴他們我們沒有 plan B,他們不喜歡這個答案,所以當時我不是他們最喜歡的人。
Renen Hallak26:13
Our gross retention rate is not 100% because some of our clients have gone bankrupt over the years, but no one has actively decided to stop using Vast.
我們的毛留存率不是 100%,因為這些年有些客戶破產了,但沒有任何人主動決定停止使用 VAST。
Renen Hallak32:15
Most of these model builders don't allow you to make inferences in your environment, which means you just have to send them your data and hope for the best. I think this significantly slows down the adoption of AI.
這些模型開發者大多不允許你在自己的環境裡做推理,這意味著你只能把數據發給他們然後祈禱。我認為這顯著拖慢了 AI 的採用。
Renen Hallak37:17
I'm not sure if it reassures me, and sometimes it scares me, uh, how big the demand is and how it's accelerating
我不確定這讓我安心,有時候它讓我害怕——需求有多大,以及它加速得有多快。
Renen Hallak47:23
And with each passing day, these AI clouds that are actually in the trenches doing the work, um, they're learning. And the neo-clouders, who are sitting on very cheap funding but not yet, um, hyperscalers, who are sitting on very cheap funding but not yet doing this work, are not learning this. And so the skills gap just, um, keeps getting bigger.
日復一日,這些真正在戰壕裡幹活的 AI 雲在學。而那些坐在極便宜資金上、但還沒做這件事的一方——還沒做這活的一方——沒有在學。所以技能差距只會越來越大。
Renen Hallak56:29
So, I think we're going to see more of a difference in the next 10 years than we've seen in the last thousand years, if this continues to develop the way it seems to be developing now.
所以我認為,如果一切按現在看起來的勢頭發展下去,未來 10 年我們會看到的變化,會比過去一千年看到的還要多。
Renen Hallak1:07:43
數字與實體
| VAST Data 估值 | 300 億美元 | 0:01 |
| VAST 單集群規模 | 數 EB,每秒數十 TB,上萬個節點 | 23:13 |
| 機架功率密度變化 | 從 10 kW 到 500 kW | 2:05 |
| AI 增長速度 | 約每 2 年 10 倍 | 52:26 |
| Navier-Stokes 求解投入的 agent 數 | 10,000 個 | 41:18 |
術語
- DASE全共享架構
- VAST 的架構:SSD 放在網絡另一側,所有節點像本地直連一樣看到全部數據。
- KV cacheKV 緩存
- 模型推理時保存的上下文內存,決定請求該路由到哪塊已加載該模型的 GPU。
- DataEnclave數據飛地
- 在企業自有環境內完成推理、權重全程加密的機密計算方案。
- neocloud新型 AI 雲
- 專為 AI 負載新建的算力雲,區別於傳統 hyperscaler 的舊棧。
- NVMe over Fabrics網絡化 NVMe
- 讓遠端 SSD 像本地直連一樣被訪問的網絡協議。
收聽指南
關注 AI 基礎設施、存儲與數據棧的創業者和投資人,以及正在評估自建 AI 工廠、擔心數據外洩的大企業技術負責人。
16:12 到 20:25 的 P vs NP 與個人數學往事,可快進。