世界太吵,来原声听播客

MAD Podcast

AI 工厂的中间层:模型正在变成一种需要管理的资源

五层蛋糕里最不起眼的一层,正在决定谁能把 AI 卖给受监管的大企业——因为模型权重和企业数据,两边都不想让对方看见。

AI 基础设施存储机密计算neocloud模型管理
前半段是创始人叙事,后半段才有真东西:模型管理、机密计算、neocloud 分化、需求侧的真实数字。

核心论点 · 点时间戳可跳到原声

13:16

模型不再是应用,是资源

Hallak 说五层蛋糕里模型其实并不住在软件基础设施之上——随着时间推移,模型已经变成一种资源,就像 GPU 是资源、SSD 是资源一样,而资源需要被管理。所以这次发布做的是模型管理:作为操作系统,要知道哪个模型擅长写代码、哪个擅长生成图像、哪个贵哪个便宜,从而把任务路由到对的模型。现在只有四五个模型时还好,一旦强化学习和微调规模化、成百上千个 agent 跑起来、模型不断衍生出新版本,这件事会变得难得多。

— Renen Hallak
14:11

机密计算让两边都不必交出底牌

模型开发者不愿交出权重,受监管的大企业不愿交出数据,这是 AI 进入金融、医疗这类行业的死结。VAST 的做法是让推理发生在企业自己的环境里(物理机房或企业自有的 VPC),而不是模型方的云上;权重全程加密,借助 Nvidia 的加密内存能力,加密数据从内存传到 GPU 全程保持加密,只有推理程序能访问。Hallak 说底层技术并不新,处理器上的机密计算已经存在十多年,新的是它现在能用在 GPU 上,加上生态里多方配合才凑成完整方案。

— Renen Hallak
21:55

共享一切,而不是分片

老式可扩展系统基于分片:每个节点负责一块,节点越多性能越强,但节点间连接数按平方增长,超过一百个节点就开始收益递减,而且一个部件坏掉所有人都要参与恢复。VAST 的 DASE 架构反过来做——SSD 不直连本机处理器,而是放在网络另一侧,靠 NVMe over Fabrics 这类新协议和新介质,让每个节点都能像本地直连一样看到全部数据,节点之间不再需要互相通信。Hallak 说他们有个客户单集群已经做到数 EB、每秒数十 TB,今天就有上万个节点。

— Renen Hallak
25:18

存储是创业公司去死的地方

2016 年拿一个存储公司去融 VC 是逆风局,存储当时被认为是整条栈里最没吸引力的部分。Hallak 说这反而成了今天的护城河:他们 2016 年动手时,架构依赖的基础部件还不存在,要到 2017、2018、2019 年才陆续可用,所以早期董事会反复问他「如果这个部件最后没出现怎么办」,他的回答是没有 plan B,对方并不喜欢这个答案。比他们早 30 年或 3 年的竞争对手没法做这种对未来的下注,而今天这个层级几乎没有别的公司,部分原因就是它不够性感——做模型公司或应用公司比做系统吸引人得多。

— Renen Hallak
31:29

零流失靠的是能随时搬走

被问到数据引力会不会让客户担心被锁定,Hallak 的回答是:因为所有接口都是标准的,客户搬离我们和搬进来一样容易,所以我们的工作就是让他们满意。他每天早上只看一张图——客户满意度图,只有绿黄红三色,公司里任何人都能把客户从绿推到黄、从黄推到红,但很少有人能把他们推回来,而唯一真正有效的指标是客户自己说「我们现在满意了」。他给出的结果是:没有客户主动决定停用 VAST,毛留存不是 100% 只是因为有些客户破产了,客户平均每年放在他们系统里的数据量翻倍甚至翻三倍。

— Renen Hallak
36:59

agent 继承人的权限,也继承人的风险

企业数据要能被模型用,路径有三条:上下文窗口、KV cache(模型的内存)、RAG。VAST 的做法是接上企业已有的认证授权机制——Active Directory、访问控制列表,先搞清楚人谁能看什么,再把这套属性延伸到 agent 上:agent 的权限继承自部署它的人,或继承自生成它的另一个 agent。除了数据访问,还要管工具调用和 agent 之间、agent 与人之间的通信,这些对话流经他们提供的流式服务,因此可以被查询和审计。Hallak 说大多数模型方不允许你在自己环境里做推理,只能把数据发过去然后祈祷,这显著拖慢了 AI 的采用。

— Renen Hallak
46:37

需求大到让他害怕

Hallak 说他不是被需求说服,而是有时被需求吓到。有个 AI 云客户一个季度前来做三年规划,说大概需要 500 PB,上周回来说还要再加 2 EB;他预计再过一两个季度对方会回来说需要两位数 EB。他看到的是全线超预期:中小环境和大环境都在从「以为要几十 EB」变成「在谈三位数」。他认为当前限制因素是物理的——土地、电力、芯片,建设速度远慢于需求,有些 AI 云已经停止卖容量,因为未来一年半都卖光了。他不确定这能持续多久,但认为大多数行业向 AI 迁移才刚开始,按现在的势头至少还能跑五到十年。

— Renen Hallak
53:24

neocloud 赢在提前建,不是提前融

被问到几百家 neocloud 里谁会活下来,Hallak 给的三个条件是:拿到电、拿到设备、拿到钱。但真正区分胜负的是建产能的时机——最成功的是那些预判需求提前建好的人,而不是落后于需求、靠租赁补产能的人。他的理由很直接:终端用户要的是立刻拿到算力,你有他们就付钱,你说「我们一起建,明年给你」,他们就走去找别人。至于「neocloud 本质是 Nvidia GPU 的金融工具、hyperscaler 靠更低资金成本最终会赢」这个流行论点,他认为现实正好相反:hyperscaler 至今没超越它们,这是创新者窘境;真正下场干活的 AI 云每天都在学,而坐在便宜资金上还没干这活的一方没在学,技能差距只会越拉越大。

— Renen Hallak

原话 · 已逐字校验

Over time, models have become a resource, just like a GPU is a resource or a solid state drive is a resource, and resources need to be managed.

随着时间推移,模型已经变成一种资源,就像 GPU 是资源、固态硬盘是资源一样,而资源需要被管理。

Renen Hallak13:16

You cannot have more than 100 nodes in one of these systems. Uh, to build AI, we need systems with many millions of nodes.

这类系统里你不可能超过 100 个节点。而要构建 AI,我们需要的是有数百万节点的系统。

Renen Hallak23:13

I kept telling them that we didn't have a plan B, that they didn't like it, and so, um, I wasn't their favorite person at the time.

我一直告诉他们我们没有 plan B,他们不喜欢这个答案,所以当时我不是他们最喜欢的人。

Renen Hallak26:13

Our gross retention rate is not 100% because some of our clients have gone bankrupt over the years, but no one has actively decided to stop using Vast.

我们的毛留存率不是 100%,因为这些年有些客户破产了,但没有任何人主动决定停止使用 VAST。

Renen Hallak32:15

Most of these model builders don't allow you to make inferences in your environment, which means you just have to send them your data and hope for the best. I think this significantly slows down the adoption of AI.

这些模型开发者大多不允许你在自己的环境里做推理,这意味着你只能把数据发给他们然后祈祷。我认为这显著拖慢了 AI 的采用。

Renen Hallak37:17

I'm not sure if it reassures me, and sometimes it scares me, uh, how big the demand is and how it's accelerating

我不确定这让我安心,有时候它让我害怕——需求有多大,以及它加速得有多快。

Renen Hallak47:23

And with each passing day, these AI clouds that are actually in the trenches doing the work, um, they're learning. And the neo-clouders, who are sitting on very cheap funding but not yet, um, hyperscalers, who are sitting on very cheap funding but not yet doing this work, are not learning this. And so the skills gap just, um, keeps getting bigger.

日复一日,这些真正在战壕里干活的 AI 云在学。而那些坐在极便宜资金上、但还没做这件事的一方——还没做这活的一方——没有在学。所以技能差距只会越来越大。

Renen Hallak56:29

So, I think we're going to see more of a difference in the next 10 years than we've seen in the last thousand years, if this continues to develop the way it seems to be developing now.

所以我认为,如果一切按现在看起来的势头发展下去,未来 10 年我们会看到的变化,会比过去一千年看到的还要多。

Renen Hallak1:07:43

数字与实体

VAST Data 估值300 亿美元0:01
VAST 单集群规模数 EB,每秒数十 TB,上万个节点23:13
机架功率密度变化从 10 kW 到 500 kW2:05
AI 增长速度约每 2 年 10 倍52:26
Navier-Stokes 求解投入的 agent 数10,000 个41:18

术语

DASE全共享架构
VAST 的架构:SSD 放在网络另一侧,所有节点像本地直连一样看到全部数据。
KV cacheKV 缓存
模型推理时保存的上下文内存,决定请求该路由到哪块已加载该模型的 GPU。
DataEnclave数据飞地
在企业自有环境内完成推理、权重全程加密的机密计算方案。
neocloud新型 AI 云
专为 AI 负载新建的算力云,区别于传统 hyperscaler 的旧栈。
NVMe over Fabrics网络化 NVMe
让远端 SSD 像本地直连一样被访问的网络协议。

收听指南

谁该听

关注 AI 基础设施、存储与数据栈的创业者和投资人,以及正在评估自建 AI 工厂、担心数据外泄的大企业技术负责人。

可跳过

16:12 到 20:25 的 P vs NP 与个人数学往事,可快进。