世界太吵,来原声听播客

a16z

AWS故意不把GPU全卖给头部模型公司,专留配额给初创企业

AWS营收里30%到40%来自曾经的初创公司,这是Garman解释为何即便算力紧缺、本可一天卖光给大模型实验室,也要刻意为小公司留GPU配额的理由。

算力分配自研芯片企业Agent落地资本开支供应链瓶颈Bedrock

原视频在 YouTube 上放不出来,用音频听:

密度集中在中后段:GPU分配逻辑、供应链瓶颈的「打地鼠」规律、自研芯片的起源、企业Agent的信任瓶颈,前十分钟偏历史回顾可以快进。

核心论点 · 点时间戳可跳到原声

4:07

今天的初创公司是明天的大客户

AWS成立之初做过内部调研,结论是最该服务的客户是初创公司。Garman说如今AWS营收里有30%到40%来自曾经的初创企业,这是AWS即便算力紧张也要刻意为小公司留配额的商业逻辑——不是做慈善,而是因为今天两三个人的团队,可能就是未来愿意为性能多付钱的大银行、大政府客户的雏形,也是AWS反过来向大客户学习新需求的来源。

— Matt Garman
18:17

宁可少赚,也要给初创公司留配额

Garman承认AWS本可以把每一块GPU都卖给头部大模型实验室,一天之内卖光,但公司刻意不这样做,为了维持整个生态的健康。据他透露,对客户提出的GPU需求,AWS最终会以某种形式答应大约60%(有时换个区域、换个配置、晚一点交付)。与此同时,AWS宣布未来几年要采购200万块英伟达GPU,是目前已知规模最大的单项算力扩充。

— Matt Garman
21:24

客户集中度是AWS对抗泡沫论的底气

面对「AI是不是泡沫」的提问,Garman给出的回应是集中度数据:一些NeoCloud把30%到60%的产能捆绑给一两个大客户,AWS在单一客户上的占比最高也就是个位数百分比,通常还更低。他的逻辑是,即便部分十亿美元估值的初创公司最终跑不出来,AWS大部分算力收入来自已经验证出正向投资回报的生产级工作负载,这部分需求不会因为某几家公司倒下而消失。

— Matt Garman
26:26

瓶颈永远在移动,从不会被彻底解决

Garman提到大学时读过《目标》这本书,给他的启发是从来没有单一瓶颈,只有当下最新的那一个。这个月是电力不够,下个月可能变成内存、台积电产能、HBM或网络组件,甚至某个连接器断供。他还提到十多年前泰国洪水导致全球硬盘短缺的旧案例,说明AWS早就把供应链管理做到四五层供应商之外,逐个追踪成千上万个零部件,哪个紧俏就补哪个。

— Matt Garman
32:33

自研芯片的起点是虚拟化税,不是AI热潮

Trainium和Graviton的故事并非始于AI,而是十三四年前客户抱怨「虚拟化税」、想要裸金属级别的性能。AWS先把网络虚拟化卸载到一块offload卡上,再收购做ARM核心卡的Annapurna团队,把存储虚拟化也卸载掉,顺带做出了Graviton。如今Graviton比同类产品便宜20%、性能还高20%,前100大客户里超过90%在用。Trainium走的是同一条「先验证后做大」路径,第三代已经卖到明年年底,而且Garman承认取名失败——叫「训练」的芯片,如今跑推理的客户反而更多。

— Matt Garman
39:40

企业的agent大多还不敢自主

Garman观察到,目前企业部署的agent大多简单、非自主,仍然有人在环节里把关。他认为企业常犯的错误是直接把人类的五个步骤原样交给agent去做,而真正该做的是推倒重来:让agent并行尝试很多种做法再收敛到答案,用计算机解决问题的方式而不是复制人类流程。真正拦住企业放手的不是技术能力不够,而是信任——怕agent权限失控、误删生产数据库,这种谨慎Garman认为「可能还挺合理」。

— Matt Garman
44:44

数据不回流模型厂商,是Bedrock的护城河

Garman重申Bedrock从设计之初就承诺客户数据永远不离开其VPC、不会被模型提供方看到prompt内容,这曾在三年前被外界批评「AWS在AI上动作太慢」。但随着客户从概念验证转向生产部署,这个保守的架构选择反而成了优势——如今OpenAI、Anthropic的工作负载都在往Bedrock上迁移,是因为企业把自己的数据视为最有价值的资产,不愿意交给模型厂商。

— Matt Garman
52:59

AWS内部:人管的是agent团队而非代码

在AWS自己的「前沿团队」里,写代码已经不是辅助补全,而是彻底交给agent——工程师的工作变成管理一支agent团队,这让新产品的上线速度发生质变。组织形态也在跟着变:过去一个产品方向配10个人长期守着,现在3到4个人就能做出同样的东西,团队该不该继续做小、更频繁换项目,是AWS正在内部做实验的问题。Garman的结论很克制:人管agent、agent也管人,两种情况会长期并存。

— Matt Garman

原话 · 已逐字校验

That's why agentic workflows tend to perform better on AWS than anywhere else.

这就是为什么智能体工作流在AWS上的表现比在其他任何地方都好。

Matt Garman8:11

I saw recently that we say, you know, yes, in some way, shape or form to something like 60% of the requests we eventually get.

我最近看到的数据是,对客户提出的GPU需求,我们最终会以某种形式答应大约60%。

Matt Garman18:17

we recently announced we're going to be buying, you know, 2 million NVIDIA GPUs over the next couple of years

我们最近宣布,未来几年要采购200万块英伟达GPU。

Matt Garman19:21

We're, you know, single digit percentages at the highest and usually it's less than that.

我们(单一客户占比)最高也就是个位数百分比,通常还不到这个数。

Matt Garman21:24

it turns out there's never one constraint. There's always just the latest constraint.

事实证明从来就没有单一的瓶颈,永远只有最新冒出来的那一个。

Matt Garman26:26

We have a guarantee that your data never leaves your VPC.

我们保证客户的数据永远不会离开你的VPC。

Matt Garman44:44

It really is agent first, the agents write all of the code. You're just managing a team of agents and driving that.

现在真的是智能体优先,代码全部由agent来写,你只是在管理并驱动一支agent团队。

Matt Garman52:59

I'll say that agents manage people, people manage agents.

我想说的是,既有agent管人,也有人管agent。

Matt Garman53:59

数字与实体

曾为初创公司的客户贡献的AWS营收占比约30%-40%4:07
2026年资本开支2200亿美元16:15
GPU需求满足率约60%的请求最终以某种形式被满足18:17
未来几年计划采购的NVIDIA GPU数量200万块19:21
Graviton相对其他芯片的成本与性能优势便宜20%,性能高20%35:36
前100大客户中使用Graviton的比例超过90%35:36
数据中心所在县因税收减少的人均金额每人每年少交约5000美元税30:32

术语

FirecrackerFirecracker微虚拟机
AWS自研的轻量级虚拟化技术,安全隔离强、启动极快,常被agent沙箱厂商使用
BedrockBedrock
AWS托管的基础模型服务,承诺客户数据不离开其VPC、不回流给模型厂商
GravitonGraviton
AWS自研的ARM架构服务器芯片,主打更低成本与更高性能
TrainiumTrainium
AWS自研AI加速芯片,原为训练设计,现大量用于推理
FDE前沿部署工程师
AWS派驻客户现场、在数周内教会客户自建评估体系后撤出的技术团队

收听指南

谁该听

关注超大规模云厂商如何分配GPU产能、自研芯片战略和企业级Agent落地瓶颈的创业者、投资人与技术管理者。

可跳过

开场关于AWS早期历史和初创公司变化的回顾,信息密度较低,可跳过。