AWS故意不把GPU全卖给头部模型公司,专留配额给初创企业
AWS营收里30%到40%来自曾经的初创公司,这是Garman解释为何即便算力紧缺、本可一天卖光给大模型实验室,也要刻意为小公司留GPU配额的理由。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
今天的初创公司是明天的大客户
AWS成立之初做过内部调研,结论是最该服务的客户是初创公司。Garman说如今AWS营收里有30%到40%来自曾经的初创企业,这是AWS即便算力紧张也要刻意为小公司留配额的商业逻辑——不是做慈善,而是因为今天两三个人的团队,可能就是未来愿意为性能多付钱的大银行、大政府客户的雏形,也是AWS反过来向大客户学习新需求的来源。
— Matt Garman宁可少赚,也要给初创公司留配额
Garman承认AWS本可以把每一块GPU都卖给头部大模型实验室,一天之内卖光,但公司刻意不这样做,为了维持整个生态的健康。据他透露,对客户提出的GPU需求,AWS最终会以某种形式答应大约60%(有时换个区域、换个配置、晚一点交付)。与此同时,AWS宣布未来几年要采购200万块英伟达GPU,是目前已知规模最大的单项算力扩充。
— Matt Garman客户集中度是AWS对抗泡沫论的底气
面对「AI是不是泡沫」的提问,Garman给出的回应是集中度数据:一些NeoCloud把30%到60%的产能捆绑给一两个大客户,AWS在单一客户上的占比最高也就是个位数百分比,通常还更低。他的逻辑是,即便部分十亿美元估值的初创公司最终跑不出来,AWS大部分算力收入来自已经验证出正向投资回报的生产级工作负载,这部分需求不会因为某几家公司倒下而消失。
— Matt Garman瓶颈永远在移动,从不会被彻底解决
Garman提到大学时读过《目标》这本书,给他的启发是从来没有单一瓶颈,只有当下最新的那一个。这个月是电力不够,下个月可能变成内存、台积电产能、HBM或网络组件,甚至某个连接器断供。他还提到十多年前泰国洪水导致全球硬盘短缺的旧案例,说明AWS早就把供应链管理做到四五层供应商之外,逐个追踪成千上万个零部件,哪个紧俏就补哪个。
— Matt Garman自研芯片的起点是虚拟化税,不是AI热潮
Trainium和Graviton的故事并非始于AI,而是十三四年前客户抱怨「虚拟化税」、想要裸金属级别的性能。AWS先把网络虚拟化卸载到一块offload卡上,再收购做ARM核心卡的Annapurna团队,把存储虚拟化也卸载掉,顺带做出了Graviton。如今Graviton比同类产品便宜20%、性能还高20%,前100大客户里超过90%在用。Trainium走的是同一条「先验证后做大」路径,第三代已经卖到明年年底,而且Garman承认取名失败——叫「训练」的芯片,如今跑推理的客户反而更多。
— Matt Garman企业的agent大多还不敢自主
Garman观察到,目前企业部署的agent大多简单、非自主,仍然有人在环节里把关。他认为企业常犯的错误是直接把人类的五个步骤原样交给agent去做,而真正该做的是推倒重来:让agent并行尝试很多种做法再收敛到答案,用计算机解决问题的方式而不是复制人类流程。真正拦住企业放手的不是技术能力不够,而是信任——怕agent权限失控、误删生产数据库,这种谨慎Garman认为「可能还挺合理」。
— Matt Garman数据不回流模型厂商,是Bedrock的护城河
Garman重申Bedrock从设计之初就承诺客户数据永远不离开其VPC、不会被模型提供方看到prompt内容,这曾在三年前被外界批评「AWS在AI上动作太慢」。但随着客户从概念验证转向生产部署,这个保守的架构选择反而成了优势——如今OpenAI、Anthropic的工作负载都在往Bedrock上迁移,是因为企业把自己的数据视为最有价值的资产,不愿意交给模型厂商。
— Matt GarmanAWS内部:人管的是agent团队而非代码
在AWS自己的「前沿团队」里,写代码已经不是辅助补全,而是彻底交给agent——工程师的工作变成管理一支agent团队,这让新产品的上线速度发生质变。组织形态也在跟着变:过去一个产品方向配10个人长期守着,现在3到4个人就能做出同样的东西,团队该不该继续做小、更频繁换项目,是AWS正在内部做实验的问题。Garman的结论很克制:人管agent、agent也管人,两种情况会长期并存。
— Matt Garman原话 · 已逐字校验
That's why agentic workflows tend to perform better on AWS than anywhere else.
这就是为什么智能体工作流在AWS上的表现比在其他任何地方都好。
Matt Garman8:11
I saw recently that we say, you know, yes, in some way, shape or form to something like 60% of the requests we eventually get.
我最近看到的数据是,对客户提出的GPU需求,我们最终会以某种形式答应大约60%。
Matt Garman18:17
we recently announced we're going to be buying, you know, 2 million NVIDIA GPUs over the next couple of years
我们最近宣布,未来几年要采购200万块英伟达GPU。
Matt Garman19:21
We're, you know, single digit percentages at the highest and usually it's less than that.
我们(单一客户占比)最高也就是个位数百分比,通常还不到这个数。
Matt Garman21:24
it turns out there's never one constraint. There's always just the latest constraint.
事实证明从来就没有单一的瓶颈,永远只有最新冒出来的那一个。
Matt Garman26:26
We have a guarantee that your data never leaves your VPC.
我们保证客户的数据永远不会离开你的VPC。
Matt Garman44:44
It really is agent first, the agents write all of the code. You're just managing a team of agents and driving that.
现在真的是智能体优先,代码全部由agent来写,你只是在管理并驱动一支agent团队。
Matt Garman52:59
I'll say that agents manage people, people manage agents.
我想说的是,既有agent管人,也有人管agent。
Matt Garman53:59
数字与实体
| 曾为初创公司的客户贡献的AWS营收占比 | 约30%-40% | 4:07 |
| 2026年资本开支 | 2200亿美元 | 16:15 |
| GPU需求满足率 | 约60%的请求最终以某种形式被满足 | 18:17 |
| 未来几年计划采购的NVIDIA GPU数量 | 200万块 | 19:21 |
| Graviton相对其他芯片的成本与性能优势 | 便宜20%,性能高20% | 35:36 |
| 前100大客户中使用Graviton的比例 | 超过90% | 35:36 |
| 数据中心所在县因税收减少的人均金额 | 每人每年少交约5000美元税 | 30:32 |
术语
- FirecrackerFirecracker微虚拟机
- AWS自研的轻量级虚拟化技术,安全隔离强、启动极快,常被agent沙箱厂商使用
- BedrockBedrock
- AWS托管的基础模型服务,承诺客户数据不离开其VPC、不回流给模型厂商
- GravitonGraviton
- AWS自研的ARM架构服务器芯片,主打更低成本与更高性能
- TrainiumTrainium
- AWS自研AI加速芯片,原为训练设计,现大量用于推理
- FDE前沿部署工程师
- AWS派驻客户现场、在数周内教会客户自建评估体系后撤出的技术团队
收听指南
关注超大规模云厂商如何分配GPU产能、自研芯片战略和企业级Agent落地瓶颈的创业者、投资人与技术管理者。
开场关于AWS早期历史和初创公司变化的回顾,信息密度较低,可跳过。