AWS故意不把GPU全賣給頭部模型公司,專留配額給初創企業
AWS營收裡30%到40%來自曾經的初創公司,這是Garman解釋為何即便算力緊缺、本可一天賣光給大模型實驗室,也要刻意為小公司留GPU配額的理由。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
今天的初創公司是明天的大客戶
AWS成立之初做過內部調研,結論是最該服務的客戶是初創公司。Garman說如今AWS營收裡有30%到40%來自曾經的初創企業,這是AWS即便算力緊張也要刻意為小公司留配額的商業邏輯——不是做慈善,而是因為今天兩三個人的團隊,可能就是未來願意為性能多付錢的大銀行、大政府客戶的雛形,也是AWS反過來向大客戶學習新需求的來源。
— Matt Garman寧可少賺,也要給初創公司留配額
Garman承認AWS本可以把每一塊GPU都賣給頭部大模型實驗室,一天之內賣光,但公司刻意不這樣做,為了維持整個生態的健康。據他透露,對客戶提出的GPU需求,AWS最終會以某種形式答應大約60%(有時換個區域、換個配置、晚一點交付)。與此同時,AWS宣布未來幾年要採購200萬塊英偉達GPU,是目前已知規模最大的單項算力擴充。
— Matt Garman客戶集中度是AWS對抗泡沫論的底氣
面對「AI是不是泡沫」的提問,Garman給出的回應是集中度數據:一些NeoCloud把30%到60%的產能捆綁給一兩個大客戶,AWS在單一客戶上的佔比最高也就是個位數百分比,通常還更低。他的邏輯是,即便部分十億美元估值的初創公司最終跑不出來,AWS大部分算力收入來自已經驗證出正向投資回報的生產級工作負載,這部分需求不會因為某幾家公司倒下而消失。
— Matt Garman瓶頸永遠在移動,從不會被徹底解決
Garman提到大學時讀過《目標》這本書,給他的啟發是從來沒有單一瓶頸,只有當下最新的那一個。這個月是電力不夠,下個月可能變成內存、台積電產能、HBM或網絡組件,甚至某個連接器斷供。他還提到十多年前泰國洪水導致全球硬盤短缺的舊案例,說明AWS早就把供應鏈管理做到四五層供應商之外,逐個追蹤成千上萬個零部件,哪個緊俏就補哪個。
— Matt Garman自研芯片的起點是虛擬化稅,不是AI熱潮
Trainium和Graviton的故事並非始於AI,而是十三四年前客戶抱怨「虛擬化稅」、想要裸金屬級別的性能。AWS先把網絡虛擬化卸載到一塊offload卡上,再收購做ARM核心卡的Annapurna團隊,把存儲虛擬化也卸載掉,順帶做出了Graviton。如今Graviton比同類產品便宜20%、性能還高20%,前100大客戶裡超過90%在用。Trainium走的是同一條「先驗證後做大」路徑,第三代已經賣到明年年底,而且Garman承認取名失敗——叫「訓練」的芯片,如今跑推理的客戶反而更多。
— Matt Garman企業的agent大多還不敢自主
Garman觀察到,目前企業部署的agent大多簡單、非自主,仍然有人在環節裡把關。他認為企業常犯的錯誤是直接把人類的五個步驟原樣交給agent去做,而真正該做的是推倒重來:讓agent並行嘗試很多種做法再收斂到答案,用計算機解決問題的方式而不是複製人類流程。真正攔住企業放手的不是技術能力不夠,而是信任——怕agent權限失控、誤刪生產數據庫,這種謹慎Garman認為「可能還挺合理」。
— Matt Garman數據不迴流模型廠商,是Bedrock的護城河
Garman重申Bedrock從設計之初就承諾客戶數據永遠不離開其VPC、不會被模型提供方看到prompt內容,這曾在三年前被外界批評「AWS在AI上動作太慢」。但隨著客戶從概念驗證轉向生產部署,這個保守的架構選擇反而成了優勢——如今OpenAI、Anthropic的工作負載都在往Bedrock上遷移,是因為企業把自己的數據視為最有價值的資產,不願意交給模型廠商。
— Matt GarmanAWS內部:人管的是agent團隊而非代碼
在AWS自己的「前沿團隊」裡,寫代碼已經不是輔助補全,而是徹底交給agent——工程師的工作變成管理一支agent團隊,這讓新產品的上線速度發生質變。組織形態也在跟著變:過去一個產品方向配10個人長期守著,現在3到4個人就能做出同樣的東西,團隊該不該繼續做小、更頻繁換項目,是AWS正在內部做實驗的問題。Garman的結論很剋制:人管agent、agent也管人,兩種情況會長期並存。
— Matt Garman原話 · 已逐字校驗
That's why agentic workflows tend to perform better on AWS than anywhere else.
這就是為什麼智能體工作流在AWS上的表現比在其他任何地方都好。
Matt Garman8:11
I saw recently that we say, you know, yes, in some way, shape or form to something like 60% of the requests we eventually get.
我最近看到的數據是,對客戶提出的GPU需求,我們最終會以某種形式答應大約60%。
Matt Garman18:17
we recently announced we're going to be buying, you know, 2 million NVIDIA GPUs over the next couple of years
我們最近宣布,未來幾年要採購200萬塊英偉達GPU。
Matt Garman19:21
We're, you know, single digit percentages at the highest and usually it's less than that.
我們(單一客戶佔比)最高也就是個位數百分比,通常還不到這個數。
Matt Garman21:24
it turns out there's never one constraint. There's always just the latest constraint.
事實證明從來就沒有單一的瓶頸,永遠只有最新冒出來的那一個。
Matt Garman26:26
We have a guarantee that your data never leaves your VPC.
我們保證客戶的數據永遠不會離開你的VPC。
Matt Garman44:44
It really is agent first, the agents write all of the code. You're just managing a team of agents and driving that.
現在真的是智能體優先,代碼全部由agent來寫,你只是在管理並驅動一支agent團隊。
Matt Garman52:59
I'll say that agents manage people, people manage agents.
我想說的是,既有agent管人,也有人管agent。
Matt Garman53:59
數字與實體
| 曾為初創公司的客戶貢獻的AWS營收佔比 | 約30%-40% | 4:07 |
| 2026年資本開支 | 2200億美元 | 16:15 |
| GPU需求滿足率 | 約60%的請求最終以某種形式被滿足 | 18:17 |
| 未來幾年計劃採購的NVIDIA GPU數量 | 200萬塊 | 19:21 |
| Graviton相對其他芯片的成本與性能優勢 | 便宜20%,性能高20% | 35:36 |
| 前100大客戶中使用Graviton的比例 | 超過90% | 35:36 |
| 數據中心所在縣因稅收減少的人均金額 | 每人每年少交約5000美元稅 | 30:32 |
術語
- FirecrackerFirecracker微虛擬機
- AWS自研的輕量級虛擬化技術,安全隔離強、啟動極快,常被agent沙箱廠商使用
- BedrockBedrock
- AWS託管的基礎模型服務,承諾客戶數據不離開其VPC、不迴流給模型廠商
- GravitonGraviton
- AWS自研的ARM架構服務器芯片,主打更低成本與更高性能
- TrainiumTrainium
- AWS自研AI加速芯片,原為訓練設計,現大量用於推理
- FDE前沿部署工程師
- AWS派駐客戶現場、在數週內教會客戶自建評估體系後撤出的技術團隊
收聽指南
關注超大規模雲廠商如何分配GPU產能、自研芯片戰略和企業級Agent落地瓶頸的創業者、投資人與技術管理者。
開場關於AWS早期歷史和初創公司變化的回顧,信息密度較低,可跳過。