世界太吵,来原声听播客

a16z

AI 的瓶颈不在模型,在铜矿和变压器

模型不再是瓶颈,瓶颈全在模型「南边」:芯片、内存、供电、冷却,一路延伸到铜矿。需求无限而供给被物理和监管卡死,资本第一次能直接换成算力。

算力数据中心能源芯片硬件创业

原视频在 YouTube 上放不出来,用音频听:

a16z 新基金 Machine H Fund 的路演:把 AI 基础设施从芯片讲到铜矿、变压器和电工短缺,机制和数字密集,后半段比前半段值钱。

核心论点 · 点时间戳可跳到原声

2:03

瓶颈已经跑到模型南边去了

Ben 说这是史上最重要的技术,所以需要一整套全新基础设施:不只是新芯片、新系统软件,还要新的供电方式,甚至要替换铜。Ragu 补了关键判断:过去三年模型能力稳步上升,模型不再是瓶颈,瓶颈是「模型南边的一切」。Martin 用创始人流向佐证——以前顶级创始人的硬件项目大概只占 5% 甚至 3%,现在超过 20% 到 30%。创始人群体比 VC 群体聪明得多,他们已经先一步认定这是创新活跃区。

— Ben Horowitz / Ragul Raguram / Martin Casado
5:04

需求无限,所以只担心毛利

判断需求是否真超过供给,Ragu 给了两个信号:一是最懂需求的人在下巨额采购单,hyperscaler 今年 capex 约 7000 亿美元,明年据说合计要冲到 1 万亿;二是他们能看到来自前沿实验室、AI 数据公司、企业、美国及国际各地的需求。Martin 补了一个反常的机制:正常生意你担心增长,AI 因为需求无限、增长无限,你担心的是公司毛利,也就是效率。而很多效率问题本质是硬件的物理限制——现有系统不是为 AI 工作负载建的。

— Ragul Raguram / Martin Casado
6:06

芯片价格居然在涨

Martin 说这是从未见过的信号:芯片价格从来都是往下走的,价格曲线先这样再回到这样,而现在价格在涨。供给端基本全部订到 2028 年,甚至出现过几千块 GPU 的多日拍卖。他还给了需求端的双重扩张:一是单位工作消耗的 token 在暴涨,聊天或 agent 从 100 token 变成几千 token;二是使用人数会从开发者扩展到所有知识工作者及更远。对比互联网时代,当时铺下去的大部分是投机性的暗光纤,而今天每一块造出来的 GPU 都已经预售出去了。

— Martin Casado
9:14

服务器里的内存能付云迁移的钱

Martin 讲了一个 CFO 的轶事:一家大型上市公司历史上非常抗拒上云,攒了很多服务器。做库存盘点时发现,服务器里的内存涨了这么多,卖掉它足以支付整个上云的迁移费用。Ragu 接着给出更硬的数字:在 Hot Chips 上,领先的内存厂商说,光是今天手里的需求,就要用三年产能来满足——这还只是今天的需求,不是未来需求。Martin 的总结是:电、冷却、内存、GPU,你说得出名字的,我们都缺。

— Martin Casado / Ragul Raguram
15:20

钱第一次能直接变成算力

Martin 说过去建东西是工程问题,可以往里面砸工程师,但受工程物理约束,这就是《人月神话》的由来;现在更像资源限制——把钱倒进系统,系统产出结果,瓶颈是系统匹配投入资源的能力。Ben 把这条推到组织层面:创业世界过去都知道,我有两年领先,你雇一千个工程师来追,只会把公司搞垮,九个人不能一个月生出一个孩子;但现在这招管用了,不是雇十万人,而是拿三十亿美元点亮一个宏大集群,Grok 或 Kimi 就可能突然冒出来。所有人都还在心理上适应这件事。

— Martin Casado / Ben Horowitz
26:49

为一个模型单独造 ASIC 开始划算

Martin 给了一个心智模型:今天训一个前沿模型要 30 到 50 亿美元,推理至少要还回这个数,假设两倍就是 100 亿美元。如果你能在推理上省 20% 效率,那就是 20 亿美元,而 20 亿美元足够造一颗 ASIC。所以行业第一次到了「为一个模型单独造 ASIC」也划算的节点。而且和传统软件不同,模型权重是固定的,没有那么多状态和动态。他不确定世界会不会走向 per model ASIC,但这个模型解释了架构为什么会越来越为这些巨额资本投入定制。

— Martin Casado
28:52

机架功率把交流电逼出局

机架功率从大约 5 到 10 千瓦走向 100 到 250 千瓦,计算密度上升约 70 倍,冷却从风冷变成必须液冷。Martin 说到了这个功率级别,交流电不再可用,必须转直流——而直流本身也需要冷却,而且极其危险,讽刺的是当年爱迪生正是靠演示交流电有多危险来推销直流。此外还有政治环境:液冷不够,得是环保液冷;有电不够,得是给社会贡献电而不是抽走电。约 10% 的数据中心在浪费大量水,做电力的寄生虫,这些都会结束。

— Martin Casado
31:22

只有 2% 的电工懂直流电

Martin 说数据中心的建筑方式已经彻底过时:机架这么密,地板承重、隔音墙都要重做,否则会扰民,没有哪个州会允许。他还点出一个被忽略的涨价项——除了内存价格,涨得最快的领域之一是钢筋混凝土。更硬的约束是人:数据中心里 800 伏的电压极其危险,而美国只有 2% 的电气工程师或电工有直流电认证。Meta 有免费培训项目在补人,但这也说明 AI 在抢工作的同时会造出很多新电工。

— Martin Casado
33:31

2028 年电力缺口对不上

到 2028 年,新数据中心需要约 44 吉瓦的额外电力,而电网预计只新增约 25 吉瓦。Martin 解释吉瓦有多大:他长大的 Flagstaff 有四五万人,用电不到一个吉瓦,所以一个吉瓦基本能点亮并空调一整个城镇。为什么公用事业和 hyperscaler 不能建快点?需要人施工、需要许可、需要能插进去的电,还要自己建电厂,而变压器和涡轮机都短缺。这不是软件问题,不是让工程师周末加班就能解决的。

— Martin Casado
36:33

美国禁数据中心,把机会送出国

Martin 说情况已经糟到新公司要拿 GPU 常常得去墨西哥或澳大利亚,因为在美国太难。这等于用禁止数据中心的方式,把就业和长期经济机会送给别的国家。他给出的标准是:数据中心应当回馈社区——电更好、没噪音、没水问题、还能增加就业,然后所有人都按这个标准来。他举了已经做到的例子:有的数据中心自供电,白天给州里送电,晚上州里不需要时再借电,因为电厂始终在按峰值容量发电,而数据中心昼夜稳定,城市白天高夜里低,这是共生关系。

— Martin Casado
38:35

不该叫 AI,该叫机器智能

Martin 解释基金为什么叫 Machine Age:第一,AI 是错的名字,应该叫机器智能。因为这不是人类思考的方式——它是对人类思考的缓存、人类思想的集合;到今天我们还不知道怎么让一个没有知识的 AI 从零重建语言。第二,AI 这个正式术语在计算机科学里已经用了 70 年,还背着科幻和 Bostrom 那类包袱。第三,要强调 machine 那一半:软件吞噬世界的人最终来到一个地方——你把钱倒进去,却被下面的真实机器卡住。

— Martin Casado
40:41

英伟达不会去捡银砖

面对「新公司还能不能切进来」的问题,Ragu 说想要 tokens per second per dollar、tokens per watt、tokens per rack 这些指标 10 倍提升,就必须有新创新,而新创新传统上来自创始人从第一性原理出发、用不同方式解题。Martin 补了市场规律:现有芯片巨头市值几万亿美元,哪怕只切 5% 也是巨大的私营公司;英伟达不是不能做,而是它盯的是贡献同样增长的 90%。他引 Alex Rampell 的故事:Dan Rose 说你能捡很多银砖,但我金砖多到捡不完,所以我看都不会看银砖。

— Ragul Raguram / Martin Casado
46:59

这些创始人必须是系统创始人

Ragu 说这类创始人和软件创始人不同:不能只是研究员或优秀计算机科学家,必须能架构和设计芯片或系统,还要想清楚怎么制造、谁来供应,以及一整套下游环节。最好的创始人像 Jensen 那样,在设计芯片之前就把整个生态想清楚。Martin 补了两个环境变化:一是实验室太缺货,愿意在硬件还没出来时就签单,所以早期就有信号;二是资本供给宽松,后续轮有大量资金。他还说这类公司第一轮就是几亿美元级别,钱在产品之前就大量投入。

— Ragul Raguram / Martin Casado
48:00

年轻创始人变少是因为供应链

针对「年轻创始人是不是变少了」,Martin 说如果做的东西供应链复杂、要制造、技术复杂,经验就有帮助。Elon 和 Travis 年轻时做的也是软件公司,连最好的创始人都需要先积累建公司、建技术的经验,才毕业到更复杂、更多活动部件的领域。一边是 Michael 这样很年轻、很聪明的人,但他做的是纯软件 AI;另一边是 Elon 或 Travis 这样有足够经验的人。他还说这个领域被整个行业和学术界冷落了 20 年,不是增长区,所以有经验的人本来就少。

— Martin Casado

原话 · 已逐字校验

Here, it goes all the way down to the copper mine. That's how widespread this thing is going to be.

在这里,它一路延伸到铜矿。这件事的波及面就是这么大。

Martin Casado3:04

Like we've never seen prices go like up on chips. If the prices went down, they always go down.

我们从没见过芯片价格往上走。价格从来都是往下走的,永远往下走。

Martin Casado6:06

the leading memory runner said the demand they have today will take them three years of capacity

领先的内存厂商说,他们今天手里的需求就要用掉三年产能。

Martin Casado9:14

This, there's nothing between the money going in and then the hardware, you know, creating intelligence.

而在这里,钱投进去和硬件产出智能之间,什么都没有。

Martin Casado16:22

Nine women can't have a baby in a month. Like that's it. Like that never works. Okay. Now that works.

九个女人也没法一个月生出一个孩子。就是这样,这从来行不通。好,现在它行得通了。

Ben Horowitz17:32

Only 2% of electrical engineers or electricians in the U.S. have been certified on DC power.

美国只有 2% 的电气工程师或电工拿到了直流电认证。

Martin Casado31:22

Artificial intelligence was the wrong word. Like we shouldn't have called it, it's machine intelligence.

人工智能是个错的名字。我们本不该这么叫,它是机器智能。

Martin Casado38:35

It sounds like you can collect a lot of silver bricks. But I'm like, I have so many gold bricks, I can't even pick them all up.

听起来你能捡很多银砖。但我的情况是,我的金砖多到都捡不完。

Martin Casado41:42

数字与实体

hyperscaler 今年 capex约 7000 亿美元5:04
供给预订情况基本全部订到 2028 年6:06
token 需求年增速预期接近 1000%12:16
开发者数量约 3000 万17:32
训练前沿模型成本30 到 50 亿美元26:49
计算密度提升约 70 倍28:52
2028 年数据中心电力缺口需约 44 吉瓦,电网预计新增约 25 吉瓦33:31

术语

hyperscaler超大规模云厂商
指自建超大规模数据中心的云巨头,如 AWS、微软、谷歌等。
ASIC专用集成电路
为特定任务定制的芯片,相比通用 GPU 更省电但只做一件事。
per model ASIC按模型定制芯片
为某一个固定权重的模型单独设计一颗芯片,而非通用加速器。
dark fiber暗光纤
互联网泡沫时期铺好却从未点亮使用的冗余光纤。
Mythical Man Month人月神话
软件工程经典论断:向延期的项目加人只会让它更晚。

收听指南

谁该听

关注 AI 基础设施、算力供应链、数据中心与能源投资的创业者和投资人,以及想理解硬件创业为何重新变热的技术负责人。

可跳过

结尾 52:00 后的基金团队介绍和免责声明可跳过。