世界太吵,来原声听播客

张小珺·商业访谈录

AGI 是马拉松:物理硬件成了最大瓶颈

去年以为加 GPU 加数据就能到 AGI,今年发现单数据中心加到 3.2 万卡就撞墙,美国能源基建还是四五十年前规划的——AGI 时间表被物理世界拖长了。

AGI算力大基建Scaling Law机器人
一位一线投资人把算力、能源、模型、产品、结盟串成一张 AGI 大基建地图,数字密度高,适合想快速校准判断的人。

核心论点 · 点时间戳可跳到原声

6:32

AGI 从百米冲刺变成马拉松

去年初大家觉得 AGI 是百米冲刺,都没做好准备;今年变成马拉松,都有充足时间准备。变化来自一个具体发现:去年以为可以无限加 GPU 加数据就能到 AGI,但突然发现 GPU 的数据中心和物理硬件是很大的瓶颈——单体数据中心现在加到 3.2 万卡,再往上就要突破很多;美国能源基建是四五十年前规划的,能源结构也大不相同,突然新增很多用电量确实跟不上。所以今年最大的感受是物理硬件成为阻碍 AGI 时间表的最大因素。

— 李广密
23:41

经济社会突然被加了两道税

一个判断是:模型公司可能是价值沉淀最厚的地方,就像移动互联网的价值沉淀在设备厂商和广告平台。于是出现两道税——老黄的 GPU 收算力税,模型收智能税,突然给经济社会加了两道税。但李广密也给出反方说法:如果大模型是电,灯泡不一定由电厂做出来。他更倾向于大模型公司是一个基础发现的 research lab,有的 lab 有商业能力会做出头部应用,但这比较考验组织能力。

— 李广密
26:34

GPT-4 的入场券是三亿美金

把训练成本拆成电和卡:假设 GPT-3.5 用 500 张 H100 训练 15 天,约 25 万度电,是三峡或上海用电量的 0.05%;GPT-4 用 8000 张 H100 训练 100 天,约 2600 万度电,是三峡或上海一天用电量的 5%、德州的 2%;GPT-5 若用 3.2 万张 H100 训练 100 天,约是三峡或上海一天用电量的 20%。钱上:每张 H100 售价 3 万美金,加周边设备,8000 卡就是三亿多美金——三亿美金是 GPT-4 的入场券;3.2 万卡集群意味着 12 到 13 亿美金。

— 李广密
28:28

万卡集群的瓶颈不在钱上

万卡集群是标配,但有钱也不够。每张卡都要连起来,互联难度很大,网络拓扑结构不是一层而是三层。影响难度的因素包括:找到适合 GPU 数据中心的土地、稳定且便宜的电力、数据中心的互联通信、降温运维的可靠性。资源越来越集中收敛,能建大集群的客户很少,会收敛到只有四五家大客户。物理世界的东西比数字世界改造得慢。

— 李广密
40:38

Scaling Law 没减速,是算力没怼够

GPT-4 公开的是 1.8T 参数、MOE 架构、约 13T 数据、2.5 万张 A100 训练 100 天。假设下一代三倍参数三倍数据就是 9 倍 compute,老黄公布的 3.2 万张 H100 集群加上优化效率提升刚好匹配;想 10 倍参数 10 倍数据就是 100 倍 compute,明显不够用。结论是 Scaling Law 没有减速,如果说变慢了,就是算力和数据没怼够——GPT-3.5 到 GPT-4 大概用了二三十倍算力提升,GPT-4 走向下一代今天还没怼够二三十倍有效算力。

— 李广密
45:43

今年必须超过 GPT-4,否则出局

2024 年是大模型公司的收敛之年。技术上的生死线是今年内必须超过 GPT-4,背后需要一个很强的团队;二三线模型公司包括国内的,得超过最好的开源模型,不然商业价值也比较小。算力上今年必须用上万卡集群,而能做好万卡集群的公司还是比较少的。未来 12 个月就看能不能有 10 万张 H100 集群,大概三五十亿美金投入。全球最后能留下的:美国可能是 OpenAI、Anthropic、Google、马斯克的 xAI 四家;欧洲 Mistral 不错但不确定欧洲是不是独立市场。

— 李广密
57:40

OpenAI 做产品是被逼出来的

对 OpenAI 的新认知有三点:AGI 时间表可能拉长;AGI 公司一开始不应该太激进做产品,但 OpenAI 现在很激进;开始理解渐进式解锁。为什么激进做应用?李广密猜:如果 AGI 有 10 年,每年都需要几个币甚至 10 个币的投入,就需要商业化,需要持续健康的现金流来支持 AGI,纯靠融资很难融到那么多钱,也不能只依赖微软。他还判断 OpenAI 在 2B 企业侧更难,因为企业客户讲信任,而微软在企业客户信任太深,OpenAI 的 2B 价值可能被微软拿掉很大一部分。

— 李广密
1:07:20

硅谷 VC 三大件:coding、agent、机器人

硅谷 VC 今年的投资主题是三大件:coding、agent 和机器人。但李广密对三大件都有怀疑:coding 一定在大模型公司和微软的核心射程以内,核心能力来自模型公司,这些 coding 创业公司不会自己训大模型,不确定上面优化层的价值有多大;模型公司可能会很激进地做 agent,因为附加值高,是模型级能力、模型级应用、模型级 agent。他倾向于短期价值还是沉淀在模型本身。机器人则是很多 researcher 创业的首选,因为比较容易讲故事。

— 李广密

原话 · 已逐字校验

今年最大的一个感受就是 物理硬件成为阻碍AGI的一个时间表的最大因素了

今年最大的一个感受就是,物理硬件成为阻碍 AGI 时间表的最大因素了。

李广密6:45

就一个是老黄的GPU收税 对吧 一个是模型收一个智能税 突然给经济社会又加了两道税吧

一个是老黄的 GPU 收税,一个是模型收一个智能税,突然给经济社会又加了两道税。

李广密23:41

它的平均不在钱上 对 万卡集群这个是个 嗯 标配 标配 它是有钱是不够的 很难的

它的瓶颈不在钱上。万卡集群是个标配,有钱是不够的,很难的。

李广密28:28

就是人的预期可以飞得很快 但是物理世界我觉得是跟不上的

人的预期可以飞得很快,但物理世界是跟不上的。

李广密32:34

如果非要说一个结论 我觉得Skill up是没有减速的 如果说变慢了 我觉得就是算力和数据没对够

如果非要说一个结论,我觉得 Scaling Law 是没有减速的;如果说变慢了,我觉得就是算力和数据没怼够。

李广密41:40

探机肉身 还是有很多局限的 你比如说 相比大猛星来讲 人的吞吐量是有限的 记忆也是比较短的 也没办法长时间工作 精力也有问题

碳基肉身还是有很多局限的。相比大模型来讲,人的吞吐量是有限的,记忆也比较短,没办法长时间工作,精力也有问题。

李广密1:15:47

人类又多了两个 收税的人类基石公司 一个是芯片算力水 一个是模型智能水

人类又多了两个收税的人类基石公司,一个是芯片算力税,一个是模型智能税。

李广密1:20:09

数字与实体

单体数据中心卡数3.2 万卡6:32
GPT-3.5 训练用电约 25 万度电(500 张 H100 训练 15 天)26:34
H100 售价每张 3 万美金27:28
GPT-4 入场券3 亿美金27:28
微软对 OpenAI 投资130 亿美金30:33
英伟达 GPU 年出货量今年可能 400 万片30:33

术语

Scaling Law规模定律
模型能力随参数、数据、算力规模增长而提升的规律。
Agent智能体
能自主调用工具、完成多步任务的模型应用形态。
主权 AI主权 AI
各国政府用国防等预算采购 GPU 建本国 AI 能力。
T5TT5T
英伟达内部每双周由每个大组发出最重要的五件事的习惯。
Killer App杀手级应用
能带来大规模用户和收入、定义平台价值的应用。

收听指南

谁该听

关注 AGI 进展的创业者、投资人和工程师,想用一集时间校准算力、能源、模型与产品判断的人。

可跳过

1:15:47 之后关于碳基硅基的闲聊可跳过。