复刻 GPT-4 的只有三家,2024 年窗口就关了
全球只有 OpenAI、Anthropic、Google 做出了 GPT-4 水平的模型,而 2024 年跑完基本决定长期格局——未来 12 个月追不上去,后面再翻转很难。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
核心 secret 只有一个:数据和 tokenizer
被问到 OpenAI、Anthropic、Google 三家最核心的 secret 是什么,回答是短期看数据——预训练数据的配比、tokenizer 怎么做;如果只留一个能力,就是 reasoning 推理能力。这个判断把「模型竞赛」从算力叙事拉回到数据工程:全球真正知道 GPT-4 数据 secret 的只有两三百人,几乎都在前几家模型公司,其他公司想搞清楚至少要做几百次、几千次充足实验,小几万张卡是必要条件。
— 李广密复刻 GPT-4 的决赛圈只有三家
把复刻 GPT-4 当作进入决赛圈的门槛,全球范围只有 OpenAI、Anthropic、Google 三家做出了 GPT-4 水平的模型。时间线上:OpenAI 是一年前做出 GPT-4,Anthropic 是半年前,Google 是下个月才能 deliver,全球其他团队可能还需要 6 到 12 个月。Google 举全公司之力搞了一年也才勉强接近。高潜黑马点了三家:马斯克的 XAI、Transformer 核心贡献者 Norm 做的 Character、以及 Bidance。
— 李广密能做大模型的天才只有两三百人
大模型的人才壁垒极高,全球范围真能对大模型有实际大贡献的天才 researcher 可能就两三百人,其中一百多人在 OpenAI,二三十人在 Google,Meta、AWS、NVIDIA 可能没有。而且聚集效应很强——这种人和这种文化非常重要,所以没那么看好其他巨头自身能做好大模型。判断标准不是 CEO,而是这家模型公司至少有一个天才科学家:OpenAI 有 Ilya,Anthropic 有 Dario,Runway、Ideogram、Pika Labs 的 CTO 也都是各自方向上的关键人物。
— 李广密下一代训练成本会从两三亿跳到十亿
如果 Claude 3 和 GPT-4.5 的训练成本是 2 到 3 亿美元,那再往后 2025、2026 年下一代的模型训练成本至少可能是 10 亿美元,甚至 30 到 50 亿美元。训练成本分两块:四分之三花在实验(小尺寸模型反复试错),四分之一花在最终那次大训练——像一次火箭发射。GPT-4 当年公开的 rumor 是 2.2 万张 A100 训练 100 天,纯大训练成本差不多 8000 万美金,但最大的成本是前期实验。700 亿参数是个分界点,以下能容忍很多错误,以上每往上扩,训练难度指数级提升。
— 李广密2024 年跑完,格局就定了
2024 年跑完基本决定大概的格局,窗口可能就是未来 12 个月,如果未来 12 个月追不上去,后面再翻转很难。最理想化的格局是很可能只剩一家——最领先的模型又最便宜,没有理由用第二家;但因为阵营抗衡,实际可能两到三家。阵营划分:微软和 OpenAI 一派,亚马逊和 Google 一起支持 Anthropic 一派,Google 自成一派,Apple 和 Tesla 代表终端一派。Meta 不一定是大模型公司,它是一个用 AI 做好自身业务的公司。
— 李广密成本是被忽视的隐形竞争力
大模型往后走有两条主线:明线是智能 capability 提升,每提升一部分就解锁一些新应用;隐线是成本下降,模型训练成本过去 18 个月降了 4 到 5 倍,推理成本过去 18 个月降了得有 10 倍,再优化两三轮问题不大。这两条主线决定 AI native 应用大爆发的幅度。成本降低的核心是工程问题——GPU 利用率、架构优化、精度调节。如果能把成本做得极低、模型还不输,这就是极强的核心竞争力,非常像芯片,头部公司身上已经看到了一定的规模效应。
— 李广密模型公司八成以上会被收购
硅谷的模型公司今天更像一个 research lab,除了 ChatGPT 意外的爆红以外,商业模式还是不清楚的。即便硅谷的大模型公司独立 IPO 可能也很难,80% 到 90% 大概率还是被收购,所以大模型公司还是要抱大腿。硅谷 VC 几乎都错过了大模型投资,就像他们也错过了 Tesla 和 SpaceX——这是两个产品不 match 的问题:大模型这种高风险、高投入、看不清商业模式的公司,不符合 VC 这个金融产品的典型投资。
— 李广密ChatGPT 看不到网络效应和数据飞轮
互联网讲究网络效应、数据飞轮、规模效应,但大模型和 AI 今天好像还看不到这些。ChatGPT 可能更像一个消费品,它只知道一些用户 query 的分布,能更好地指导训练、哪些数据重要哪些不重要,也可以 distill 去做一些小模型满足头部 query,但还不像数据飞轮、网络效应很强的产品。移动互联网时代最核心的是全球多出了四五十亿用户、手机上能采集更多数据做机器学习和推荐;这一波最隐形的一个核心竞争力可能是成本。
— 李广密年初低估了 GPT-4 难度,高估了应用速度
复盘这一年,年初低估了做到 GPT-4 的难度,高估了应用大爆发的速度。今天真正 AI native 的产品还是太少,就头部那几家——ChatGPT、Character、Perplexity,还得再等个一两代的模型,会有更多 native 的产品出来。企业级探索大模型的 use case 现在成功的还不多,只有微软和 Adobe 比较激进。大模型今天还在早期,很像芯片:要等芯片的能力和成本再迭代个两三代,上面的消费电子才会慢慢爆发。
— 李广密AI 创造的增量 GDP 是互联网的 5 到 10 倍
对未来 20 年的推演:AI 创造的直接增量 GDP 可能是比互联网过去 20 年创造的增量 GDP 要大个 5 到 10 倍。算账方式是——如果这一波 AI 替代 10 亿白领,每个白领年薪 3 到 5 万美元,这就是 30 到 50 万亿美元的 market size;如果全球 GDP 翻倍,从今天的 96 万亿美元变成 200 万亿美元,增加 100 万亿,AI 切 10% 到 20% 就是 10 到 20 万亿美元的 revenue,再乘以 10 的 multiple,会诞生很多大公司。另外数据中心用电量今天占人类总能源的 2% 到 3%,未来涨到 10% 到 20% 可预见性也蛮高。
— 李广密原话 · 已逐字校验
所以我觉得大模型今天是人类 一个千亿美金的BET
所以我觉得大模型今天是人类一个千亿美金的 BET。
李广密45:35
大家都把chatGPT和character当应用 我觉得这就是噪音 其实它两个是模型公司
大家都把 ChatGPT 和 Character 当应用,我觉得这就是噪音,其实它两个是模型公司。
李广密1:26:05
乔布斯和马斯克 好像在硅谷没有朋友 但Sam在硅谷所有人都是朋友
乔布斯和马斯克好像在硅谷没有朋友,但 Sam 在硅谷所有人都是朋友。
李广密1:28:07
当你看到硅谷那么牛逼的公司 那么天才的科学家都一往无前很相信 我觉得从他们的眼睛里是看到了光和希望吧
当你看到硅谷那么牛逼的公司、那么天才的科学家都一往无前很相信,我觉得从他们的眼睛里是看到了光和希望吧。
李广密1:30:07
数字与实体
| OpenAI 年化收入 | 十多亿美元,明年可能五六十亿美元 | 12:09 |
| ChatGPT 稳定 MAU | 两个多亿 | 4:04 |
| ChatGPT 占 Chat 流量 | 百分之七八十 | 12:09 |
| GPT-4 训练规模 | 2.2 万张 A100 训练 100 天 | 40:33 |
| 模型训练成本降幅 | 过去 18 个月降了 4 到 5 倍 | 38:31 |
| 模型推理成本降幅 | 过去 18 个月降了得有 10 倍 | 38:31 |
| 全球大模型投入 | 未来几年三到五年至少要花一千亿美金 | 44:35 |
术语
- Scaling Law规模定律
- 模型能力随参数量、数据、算力扩大而提升的经验规律,目前还没有理论支撑。
- Tokenizer分词器
- 把文本切成模型可处理单元的方法,直接影响训练效果。
- MoE混合专家
- 一种模型架构,由 Norm 提出,让不同专家网络处理不同输入。
- Diffusion Model扩散模型
- 图像生成主流方案,加时间维度后可做视频生成。
- AI nativeAI 原生
- 从模型能力出发设计的产品,而非在旧产品上叠加 AI 功能。
收听指南
关注大模型赛道判断的创业者、投资人和工程师,尤其是想搞清楚 2024 年格局窗口、模型公司终局和成本曲线的人。
1:15:00 到 1:17:00 聊车企和自动驾驶,与主线关系较弱。