预训练才是主峰:智能本身就是最大的应用
模型公司是炼油厂,值钱的是化工厂和汽车公司;但今天最大的红利是承接研究溢出的智能,而不是做产品拉动的应用。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
预训练结束是最大共识,也是最大非共识
广密认为今天最大的共识是「Pretraining结束了」,但最大的非共识恰恰是「Pretraining空间还非常大,甚至刚开始」。他的判断是:只有Pretraining才能涌现新能力,Post Training和RL只是激发或加强能力,决定模型内在上限。他用一个比喻:在很差的Base Model上做强化学习,就像小学生刷题,很容易饱和见顶;只有Pretraining才能把小学生本质上变成初中生。他判断下一代SOTA模型还是能显著Beat今天的SOTA。
— 广密OpenAI不重视预训练,是组织问题不是战略问题
外界看OpenAI好像没那么重视Pretraining了。广密给了两个原因:一是战略选择,O系列在Benchmark上走得快,两个月刷分收益可能比Pretraining一两年还快,ChatGPT增速也很恐怖,占了管理层很大精力;二是组织问题,OpenAI的Pretraining核心团队一直动荡,最早Anthropic的Daryl带走一批,Elia离开,CTO Mira又带走核心Post Training的人,原来的Pretraining的人不断被调到Post Training。所以不是top down不重视,而是组织调整显得不那么重视。
— 广密Coding是模型的手,也是AGI最好的环境
广密说想明白一件事:Coding可能是实现AGI最好的环境。Coding的意义不在编程本身,而在于现实世界绝大部分任务都可以通过code来表达。他把Coding类比成AlphaGo的棋盘、百度的通用搜索、淘宝的商品搜索环境。Coding是模型的一个手——模型通过生成执行代码,实现对外部环境的采集、处理、反馈。他判断两年以内,Agent能操作电脑和手机这种数字环境,能力绝对超过99%的人,操作人类正常操作99%的行为,而且比人操作得好。
— 广密OpenAI和Anthropic同宗同源,但战略已经分化
广密认为OpenAI和Anthropic最开始路线一样,但走着走着核心战略Bet已经发生很大变化。OpenAI核心Bet是两个:一是希望通过O系列或Resoning Model实现AGI,二是希望ChatGPT做成十多亿活跃用户的K-Lab去先翻Google。Anthropic核心Bet是专注做Pretraining,继续Bet on Pretraining,有一个很强的Base Model,继续Bet on Coding、Bet on Agentic。OpenAI更重视C端市场,Anthropic更重视B端市场;OpenAI是自下而上创新的组织文化,Anthropic是自上而下创新的组织文化。
— 广密智能提升是唯一主线,智能本身就是最大应用
广密把AGI探索比作爬一座科学的高山,最后谁能到珠穆朗玛峰。他反复讲一句话:智能提升是唯一的主线,智能本身就是最大的应用。ChatGPT走到3.5有了通用泛化性,解锁了对话能力;Claude走到3.5 Sonnet解锁了Coding能力,跑出了Cursor;今天大家都在解锁Agent、Agentic。他画出的登山路线图是:ChatGPT只是山脚第一站,后面还有Coding、Coding Agent、General Agent、AI for Science、Robotics。他认为AI for Science科学探索才是那个珠穆朗玛峰——真的攻克癌症,或治疗人类几乎所有疾病。
— 广密机器人数据采集太低效,所以排在Science后面
广密对Robotics态度有变化。从第一性原理看,今天做Robotics的Foundation Model或Research Lab,做法上不够本质。数据上,GPT语言模型有Scaling Law,因为有Common Crawl数据集持续抓互联网数据;但机器人数据采集太低效,人操作几十台设备,每小时成本可能几十上百块,要采集一亿个小时有效数据,可能要几亿美金成本,Scaling Law验证成本很高。算法结构上,今天大家还没达成一致,底层算法到底是哪一个没有共识,还没找到有通用泛化性的架构。他认为未来语言模型的多模态能力强了,从2D世界走向3D世界是比较自然的过程。
— 广密Online Learning可能是下一个范式级路线
广密认为如果未来还有范式级路线,Online Learning可能算一个。核心不是online real time,而是让模型自主地在线探索和学习,很像人类的生存方式——在生存和激励的基础上,有充分的好奇心,一切探索,然后把好的workflow抽象、自动化,形成自己的workflow。目前范式下能想象到的Online Learning,是让模型通过和用户的交互,实时更新更小的参数。但什么情况下更新记忆、更新什么,今天也没有一个reward,模型要达到什么样的目标也没有很好的定义。他说伊利亚在memory和multi agent上研究比较好。
— 广密利润池划分不合理:英伟达拿走80%以上
广密认为今天价值链的利润池划分很不合理。从NVIDIA到AWS到Anthropic到Cursor,NVIDIA几乎拿走了利润的80%以上,AWS拿走了30%,Anthropic是亏的,Cursor也是负毛利的。他判断长期会往后移:AWS的利润起来,然后模型和应用的利润也会起来。他对模型公司的长期价值信心越来越强。他还提到模型训练的经济性:OpenAI几百亿美金的投入,是给全人类提供了一个巨大的技术杠杆,几千个人杠杆了几亿人的生产力,是给今天通胀的世界提供了巨大的通缩力量。
— 广密原话 · 已逐字校验
我觉得coding可能就是模型的一个手吧 你看Manus也给agent搭了个虚拟的电脑环境 agent来操作电脑的工具 就是我觉得两年以内 agent能操作电脑和手机这种数字环境 它的能力是绝对超过99%的人的
Coding可能就是模型的一个手。Manus也给Agent搭了个虚拟的电脑环境,Agent来操作电脑的工具。我觉得两年以内,Agent能操作电脑和手机这种数字环境,它的能力绝对超过99%的人。
广密11:15
我最近脑子里反复讲的就是一句话 就是叫智能提升是唯一的主线 智能本身就是最大的应用 所以我们还是要围绕智能本身去投入和思考
我最近脑子里反复讲的就是一句话:智能提升是唯一的主线,智能本身就是最大的应用。所以我们还是要围绕智能本身去投入和思考。
广密30:31
我觉得组织和文化的竞争力 是仅次于算力的核心竞争力
组织和文化的竞争力,是仅次于算力的核心竞争力。
广密1:42:38
我觉得科技投资不是混 能混出来的 很多VC Investor 其实喜欢混圈子 我觉得其实混圈子 没有意义 我觉得天花板是很低的 我觉得还是得靠创造
科技投资不是靠混能混出来的。很多VC Investor喜欢混圈子,混圈子没有意义,天花板很低。还是得靠创造。
广密1:55:52
数字与实体
| Cursor 的 AR 命令数 | 超过 150 个,年底可能 4 到 500 个 | 16:19 |
| Manus 平均一个任务消耗 Token | 七八十万个 | 46:40 |
| Anthropic 最新估值 | 615 亿美金 | 1:39:34 |
| Mira 新公司估值 | 100 亿 | 1:39:34 |
| Elia 公司估值 | 310 亿 | 1:39:34 |
| OpenAI 融资额 | 400 亿美金 | 1:23:15 |
术语
- Pretraining预训练
- 决定模型内在上限、能涌现新能力的训练阶段。
- Post Training后训练
- 在预训练之后对模型进行加强和激发的训练阶段。
- RL强化学习
- 通过奖励信号加强模型能力,但不涌现新能力。
- Tool Use工具调用
- 模型调用外部工具完成任务的能力,Agent 的关键能力之一。
- Long Context长上下文
- 模型一次能处理很长的序列信息,Agent 多步骤任务的关键。
- Online Learning在线学习
- 让模型自主在线探索和学习,可能是下一个范式级路线。
收听指南
关注全球大模型格局的创业者、投资人和工程师;想理解预训练与 Agent 路线分歧、以及模型公司竞争判断的人。
1:54:32 之后的中美格局与全球化讨论,信息密度较低。