世界太吵,来原声听播客

张小珺·商业访谈录

李想:通用 agent 五年内不会出现,只会先有 agentOS

李想判断通用 agent 五年内不会出现,真正会出现的是 agentOS——各专业在上面开发自己的专业 agent。因为生产工具必须能行动、能替代专业工作,而不是给个建议。

自动驾驶VLAAgentOS组织管理世界模型
李想罕见地把 VLA 训练全流程、世界模型三阶段、AgentOS 构想讲透,还给了大量具体数字和内部决策细节。信息密度高,但后半段组织与智慧部分偏软。

核心论点 · 点时间戳可跳到原声

8:01

AI 分三级,只有生产工具才值钱

李想把 AI 产品分成三级:信息工具、辅助工具、生产工具。信息工具只给参考,辅助工具提升现有产品竞争力,只有生产工具才真正替代专业工作、减少工作时长。他判断标准很硬:你愿不愿意为它付钱。目前他身边同事自掏腰包认的初级生产工具只有两个——Cursor 给编程同事,OpenAI 的 Deep Research 给商分和战略团队。他认为 Agent 最重要的评判条件就是它是否是个生产工具,是否真正能替代我去完成专业的工作。

— 李想
15:06

DeepSeek 教的是人类最佳实践四步

李想从 DeepSeek 身上学到的是它极简地用了人类最佳实践。做能力时四步:先搞研究,再搞研发,然后把能力表达出来,最后变成业务价值。做业务时四步:先做索引分析,再确定目标,然后制定策略并执行,最后做反思复盘。他说人类经常做着做着就忘了最佳实践——遇到问题只想改策略,不做复盘、不做市场分析、不重新确定目标。而严格按最佳实践是反人性的,所以一个好的组织、一个卓越的人,很多时候要跟人性做对抗。

— 李想
23:09

梁文锋自律,是能坚守最佳实践

李想去年九月跟梁文锋聊过一次,印象最深两点:第一他是个特别自律的人,自律的最大特点是能坚守自己相信的东西、坚守最佳实践,能跟人性里的懒惰、走捷径做对抗;第二他会在全世界范围研究和学习最佳实践与最好的方法论。李想还透露,DeepSeek 开源让理想做 VLA 加速了九个月,省了大概大几亿成本,所以理想把操作系统也开源了,纯粹是感谢 DeepSeek,不是公司战略。

— 李想
42:23

VLA 训练分三步,先训 VL 基座

李想手把手讲 VLA 训练。第一步训 VL 基座,当前版本是 32B 云端模型,数据包含三部分:3D Vision、高清 2D Vision(清晰度比开源 VLM 提升 3 到 5 倍)、以及图像与语义联合的语料——比如把导航地图和人类对地图的理解一起放进去,这是理想自己才有的数据。基座训完蒸馏成 3.2B 端侧 MOE 模型,八个专家组成,因为双 Orin X 和索尔 U 直接跑 3.2B 完整模型帧率达不到。第二步后训练,把 action 放进来,像去驾校学开车,模型从 3.2B 扩到接近 4B,COT 只做两步到三步,还会做 diffusion 预测未来 4 到 8 秒轨迹。第三步强化,先做 RLHF 跟人类对齐,再用世界模型生成数据做纯 RL,考核舒适性、碰撞、交通规则三项。

— 李想
1:04:36

世界模型三阶段,最终是 L4 运营系统

李想区分了两种世界模型解读:机器人领域把 action 之后 diffusion 预测未来几秒当成世界模型,理想把那个归为 VLA 的能力部分,真正的世界模型是重建加生成的交通物理世界。它有三个阶段:第一阶段用来考试,第二阶段生成训练数据,第三阶段变成未来 L4 级别自动驾驶车辆的运营系统。因为不可能写一个传统 IT 软件来运营跑在路上、车上没人的自动驾驶车。他还给了数字:每万公里验证成本从 17 到 18 万人民币降到 4000 多块,基本全是算力成本,而且能 100% 还原真实场景。

— 李想
1:16:44

ETC 用规则算法,一周解决三四个月难题

李想举了 ETC 的例子说明为什么不放弃工具。VLM 对位置判断很糟糕,两三个 ETC 还能判断左中右,像机场高速十几个 ETC 就混乱了。团队不停给 VLM 喂更多语料都没解决,因为这是 VLM 的架构问题。李想说解决 ETC 为什么不能用规则算法,最多 15 个口,写个程序一天甚至三天就能完成。团队很快把问题解决了,ETC 非常稳,一周都不到就解决了过去三四个月解决不了、成本很高的方式解决不了的问题。他的原则是:确定性的、能拿规则解决的,意味着更低能量消耗、更低算力消耗和更高准确性。

— 李想
1:23:49

L4 卡在端侧算力,不在算法

李想判断 L3 和 L4 的上限由模型规模决定。今天车上放 3.2B MOE、算上 action 大概 4B,两颗 Orin X 或一个索尔 U 有 64G 显存,最大能跑 30B 模型,但帧数达不到。要满足交通或机器人的帧数,模型规模就得往下压,端上模型规模受限。如果有一天能把 32B 模型直接放端侧,L4 可能就实现了,云端模型也会扩大到 320B。他说今年算力基本就是 L3 水平,最快三季度最晚四季度能看到真正 L3 能力的产品,但法规等还要解决。

— 李想
1:52:07

三到七人组成一个更强的大脑和心脏

李想讲他复盘出来的能量构建方式:三个人起就能形成有效支撑,三个人不内卷、一致对外,通过吵架思考形成一个更全面强大的大脑,一旦形成判断又形成一个更强烈的心脏,你缺能量时其他人给你补。他说一般三到七人最稳固,少于三个人太少,多于七个人太多,所以今天设计很多结构时会刻意设计三到七人组合的脑力和心理支撑结构。他还说,当人和人之间能量存在时,争执讨论吵架就是更完善的大脑;能量消失时,这些就是内耗。

— 李想

原话 · 已逐字校验

我觉得人工智能变成生产工具 然后才是真正人工智能爆发的时刻

我认为人工智能变成生产工具,然后才是真正人工智能爆发的时刻。

李想9:01

因为严格的按照最佳实践 其实是反人性的 对随心所欲 然后才是 然后满足人性的 对所以呢 我觉得一个好的组织 对然后一个卓越的组织 然后一个卓越的人 很多时候其实要跟人性做对抗

因为严格地按照最佳实践,其实是反人性的;随心所欲才是满足人性的。所以一个好的组织、一个卓越的组织、一个卓越的人,很多时候其实要跟人性做对抗。

李想20:08

我觉得5年之内没有通用agent 会有一个agentOS 方便各个专业的人 在这agentOS上 其实开发出来自己需要的agent

我觉得五年之内没有通用 agent,会有一个 agentOS,方便各个专业的人在这个 agentOS 上开发出自己需要的 agent。

李想53:30

就是没有办法直接摘第10个包子 虽然可能大家觉得第10个包子吃饱了 但前面每一个包子其实都跳不过去

就是没有办法直接摘第 10 个包子。虽然可能大家觉得第 10 个包子吃饱了,但前面每一个包子其实都跳不过去。

李想58:32

因为模型能力越强 也意味着他胡来的可能性越高 就跟一个人能力越强 其实我要需要他的职业性越强

因为模型能力越强,也意味着它胡来的可能性越高。就跟一个人能力越强,其实我越需要他的职业性越强。

李想1:06:38

当人和人之间能量始终存在的时候 然后我觉得这些争执 这些讨论这些吵架 就是一个更完善的大脑 当这些能量消失的时候 然后这些政治讨论不同的想法 其实就是内耗

当人和人之间能量始终存在的时候,这些争执、讨论、吵架就是一个更完善的大脑;当这些能量消失的时候,这些讨论、不同的想法其实就是内耗。

李想1:51:06

那我觉得什么是智慧 我觉得智慧就是我们和万物的关系

那我觉得什么是智慧?我觉得智慧就是我们和万物的关系。

李想2:27:22

数字与实体

理想 2025 年预计收入一千大几亿人民币1:25:51
理想 2024 年销量50 万辆1:26:52
VLA 云端 VL 基座模型规模32B(320 亿参数)42:23
每万公里验证成本从 17-18 万人民币降到 4000 多块1:08:38
超级对齐团队规模一百多人1:12:40
端到端团队规模200 人1:59:08
DeepSeek 开源为理想节省的时间九个月23:09

术语

VLA视觉-语言-行动模型
李想定义为司机大模型,能像人类司机一样理解物理世界、开车并与人沟通。
MoE专家混合模型
把一堆专家能力组合在一起的架构,李想用它比喻 CEO 调用不同专家。
AgentOS智能体操作系统
李想认为通用 agent 的更好描述,各专业在上面开发自己的专业 agent。
RLHF带人类反馈的强化学习
用人类接管、驾驶习惯等数据做反馈,让模型与人类和社会对齐。
世界模型交通物理世界仿真
理想用重建加生成构建的交通世界,用于考试、生成训练数据和未来 L4 运营。

收听指南

谁该听

关注 AI Agent 落地、自动驾驶技术路线、组织与人才管理的创业者和工程师,尤其是想知道 VLA 到底怎么训、AgentOS 构想是否成立的人。

可跳过

2:09 之后回顾十周年和家庭亲密关系部分,偏个人感悟,可跳过。