李想:通用 agent 五年內不會出現,只會先有 agentOS
李想判斷通用 agent 五年內不會出現,真正會出現的是 agentOS——各專業在上面開發自己的專業 agent。因為生產工具必須能行動、能替代專業工作,而不是給個建議。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
AI 分三級,只有生產工具才值錢
李想把 AI 產品分成三級:信息工具、輔助工具、生產工具。信息工具只給參考,輔助工具提升現有產品競爭力,只有生產工具才真正替代專業工作、減少工作時長。他判斷標準很硬:你願不願意為它付錢。目前他身邊同事自掏腰包認的初級生產工具只有兩個——Cursor 給編程同事,OpenAI 的 Deep Research 給商分和戰略團隊。他認為 Agent 最重要的評判條件就是它是否是個生產工具,是否真正能替代我去完成專業的工作。
— 李想DeepSeek 教的是人類最佳實踐四步
李想從 DeepSeek 身上學到的是它極簡地用了人類最佳實踐。做能力時四步:先搞研究,再搞研發,然後把能力表達出來,最後變成業務價值。做業務時四步:先做索引分析,再確定目標,然後制定策略並執行,最後做反思復盤。他說人類經常做著做著就忘了最佳實踐——遇到問題只想改策略,不做復盤、不做市場分析、不重新確定目標。而嚴格按最佳實踐是反人性的,所以一個好的組織、一個卓越的人,很多時候要跟人性做對抗。
— 李想梁文鋒自律,是能堅守最佳實踐
李想去年九月跟梁文鋒聊過一次,印象最深兩點:第一他是個特別自律的人,自律的最大特點是能堅守自己相信的東西、堅守最佳實踐,能跟人性裡的懶惰、走捷徑做對抗;第二他會在全世界範圍研究和學習最佳實踐與最好的方法論。李想還透露,DeepSeek 開源讓理想做 VLA 加速了九個月,省了大概大幾億成本,所以理想把操作系統也開源了,純粹是感謝 DeepSeek,不是公司戰略。
— 李想VLA 訓練分三步,先訓 VL 基座
李想手把手講 VLA 訓練。第一步訓 VL 基座,當前版本是 32B 雲端模型,數據包含三部分:3D Vision、高清 2D Vision(清晰度比開源 VLM 提升 3 到 5 倍)、以及圖像與語義聯合的語料——比如把導航地圖和人類對地圖的理解一起放進去,這是理想自己才有的數據。基座訓完蒸餾成 3.2B 端側 MOE 模型,八個專家組成,因為雙 Orin X 和索爾 U 直接跑 3.2B 完整模型幀率達不到。第二步後訓練,把 action 放進來,像去駕校學開車,模型從 3.2B 擴到接近 4B,COT 只做兩步到三步,還會做 diffusion 預測未來 4 到 8 秒軌跡。第三步強化,先做 RLHF 跟人類對齊,再用世界模型生成數據做純 RL,考核舒適性、碰撞、交通規則三項。
— 李想世界模型三階段,最終是 L4 運營系統
李想區分了兩種世界模型解讀:機器人領域把 action 之後 diffusion 預測未來幾秒當成世界模型,理想把那個歸為 VLA 的能力部分,真正的世界模型是重建加生成的交通物理世界。它有三個階段:第一階段用來考試,第二階段生成訓練數據,第三階段變成未來 L4 級別自動駕駛車輛的運營系統。因為不可能寫一個傳統 IT 軟件來運營跑在路上、車上沒人的自動駕駛車。他還給了數字:每萬公里驗證成本從 17 到 18 萬人民幣降到 4000 多塊,基本全是算力成本,而且能 100% 還原真實場景。
— 李想ETC 用規則算法,一週解決三四個月難題
李想舉了 ETC 的例子說明為什麼不放棄工具。VLM 對位置判斷很糟糕,兩三個 ETC 還能判斷左中右,像機場高速十幾個 ETC 就混亂了。團隊不停給 VLM 喂更多語料都沒解決,因為這是 VLM 的架構問題。李想說解決 ETC 為什麼不能用規則算法,最多 15 個口,寫個程序一天甚至三天就能完成。團隊很快把問題解決了,ETC 非常穩,一週都不到就解決了過去三四個月解決不了、成本很高的方式解決不了的問題。他的原則是:確定性的、能拿規則解決的,意味著更低能量消耗、更低算力消耗和更高準確性。
— 李想L4 卡在端側算力,不在算法
李想判斷 L3 和 L4 的上限由模型規模決定。今天車上放 3.2B MOE、算上 action 大概 4B,兩顆 Orin X 或一個索爾 U 有 64G 顯存,最大能跑 30B 模型,但幀數達不到。要滿足交通或機器人的幀數,模型規模就得往下壓,端上模型規模受限。如果有一天能把 32B 模型直接放端側,L4 可能就實現了,雲端模型也會擴大到 320B。他說今年算力基本就是 L3 水平,最快三季度最晚四季度能看到真正 L3 能力的產品,但法規等還要解決。
— 李想三到七人組成一個更強的大腦和心臟
李想講他復盤出來的能量構建方式:三個人起就能形成有效支撐,三個人不內捲、一致對外,通過吵架思考形成一個更全面強大的大腦,一旦形成判斷又形成一個更強烈的心臟,你缺能量時其他人給你補。他說一般三到七人最穩固,少於三個人太少,多於七個人太多,所以今天設計很多結構時會刻意設計三到七人組合的腦力和心理支撐結構。他還說,當人和人之間能量存在時,爭執討論吵架就是更完善的大腦;能量消失時,這些就是內耗。
— 李想原話 · 已逐字校驗
我覺得人工智能變成生產工具 然後才是真正人工智能爆發的時刻
我認為人工智能變成生產工具,然後才是真正人工智能爆發的時刻。
李想9:01
因為嚴格的按照最佳實踐 其實是反人性的 對隨心所欲 然後才是 然後滿足人性的 對所以呢 我覺得一個好的組織 對然後一個卓越的組織 然後一個卓越的人 很多時候其實要跟人性做對抗
因為嚴格地按照最佳實踐,其實是反人性的;隨心所欲才是滿足人性的。所以一個好的組織、一個卓越的組織、一個卓越的人,很多時候其實要跟人性做對抗。
李想20:08
我覺得5年之內沒有通用agent 會有一個agentOS 方便各個專業的人 在這agentOS上 其實開發出來自己需要的agent
我覺得五年之內沒有通用 agent,會有一個 agentOS,方便各個專業的人在這個 agentOS 上開發出自己需要的 agent。
李想53:30
就是沒有辦法直接摘第10個包子 雖然可能大家覺得第10個包子吃飽了 但前面每一個包子其實都跳不過去
就是沒有辦法直接摘第 10 個包子。雖然可能大家覺得第 10 個包子吃飽了,但前面每一個包子其實都跳不過去。
李想58:32
因為模型能力越強 也意味著他胡來的可能性越高 就跟一個人能力越強 其實我要需要他的職業性越強
因為模型能力越強,也意味著它胡來的可能性越高。就跟一個人能力越強,其實我越需要他的職業性越強。
李想1:06:38
當人和人之間能量始終存在的時候 然後我覺得這些爭執 這些討論這些吵架 就是一個更完善的大腦 當這些能量消失的時候 然後這些政治討論不同的想法 其實就是內耗
當人和人之間能量始終存在的時候,這些爭執、討論、吵架就是一個更完善的大腦;當這些能量消失的時候,這些討論、不同的想法其實就是內耗。
李想1:51:06
那我覺得什麼是智慧 我覺得智慧就是我們和萬物的關係
那我覺得什麼是智慧?我覺得智慧就是我們和萬物的關係。
李想2:27:22
數字與實體
| 理想 2025 年預計收入 | 一千大幾億人民幣 | 1:25:51 |
| 理想 2024 年銷量 | 50 萬輛 | 1:26:52 |
| VLA 雲端 VL 基座模型規模 | 32B(320 億參數) | 42:23 |
| 每萬公里驗證成本 | 從 17-18 萬人民幣降到 4000 多塊 | 1:08:38 |
| 超級對齊團隊規模 | 一百多人 | 1:12:40 |
| 端到端團隊規模 | 200 人 | 1:59:08 |
| DeepSeek 開源為理想節省的時間 | 九個月 | 23:09 |
術語
- VLA視覺-語言-行動模型
- 李想定義為司機大模型,能像人類司機一樣理解物理世界、開車並與人溝通。
- MoE專家混合模型
- 把一堆專家能力組合在一起的架構,李想用它比喻 CEO 調用不同專家。
- AgentOS智能體操作系統
- 李想認為通用 agent 的更好描述,各專業在上面開發自己的專業 agent。
- RLHF帶人類反饋的強化學習
- 用人類接管、駕駛習慣等數據做反饋,讓模型與人類和社會對齊。
- 世界模型交通物理世界仿真
- 理想用重建加生成構建的交通世界,用於考試、生成訓練數據和未來 L4 運營。
收聽指南
關注 AI Agent 落地、自動駕駛技術路線、組織與人才管理的創業者和工程師,尤其是想知道 VLA 到底怎麼訓、AgentOS 構想是否成立的人。
2:09 之後回顧十週年和家庭親密關係部分,偏個人感悟,可跳過。