世界模型不是預測未來,是給機器人做排名驗證
Cosmos 3 把前向動力學、逆向動力學和策略塞進一個模型,但最先落地的不是訓練,而是用神經模擬器給一堆 checkpoint 排名,篩掉大部分再上真機。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
一個模型幹三件事,靠信息瓶頸逼出協同
Cosmos 3 的架構是兩座塔:一座自迴歸的視覺語言模型負責理解和推理,一座雙向擴散的生成器塔負責生成視頻、動作和音頻。生成器塔裡每個 token 都注意其他所有 token,所以一個 chunk 內的信號是連貫的。關鍵設計是把前向動力學(給動作預測未來)、逆向動力學(給視覺變化反推動作)和策略(給任務決定做什麼)放進同一個模型,並施加信息瓶頸——容量有限,三者必須共享對觀察和動作之間相關性的表示。論文結果顯示三者有協同,一個幫另一個。Ming-Yu 說這本質上是同一件事的不同切片。
— Ming-Yu Liu不同頻率的信號要壓到同一根時間軸上
視頻有不同幀率,音頻有不同赫茲,動作也有自己的頻率。要讓一個模型同時處理這些,必須解決時間尺度不一致的問題。Cosmos 3 的做法是 temporal position embedding,把所有信號歸一化到同一根軸上,讓每個 token 代表信號的一個時間片段,模型既知道哪些 token 屬於同一時刻,也知道不同時刻之間的相對距離。Ming-Yu 說這是讓整個模型能工作的關鍵部分。沒有這一步,音頻、視頻、動作沒法在同一個注意力空間裡對齊。
— Ming-Yu Liu人類視頻多、機器人數據少,但遷移的是模式不是動作
訓練數據嚴重不對稱:第一人稱的人類視頻海量,機器人視頻少得多。但 Ming-Yu 認為遷移可行的原因是共享詞彙——人手操作物體的視覺模式,和機器人夾爪操作物體的視覺模式,在觀察與動作的相關性上非常相似。即使動作空間不能精確對應,一旦對齊了一組動作,模式是相似的,泛化到另一種 embodiment 就更容易。加入多種 embodiment 訓練,還能幫助泛化到沒見過的 embodiment。他承認模型並不知道什麼時候不該遷移、遷移可能有害,但強調關鍵是模式而非精確的動作空間。
— Ming-Yu Liu神經模擬器先做被動驗證,不做訓練
被問到 sim-to-real gap 和策略在模擬器裡鑽空子的問題時,Ming-Yu 承認可能發生。但他給出的落地順序是:神經模擬器先用於被動驗證。模型訓練會產生大量 checkpoint,理想情況是把每個策略部署到真機、真環境測完成率,但成本太高。用世界模擬器替代真機和真司機,讓策略直接和模擬器交互,rollout 結束後測成功率。不需要模擬器的成功率精確,只需要排名保持——模擬器裡 A 比 B 好,真機上大概率也是。這樣能快速縮小需要真機驗證的 checkpoint 數量,提高開發速度。他說即使世界模型還不夠成熟到能喂訓練數據,也先能做策略驗證。
— Ming-Yu LiuCosmos 作為起點,提供數據、環境和初始權重
Cosmos 想幫生態的三件事:更好的數據、更好的環境、更好的起點。Ming-Yu 說把視頻、動作、文本連在一起學共享表示,是構建策略模型的好起點,這不是理論——在後訓練 Cosmos 模型到共享數據集上,取得了 pick and place 策略的結果。直覺是:如果能很好地預測像素動態,並學到像素和動作之間的相關性,就能幫助構建策略模型。隨著 Cosmos 模型推進、引入更多 embodiment,它作為起點的質量會越來越高,適配新 embodiment 所需的工作量會越來越少。repo 裡提供了後訓練 recipe,讓開發者能復現結果。
— Ming-Yu Liu導航已經夠用,操作才是真正的難關
Ming-Yu 把機器人任務分成兩類。導航任務裡,你不希望物理設備碰到任何東西,相對簡單,他認為現在一個模型已經夠好。但操作任務要求各種交互,有接觸就有緩衝,有潛在的形變,所以更難。他對整個領域在 world model 上的熱情、深度學習研究的持續進步和算力的提升很樂觀,認為會到達一個狀態:用神經模擬能很好地處理複雜的操作任務。到那時就可以用世界模擬器測試機器人策略。這個判斷把 Cosmos 的能力邊界說得很清楚——不是所有機器人任務都同等成熟。
— Ming-Yu Liu人形機器人進家門,安全驗證是唯一齣路
Ming-Yu 用自動駕駛類比:車已經在人類空間裡移動,所以今天就需要大量策略驗證來保證足夠安全。當人形機器人進入很多人的家裡,安全更重要——你不會預期家裡有輛車,但會預期人形機器人出現在你、你的孩子、你的寵物周圍。開發者怎麼保證每一次策略迭代、整個系統都足夠安全?需要策略驗證。但你不會有足夠空間搭建各種廚房、各種任務。所以他認為用神經模擬器是唯一能給你開發速度的方式。這段把 Cosmos Dreams 的動機從技術推到了部署場景。
— Ming-Yu Liu世界模型要住在機器人住的地方
Cosmos 有三個尺寸:Super 是前沿模型,保真度最高,要最高精度且有算力就選它;Nano 居中,更小,更容易用各種 GPU 資源後訓練;Edge 要跑在 Jetson Thor、Orin、DGX Spark 這類邊緣設備上。做 Edge 的原因是讓世界模型住在機器人住的地方,這樣採取某個動作時不需要往返數據中心。Ming-Yu 說真實部署時不能指望網絡連接足夠好來完成所有任務,有些場景是安全關鍵的,必須當場完成任務。Edge 模型更小、算力需求更低,容易微調,他們有一個 recipe 能在一天內微調 Cosmos Edge 提升視覺理解能力。他還設想三種尺寸未來會協同工作:難任務調用強模型,簡單任務靠邊緣模型當場完成。
— Ming-Yu Liu原話 · 已逐字校驗
I think a world model is going to be the same. So I think a world model is a collection of useful tools. We model something because we are trying to achieve some goal.
我認為世界模型也會一樣。世界模型是一組有用的工具。我們對某樣東西建模,是因為我們想達成某個目標。
Ming-Yu Liu5:22
Yeah, so I think that these three, they are trying to fundamentally trying to capture the correlation between the observation and action. Right? It's just a different slice, different perspective.
我認為這三者根本上都是在捕捉觀察和動作之間的相關性。只是不同的切片、不同的視角。
Ming-Yu Liu8:26
So I think it's more about our shared vocabulary for different embodiments, right?
所以我認為這更多是關於不同 embodiment 之間的共享詞彙。
Ming-Yu Liu9:28
If the success rates of the world simulator, the new world simulator correlates with the real-world, you know, testing, the ranking preserve, you don't need them to be precise. You just need to know if policy A is better than that. and policy B in neural simulator.
如果世界模擬器的成功率與真實世界測試相關,排名保持住,你不需要它們精確。你只需要知道在神經模擬器裡策略 A 是否比策略 B 好。
Ming-Yu Liu14:42
So even before it's mature enough to feed the policy model, the training data to train, wall simulator can be used as a policy verification.
所以即使在它成熟到能給策略模型喂訓練數據之前,世界模擬器也可以用作策略驗證。
Ming-Yu Liu15:43
You don't expect to see a car, you know, in your house. But once human-knowing is everywhere, you're going to expect to see human-knowing surrounding you and maybe your kid, your pet, right? So you do want them to be safe enough.
你不會預期在自己家裡看到一輛車。但一旦人形機器人無處不在,你會預期人形機器人圍繞著你,也許是你的孩子、你的寵物。所以你確實希望它們足夠安全。
Ming-Yu Liu20:57
So the reason we built this one is that we want the world model lives where a robot lives, right? So that you don't need to have a round trip to data center when you want to take a certain action.
我們做這個的原因是,我們希望世界模型住在機器人住的地方。這樣你想採取某個動作時,不需要往返數據中心。
Ming-Yu Liu23:01
數字與實體
| Cosmos 模型尺寸檔位 | Super、Nano、Edge 三檔 | 22:04 |
| Edge 模型目標設備 | Jetson Thor、Orin、DGX Spark | 22:50 |
| Cosmos Edge 微調耗時 | 一天內完成微調以提升視覺理解 | 23:01 |
| Cosmos 模型與數據託管 | 模型和數據在 Hugging Face,代碼在 GitHub | 24:24 |
術語
- world model世界模型
- 對環境動態建模、能預測未來觀察或反推動作的模型集合。
- forward dynamics前向動力學
- 給定起始狀態和動作,預測接下來會發生什麼。
- inverse dynamics逆向動力學
- 給定視覺上的狀態轉移,反推執行了什麼動作。
- sim-to-real gap仿真到現實的差距
- 模擬器裡訓練的策略遷移到真機時性能下降的現象。
- embodiment具身形態
- 機器人的物理身體構型,如人手、夾爪、不同臂長。
- temporal position embedding時間位置嵌入
- 把不同頻率的信號歸一化到同一時間軸,讓模型對齊時刻。
收聽指南
做機器人策略、自動駕駛仿真、具身智能的工程師和研究者;評估世界模型落地路徑的投資人。
0:00-2:28 的開場演示和項目介紹可快進,技術內容從 2:28 開始。