世界太吵,來原聲聽播客

ML Street Talk

世界模型不是預測未來,是給機器人做排名驗證

Cosmos 3 把前向動力學、逆向動力學和策略塞進一個模型,但最先落地的不是訓練,而是用神經模擬器給一堆 checkpoint 排名,篩掉大部分再上真機。

世界模型機器人NVIDIA仿真具身智能

原視頻在 YouTube 上放不出來,用音頻聽:

NVIDIA Cosmos 3 的技術細節和落地路徑,講清了世界模型在機器人上先做什麼、後做什麼。信息密度中等,後半段的工程判斷比前半段的架構描述值錢。

核心論點 · 點時間戳可跳到原聲

2:28

一個模型幹三件事,靠信息瓶頸逼出協同

Cosmos 3 的架構是兩座塔:一座自迴歸的視覺語言模型負責理解和推理,一座雙向擴散的生成器塔負責生成視頻、動作和音頻。生成器塔裡每個 token 都注意其他所有 token,所以一個 chunk 內的信號是連貫的。關鍵設計是把前向動力學(給動作預測未來)、逆向動力學(給視覺變化反推動作)和策略(給任務決定做什麼)放進同一個模型,並施加信息瓶頸——容量有限,三者必須共享對觀察和動作之間相關性的表示。論文結果顯示三者有協同,一個幫另一個。Ming-Yu 說這本質上是同一件事的不同切片。

— Ming-Yu Liu
6:24

不同頻率的信號要壓到同一根時間軸上

視頻有不同幀率,音頻有不同赫茲,動作也有自己的頻率。要讓一個模型同時處理這些,必須解決時間尺度不一致的問題。Cosmos 3 的做法是 temporal position embedding,把所有信號歸一化到同一根軸上,讓每個 token 代表信號的一個時間片段,模型既知道哪些 token 屬於同一時刻,也知道不同時刻之間的相對距離。Ming-Yu 說這是讓整個模型能工作的關鍵部分。沒有這一步,音頻、視頻、動作沒法在同一個注意力空間裡對齊。

— Ming-Yu Liu
9:28

人類視頻多、機器人數據少,但遷移的是模式不是動作

訓練數據嚴重不對稱:第一人稱的人類視頻海量,機器人視頻少得多。但 Ming-Yu 認為遷移可行的原因是共享詞彙——人手操作物體的視覺模式,和機器人夾爪操作物體的視覺模式,在觀察與動作的相關性上非常相似。即使動作空間不能精確對應,一旦對齊了一組動作,模式是相似的,泛化到另一種 embodiment 就更容易。加入多種 embodiment 訓練,還能幫助泛化到沒見過的 embodiment。他承認模型並不知道什麼時候不該遷移、遷移可能有害,但強調關鍵是模式而非精確的動作空間。

— Ming-Yu Liu
12:53

神經模擬器先做被動驗證,不做訓練

被問到 sim-to-real gap 和策略在模擬器裡鑽空子的問題時,Ming-Yu 承認可能發生。但他給出的落地順序是:神經模擬器先用於被動驗證。模型訓練會產生大量 checkpoint,理想情況是把每個策略部署到真機、真環境測完成率,但成本太高。用世界模擬器替代真機和真司機,讓策略直接和模擬器交互,rollout 結束後測成功率。不需要模擬器的成功率精確,只需要排名保持——模擬器裡 A 比 B 好,真機上大概率也是。這樣能快速縮小需要真機驗證的 checkpoint 數量,提高開發速度。他說即使世界模型還不夠成熟到能喂訓練數據,也先能做策略驗證。

— Ming-Yu Liu
16:47

Cosmos 作為起點,提供數據、環境和初始權重

Cosmos 想幫生態的三件事:更好的數據、更好的環境、更好的起點。Ming-Yu 說把視頻、動作、文本連在一起學共享表示,是構建策略模型的好起點,這不是理論——在後訓練 Cosmos 模型到共享數據集上,取得了 pick and place 策略的結果。直覺是:如果能很好地預測像素動態,並學到像素和動作之間的相關性,就能幫助構建策略模型。隨著 Cosmos 模型推進、引入更多 embodiment,它作為起點的質量會越來越高,適配新 embodiment 所需的工作量會越來越少。repo 裡提供了後訓練 recipe,讓開發者能復現結果。

— Ming-Yu Liu
19:53

導航已經夠用,操作才是真正的難關

Ming-Yu 把機器人任務分成兩類。導航任務裡,你不希望物理設備碰到任何東西,相對簡單,他認為現在一個模型已經夠好。但操作任務要求各種交互,有接觸就有緩衝,有潛在的形變,所以更難。他對整個領域在 world model 上的熱情、深度學習研究的持續進步和算力的提升很樂觀,認為會到達一個狀態:用神經模擬能很好地處理複雜的操作任務。到那時就可以用世界模擬器測試機器人策略。這個判斷把 Cosmos 的能力邊界說得很清楚——不是所有機器人任務都同等成熟。

— Ming-Yu Liu
20:57

人形機器人進家門,安全驗證是唯一齣路

Ming-Yu 用自動駕駛類比:車已經在人類空間裡移動,所以今天就需要大量策略驗證來保證足夠安全。當人形機器人進入很多人的家裡,安全更重要——你不會預期家裡有輛車,但會預期人形機器人出現在你、你的孩子、你的寵物周圍。開發者怎麼保證每一次策略迭代、整個系統都足夠安全?需要策略驗證。但你不會有足夠空間搭建各種廚房、各種任務。所以他認為用神經模擬器是唯一能給你開發速度的方式。這段把 Cosmos Dreams 的動機從技術推到了部署場景。

— Ming-Yu Liu
22:04

世界模型要住在機器人住的地方

Cosmos 有三個尺寸:Super 是前沿模型,保真度最高,要最高精度且有算力就選它;Nano 居中,更小,更容易用各種 GPU 資源後訓練;Edge 要跑在 Jetson Thor、Orin、DGX Spark 這類邊緣設備上。做 Edge 的原因是讓世界模型住在機器人住的地方,這樣採取某個動作時不需要往返數據中心。Ming-Yu 說真實部署時不能指望網絡連接足夠好來完成所有任務,有些場景是安全關鍵的,必須當場完成任務。Edge 模型更小、算力需求更低,容易微調,他們有一個 recipe 能在一天內微調 Cosmos Edge 提升視覺理解能力。他還設想三種尺寸未來會協同工作:難任務調用強模型,簡單任務靠邊緣模型當場完成。

— Ming-Yu Liu

原話 · 已逐字校驗

I think a world model is going to be the same. So I think a world model is a collection of useful tools. We model something because we are trying to achieve some goal.

我認為世界模型也會一樣。世界模型是一組有用的工具。我們對某樣東西建模,是因為我們想達成某個目標。

Ming-Yu Liu5:22

Yeah, so I think that these three, they are trying to fundamentally trying to capture the correlation between the observation and action. Right? It's just a different slice, different perspective.

我認為這三者根本上都是在捕捉觀察和動作之間的相關性。只是不同的切片、不同的視角。

Ming-Yu Liu8:26

So I think it's more about our shared vocabulary for different embodiments, right?

所以我認為這更多是關於不同 embodiment 之間的共享詞彙。

Ming-Yu Liu9:28

If the success rates of the world simulator, the new world simulator correlates with the real-world, you know, testing, the ranking preserve, you don't need them to be precise. You just need to know if policy A is better than that. and policy B in neural simulator.

如果世界模擬器的成功率與真實世界測試相關,排名保持住,你不需要它們精確。你只需要知道在神經模擬器裡策略 A 是否比策略 B 好。

Ming-Yu Liu14:42

So even before it's mature enough to feed the policy model, the training data to train, wall simulator can be used as a policy verification.

所以即使在它成熟到能給策略模型喂訓練數據之前,世界模擬器也可以用作策略驗證。

Ming-Yu Liu15:43

You don't expect to see a car, you know, in your house. But once human-knowing is everywhere, you're going to expect to see human-knowing surrounding you and maybe your kid, your pet, right? So you do want them to be safe enough.

你不會預期在自己家裡看到一輛車。但一旦人形機器人無處不在,你會預期人形機器人圍繞著你,也許是你的孩子、你的寵物。所以你確實希望它們足夠安全。

Ming-Yu Liu20:57

So the reason we built this one is that we want the world model lives where a robot lives, right? So that you don't need to have a round trip to data center when you want to take a certain action.

我們做這個的原因是,我們希望世界模型住在機器人住的地方。這樣你想採取某個動作時,不需要往返數據中心。

Ming-Yu Liu23:01

數字與實體

Cosmos 模型尺寸檔位Super、Nano、Edge 三檔22:04
Edge 模型目標設備Jetson Thor、Orin、DGX Spark22:50
Cosmos Edge 微調耗時一天內完成微調以提升視覺理解23:01
Cosmos 模型與數據託管模型和數據在 Hugging Face,代碼在 GitHub24:24

術語

world model世界模型
對環境動態建模、能預測未來觀察或反推動作的模型集合。
forward dynamics前向動力學
給定起始狀態和動作,預測接下來會發生什麼。
inverse dynamics逆向動力學
給定視覺上的狀態轉移,反推執行了什麼動作。
sim-to-real gap仿真到現實的差距
模擬器裡訓練的策略遷移到真機時性能下降的現象。
embodiment具身形態
機器人的物理身體構型,如人手、夾爪、不同臂長。
temporal position embedding時間位置嵌入
把不同頻率的信號歸一化到同一時間軸,讓模型對齊時刻。

收聽指南

誰該聽

做機器人策略、自動駕駛仿真、具身智能的工程師和研究者;評估世界模型落地路徑的投資人。

可跳過

0:00-2:28 的開場演示和項目介紹可快進,技術內容從 2:28 開始。