世界太吵,来原声听播客

ML Street Talk

世界模型不是预测未来,是给机器人做排名验证

Cosmos 3 把前向动力学、逆向动力学和策略塞进一个模型,但最先落地的不是训练,而是用神经模拟器给一堆 checkpoint 排名,筛掉大部分再上真机。

世界模型机器人NVIDIA仿真具身智能

原视频在 YouTube 上放不出来,用音频听:

NVIDIA Cosmos 3 的技术细节和落地路径,讲清了世界模型在机器人上先做什么、后做什么。信息密度中等,后半段的工程判断比前半段的架构描述值钱。

核心论点 · 点时间戳可跳到原声

2:28

一个模型干三件事,靠信息瓶颈逼出协同

Cosmos 3 的架构是两座塔:一座自回归的视觉语言模型负责理解和推理,一座双向扩散的生成器塔负责生成视频、动作和音频。生成器塔里每个 token 都注意其他所有 token,所以一个 chunk 内的信号是连贯的。关键设计是把前向动力学(给动作预测未来)、逆向动力学(给视觉变化反推动作)和策略(给任务决定做什么)放进同一个模型,并施加信息瓶颈——容量有限,三者必须共享对观察和动作之间相关性的表示。论文结果显示三者有协同,一个帮另一个。Ming-Yu 说这本质上是同一件事的不同切片。

— Ming-Yu Liu
6:24

不同频率的信号要压到同一根时间轴上

视频有不同帧率,音频有不同赫兹,动作也有自己的频率。要让一个模型同时处理这些,必须解决时间尺度不一致的问题。Cosmos 3 的做法是 temporal position embedding,把所有信号归一化到同一根轴上,让每个 token 代表信号的一个时间片段,模型既知道哪些 token 属于同一时刻,也知道不同时刻之间的相对距离。Ming-Yu 说这是让整个模型能工作的关键部分。没有这一步,音频、视频、动作没法在同一个注意力空间里对齐。

— Ming-Yu Liu
9:28

人类视频多、机器人数据少,但迁移的是模式不是动作

训练数据严重不对称:第一人称的人类视频海量,机器人视频少得多。但 Ming-Yu 认为迁移可行的原因是共享词汇——人手操作物体的视觉模式,和机器人夹爪操作物体的视觉模式,在观察与动作的相关性上非常相似。即使动作空间不能精确对应,一旦对齐了一组动作,模式是相似的,泛化到另一种 embodiment 就更容易。加入多种 embodiment 训练,还能帮助泛化到没见过的 embodiment。他承认模型并不知道什么时候不该迁移、迁移可能有害,但强调关键是模式而非精确的动作空间。

— Ming-Yu Liu
12:53

神经模拟器先做被动验证,不做训练

被问到 sim-to-real gap 和策略在模拟器里钻空子的问题时,Ming-Yu 承认可能发生。但他给出的落地顺序是:神经模拟器先用于被动验证。模型训练会产生大量 checkpoint,理想情况是把每个策略部署到真机、真环境测完成率,但成本太高。用世界模拟器替代真机和真司机,让策略直接和模拟器交互,rollout 结束后测成功率。不需要模拟器的成功率精确,只需要排名保持——模拟器里 A 比 B 好,真机上大概率也是。这样能快速缩小需要真机验证的 checkpoint 数量,提高开发速度。他说即使世界模型还不够成熟到能喂训练数据,也先能做策略验证。

— Ming-Yu Liu
16:47

Cosmos 作为起点,提供数据、环境和初始权重

Cosmos 想帮生态的三件事:更好的数据、更好的环境、更好的起点。Ming-Yu 说把视频、动作、文本连在一起学共享表示,是构建策略模型的好起点,这不是理论——在后训练 Cosmos 模型到共享数据集上,取得了 pick and place 策略的结果。直觉是:如果能很好地预测像素动态,并学到像素和动作之间的相关性,就能帮助构建策略模型。随着 Cosmos 模型推进、引入更多 embodiment,它作为起点的质量会越来越高,适配新 embodiment 所需的工作量会越来越少。repo 里提供了后训练 recipe,让开发者能复现结果。

— Ming-Yu Liu
19:53

导航已经够用,操作才是真正的难关

Ming-Yu 把机器人任务分成两类。导航任务里,你不希望物理设备碰到任何东西,相对简单,他认为现在一个模型已经够好。但操作任务要求各种交互,有接触就有缓冲,有潜在的形变,所以更难。他对整个领域在 world model 上的热情、深度学习研究的持续进步和算力的提升很乐观,认为会到达一个状态:用神经模拟能很好地处理复杂的操作任务。到那时就可以用世界模拟器测试机器人策略。这个判断把 Cosmos 的能力边界说得很清楚——不是所有机器人任务都同等成熟。

— Ming-Yu Liu
20:57

人形机器人进家门,安全验证是唯一出路

Ming-Yu 用自动驾驶类比:车已经在人类空间里移动,所以今天就需要大量策略验证来保证足够安全。当人形机器人进入很多人的家里,安全更重要——你不会预期家里有辆车,但会预期人形机器人出现在你、你的孩子、你的宠物周围。开发者怎么保证每一次策略迭代、整个系统都足够安全?需要策略验证。但你不会有足够空间搭建各种厨房、各种任务。所以他认为用神经模拟器是唯一能给你开发速度的方式。这段把 Cosmos Dreams 的动机从技术推到了部署场景。

— Ming-Yu Liu
22:04

世界模型要住在机器人住的地方

Cosmos 有三个尺寸:Super 是前沿模型,保真度最高,要最高精度且有算力就选它;Nano 居中,更小,更容易用各种 GPU 资源后训练;Edge 要跑在 Jetson Thor、Orin、DGX Spark 这类边缘设备上。做 Edge 的原因是让世界模型住在机器人住的地方,这样采取某个动作时不需要往返数据中心。Ming-Yu 说真实部署时不能指望网络连接足够好来完成所有任务,有些场景是安全关键的,必须当场完成任务。Edge 模型更小、算力需求更低,容易微调,他们有一个 recipe 能在一天内微调 Cosmos Edge 提升视觉理解能力。他还设想三种尺寸未来会协同工作:难任务调用强模型,简单任务靠边缘模型当场完成。

— Ming-Yu Liu

原话 · 已逐字校验

I think a world model is going to be the same. So I think a world model is a collection of useful tools. We model something because we are trying to achieve some goal.

我认为世界模型也会一样。世界模型是一组有用的工具。我们对某样东西建模,是因为我们想达成某个目标。

Ming-Yu Liu5:22

Yeah, so I think that these three, they are trying to fundamentally trying to capture the correlation between the observation and action. Right? It's just a different slice, different perspective.

我认为这三者根本上都是在捕捉观察和动作之间的相关性。只是不同的切片、不同的视角。

Ming-Yu Liu8:26

So I think it's more about our shared vocabulary for different embodiments, right?

所以我认为这更多是关于不同 embodiment 之间的共享词汇。

Ming-Yu Liu9:28

If the success rates of the world simulator, the new world simulator correlates with the real-world, you know, testing, the ranking preserve, you don't need them to be precise. You just need to know if policy A is better than that. and policy B in neural simulator.

如果世界模拟器的成功率与真实世界测试相关,排名保持住,你不需要它们精确。你只需要知道在神经模拟器里策略 A 是否比策略 B 好。

Ming-Yu Liu14:42

So even before it's mature enough to feed the policy model, the training data to train, wall simulator can be used as a policy verification.

所以即使在它成熟到能给策略模型喂训练数据之前,世界模拟器也可以用作策略验证。

Ming-Yu Liu15:43

You don't expect to see a car, you know, in your house. But once human-knowing is everywhere, you're going to expect to see human-knowing surrounding you and maybe your kid, your pet, right? So you do want them to be safe enough.

你不会预期在自己家里看到一辆车。但一旦人形机器人无处不在,你会预期人形机器人围绕着你,也许是你的孩子、你的宠物。所以你确实希望它们足够安全。

Ming-Yu Liu20:57

So the reason we built this one is that we want the world model lives where a robot lives, right? So that you don't need to have a round trip to data center when you want to take a certain action.

我们做这个的原因是,我们希望世界模型住在机器人住的地方。这样你想采取某个动作时,不需要往返数据中心。

Ming-Yu Liu23:01

数字与实体

Cosmos 模型尺寸档位Super、Nano、Edge 三档22:04
Edge 模型目标设备Jetson Thor、Orin、DGX Spark22:50
Cosmos Edge 微调耗时一天内完成微调以提升视觉理解23:01
Cosmos 模型与数据托管模型和数据在 Hugging Face,代码在 GitHub24:24

术语

world model世界模型
对环境动态建模、能预测未来观察或反推动作的模型集合。
forward dynamics前向动力学
给定起始状态和动作,预测接下来会发生什么。
inverse dynamics逆向动力学
给定视觉上的状态转移,反推执行了什么动作。
sim-to-real gap仿真到现实的差距
模拟器里训练的策略迁移到真机时性能下降的现象。
embodiment具身形态
机器人的物理身体构型,如人手、夹爪、不同臂长。
temporal position embedding时间位置嵌入
把不同频率的信号归一化到同一时间轴,让模型对齐时刻。

收听指南

谁该听

做机器人策略、自动驾驶仿真、具身智能的工程师和研究者;评估世界模型落地路径的投资人。

可跳过

0:00-2:28 的开场演示和项目介绍可快进,技术内容从 2:28 开始。