世界太吵,来原声听播客

a16z

世界模型不是视频生成:Atlas 把 3D 控制做成了输入

语言模型处理 token,世界模型处理物理空间。Atlas 的关键不是生成更长的视频,而是把相机和参考图放进 3D 坐标里当输入,让生成从老虎机变成导演。

世界模型3D 生成机器人仿真VFXAtlas

原视频在 YouTube 上放不出来,用音频听:

23 分钟信息密度中等,但 Justin 把世界模型和视频生成的分野讲得很清楚,做 3D、机器人、VFX 的人值得听。

核心论点 · 点时间戳可跳到原声

1:05

Atlas 是模型发布,不是产品发布

Justin 开场就澄清:Atlas 不是产品,是 World Labs 的基座模型,产品后面才来。它做三件事——生成不存在的世界、从真实空间重建、在重建空间里做仿真。生成可以从文本或图像起步,然后直接操控相机飞过这个世界;重建可以只用一张照片,也可以给到一百张以上,照片越多重建越准;仿真则面向 VFX 和机器人。这个顺序本身说明 World Labs 不打算先做消费级应用,而是先把横向基座模型立住,再让产品长在上面。

— Justin Johnson
4:09

参考图被钉在 3D 空间里,不是喂给模型

视频模型生成到十秒左右容易开始跑偏、自己幻觉出方向,Justin 说 Atlas 的解法是 spatial context:你给的参考图不是普通图像,而是被 grounded 在 3D 空间里,可以指定「这张放这里、那张放那里」。生成视频时你也不只是给文本提示,而是直接操控相机,要求它往这个方向、那个方向飞,做到精确的像素级控制。所以哪怕生成到一分钟,也不是拉老虎机,而是你在生成、在导演、在控制模型输出什么。

— Justin Johnson
7:10

Atlas 把 2D 和 3D 的分叉提前了

和 World Labs 第一个产品 Marble 相比,Atlas 是完全重建的模型栈。Marble 把 Gaussian splat 放在中心,输出视频、3D 场景、mesh 都要先经过 Gaussian 表示,再渲染回图像或视频。Atlas 要打破这个依赖:架构更统一、更容易扩展,2D 和 3D 的分叉发生在更早的位置。生成 2D 或视频输出时不再瓶颈在 Gaussian 场景上,模型直接给出 2D 像素;只有在你确实需要 3D 的应用里,才把它提升到 3D。

— Justin Johnson
8:10

Gaussian 没被淘汰,只是不再是必经之路

Justin 不认为 Gaussian 被 outgrow 了,它就是个工具,要用对地方。VFX 的最终产物是 2D 图像或视频,也许根本不需要显式 3D。但实时应用、嵌入式设备上,Gaussian 和 mesh 这类显式 3D 表示仍有位置:未来也许能从服务器农场实时流式传像素,但现在还没到,而且会很贵,所以客户端渲染、移动端和 VR 设备上,Gaussian 或 mesh 依然有用。另一个作用是接入现有工作流——游戏、VFX、设计、建筑的人已经有基于 3D 表示的管线,与其让他们一次性切换到全 AI 原生,不如让 AI 进入他们的工作流。

— Justin Johnson
11:13

仿真补的是机器人训练的最后一段路

real to sim 对机器人的价值,Justin 说首先是评估:机器人最终要在特定工厂、特定机器、特定环境里工作,你得确保它恰好在这个环境里能用。所以仿真在训练和评估的最后一段路很有用——建一个尽可能贴近最终用例的仿真,然后要么在这个仿真里直接微调预训练的机器人基础模型,要么做评估确认它能工作。这给了你一条不同于「收集大量演示或人工遥操作」的路径。他还描述了一个更激进的版本:拿手机拍几张照片或几段随手视频,用 Atlas 重建空间,用自然语言描述任务,让 agent 去搭仿真、做 RL 微调,几分钟内就得到一个适配这个空间的机器人。

— Justin Johnson
14:16

OpenAI 放下世界模型,可能是创新者困境

主持人问为什么 OpenAI 当年把 Sora 那篇「视频生成模型即世界模拟器」的方向做成了消费产品、现在又不做世界模型了。Justin 说不评论 OpenAI 内部策略,但给出一个解释:可能存在创新者困境——你手里握着 LLM 这个很强的东西,而且在这个方向上领先,那么去投资下一个东西就不一定划算。而 World Labs 的判断是,这里存在另一类模型,有大量机会,他们想去做抓住机会的人。

— Justin Johnson
18:21

三台 iPhone 拍出子弹时间,比预期好太多

被问到难物理时,Justin 说黑洞他没试过,猜不会太惊艳。但真正让他意外的是 bullet time:用三台 iPhone 架在三脚架上做同步拍摄,再用 Atlas 做冻结帧、绕飞的重构图。他举了官方示例——草莓掉进燕麦奶,奶花溅起的瞬间冻结时间,绕着飞一圈,效果完全疯狂。这个能力只需要三个输入视角。这说明 Atlas 的价值不只在「生成新世界」,也在把少量真实拍摄变成传统上需要大量相机阵列才能做的镜头。

— Justin Johnson
19:21

3D 在输入端被低估了

Justin 说 3D 的价值有两处,输出端大家已经聊过——有时你就是需要显式 3D 资产插进工作流或游戏引擎。但输入端 3D 的价值被低估了:哪怕最终输出是 2D 的 VFX 镜头,让模型提供 3D 控制面,也能帮导演决定模型该输出什么样的场景。你不想只用文字写「推进、拉远、左移」,而是想直接抓住相机,让它精确地按你要的方式变焦——这用文字根本描述不出来。所以 Atlas 把相机控制做成原生输入类型,多模态里的一模态就是相机。

— Justin Johnson

原话 · 已逐字校验

language models are these general horizontal engines for processing streams of discrete tax, discrete tokens. Those have had tons of applications from everything that we know and love today. And our thesis is that there exists another category of model called world models that should be based in visual understanding, should be based in physical understanding that can be used to generate, simulate, reconstruct worlds.

语言模型是处理离散文本、离散 token 流的通用横向引擎,今天我们所熟知和喜爱的一切应用都建立在它之上。我们的论点是,还存在另一类模型,叫世界模型,它应该建立在视觉理解、物理理解之上,可以用来生成、仿真、重建世界。

Justin Johnson3:07

when you give Atlas reference images, they aren't just images. They're actually grounded in 3D space. So you can stage those images in 3D and say, this reference image should be here.

当你给 Atlas 参考图时,它们不只是图像,它们实际上被锚定在 3D 空间里。你可以在 3D 中摆放这些图像,说这张参考图应该在这里。

Justin Johnson4:09

So the idea here is that even as you go to really long generations, it's not a slot machine. You're generating and directing and really controlling what the model outputs.

所以这里的思路是,即使你生成很长的内容,它也不是老虎机。你在生成、在导演、在真正控制模型输出什么。

Justin Johnson5:09

Marble really put Gaussian splats really at the center of many things that it did. So Marble could output videos, Marble could output 3D scenes, Marble could output meshes, but everything was kind of bottlenecking through a 3D Gaussian splat representation.

Marble 把 Gaussian splat 放在它做的很多事情的中心。Marble 能输出视频、能输出 3D 场景、能输出 mesh,但所有东西都在某种程度上瓶颈在 3D Gaussian splat 表示上。

Justin Johnson7:10

I think there is maybe a sense of a bit of innovators dilemma, right? Like you're sitting on LLMs and you've got this as a really powerful thing and you're, you're leading the pack there. It doesn't necessarily make sense to try to invest in that next thing.

我觉得这里可能有一点创新者困境的味道。你手里握着 LLM,它是非常强大的东西,而且你在那里领先。去投资下一个东西就不一定划算了。

Justin Johnson14:16

I think there's an underappreciated value of 3D on the input side as well. Right. Like even even in a situation like a VFX shot or something like that or the ultimate output is 2D. It's. useful for the model to offer these 3D control surfaces to let the human director figure out what kind of scene the model should output.

我认为 3D 在输入端的价值也被低估了。哪怕是在 VFX 镜头这种最终输出是 2D 的场景里,让模型提供这些 3D 控制面、让人类导演去决定模型该输出什么样的场景,也是有用的。

Justin Johnson19:21

you can control precisely where does the camera move because I don't just want to write in text like pan in, pan out, truck left. I want to be able to grab the camera and make it zoom exactly as I like. And there's really no way to describe that explicitly in text.

你可以精确控制相机往哪移动,因为我不想只在文字里写「推进、拉远、左移」。我想能直接抓住相机,让它完全按我喜欢的方式变焦。而这用文字根本没法明确描述出来。

Justin Johnson20:21

数字与实体

Atlas 重建所需输入照片数少至 1 张,多至 100 张以上2:06
Atlas 生成视频时长示例最长约 1 分钟4:09
bullet time 所需输入视角3 个18:21

术语

world model世界模型
基于视觉与物理理解、可生成/仿真/重建世界的横向基座模型。
Gaussian splat高斯泼溅
一种显式 3D 表示,用大量高斯点重建场景,便于客户端渲染。
real to sim实拍到仿真
用真实拍摄的照片或视频重建 3D 空间,再在其中做机器人仿真。
bullet time子弹时间
冻结瞬间并绕场景飞行的镜头效果,传统上需相机阵列。
SFT监督微调
用标注数据对预训练模型做监督微调,Justin 说牛顿物理问题大概一次 SFT 就能解决。

收听指南

谁该听

做 3D 生成、VFX、游戏引擎、机器人仿真的工程师和创业者,以及想理解世界模型与视频模型分野的投资人。

可跳过

开头 0:00-1:05 是节目预告和嘉宾介绍,可跳过。