世界太吵,来原声听播客

a16z

世界模型的新基元:不是预测下一帧,而是预测下一个视角

语言模型靠预测下一个 token,Atlas 靠预测下一个视角。它把生成和重建放进同一个模型,用三台 iPhone 复现《黑客帝国》几百台摄像机才拍出的子弹时间。

世界模型空间智能3D 重建机器人仿真多模态

原视频在 YouTube 上放不出来,用音频听:

Fei-Fei Li 和 World Labs 三位联创亲自讲清新模型 Atlas 的技术选择与取舍,含具体数字和内部决策时刻,信息密度高。

核心论点 · 点时间戳可跳到原声

1:10

Atlas 把生成和重建塞进同一个模型

Justin 说 Atlas 有三件事:生成、重建、模拟。核心变化是它第一次把像素生成和像素重建统一在一个架构里——历史上重建是计算机视觉的独立子领域,有自己的专门模型;生成则是扩散模型的强项。Fei-Fei Li 强调这个统一「anchoring on viewpoints」,靠视角估计把两条传统赛道缝在一起。为此模型从预训练阶段就是原生多模态:文本、图像、视频、相机位姿、3D 都是原生输入,相机位姿作为预训练输入此前没人做过。

— Justin Johnson / Fei-Fei Li
3:18

三台 iPhone 拍出子弹时间

《黑客帝国》里 Neo 后仰那一镜,是绿幕前几百台摄像机围成一圈拍的。Atlas 用三台 iPhone 就能复现:拍下有人投篮、有人把草莓丢进牛奶,然后重新取景、冻结时间、让镜头飞进牛奶溅起的瞬间。Ben 说这是「no studio capture, no green screen, no expensive calibration」。这个画面是理解 Atlas 能力最直观的入口——它不只是生成好看的像素,而是能在任意时空点重新架设虚拟摄像机。

— Justin Johnson
13:32

稠密重建要几百张照片,Atlas 要三张

Ben 解释稠密重建为什么稠密:要让某个东西出现在重建里,你至少需要它的三四个视角。这个房间的麦克风底下、桌子底下、椅腿之间、植物叶子,全都要覆盖到,训练有素的人要拍几分钟,普通消费者第一次扫一个多房间环境可能花两小时。Atlas 把这个数字压到三张,Ben 说这是「50, 100 X reduction」。他拿自己以前拍的两千张多房间房子的素材,砍到三四十张输入,飞越效果基本一样。

— Ben Mildenhall
17:47

重建必然有洞,所以必须生成

Justin 给出生成和重建必须耦合的机制:传统重建靠多视角三角化同一个 3D 点,任何没被输入视角看到的像素就是洞。就算让 Ben 拿单反拍几百张,也永远拍不到所有麦克风底下和桌腿之间。所以模型必须有生成能力去「想象」没拍到的部分。他把这类比成 LLM 的上下文:重建就是上下文极长的生成,Atlas 能塞进 64 张图的采集做整栋房子的飞越,而 Marble 时代根本塞不进超过几张图。

— Justin Johnson
22:56

瓶颈是算力,不是架构,也不是数据

被问是否到了这个架构的扩展尽头,Justin 说「No, no, we're at the beginning」,而且不用改架构。他明确说当前主要瓶颈是训练算力:开发时训了一串模型,每加大、每训久、每上更多芯片,都显著变好;这次发布的模型大小是被发布日期倒推决定的,不是被规模或数据限制的。Fei-Fei Li 补充,他们早期就押注两个假设——scaling law 和 next viewpoint prediction,但没料到第一轮预训练就能到这个质量。

— Justin Johnson / Fei-Fei Li
23:56

那张桌子下的镜头让三人五秒内拍板

Fei-Fei Li 讲了一个内部时刻:初夏某天,还不是现在这个 Atlas 规模,是个更小的模型,Ben 把视角生成接进去,用 Nerf 论文那张著名的花园桌子,镜头从桌子底下飞过,还带着一个足球。她强调「no one has ever seen this result」。那天早上三个人对视,说就是它了,五秒内做了决定。这个细节说明技术判断不是靠路线图,是靠一个具体画面。

— Fei-Fei Li
29:03

机器人最大的瓶颈是数据,不是芯片

Fei-Fei Li 说机器人现在最大的问题是数据,芯片是以后的事。要训一个做线缆操作的机械臂,需要真实到仿真、仿真到真实的循环,还要做 randomization——同一根线缆要能往不同方向弯,盒子要有不同尺寸、颜色、盖子。收购的 Cinex 团队原本就在做稠密重建,极其痛苦、拖慢仿真速度,Atlas 是这一环的下一代技术。Justin 补充机器人和别的 AI 应用本质不同:策略不是产出静态 artifact,而是要在真实世界里行动、遭遇意外,所以必须靠仿真暴露所有可能的失败。

— Fei-Fei Li / Justin Johnson
41:18

新视角预测和下一 token 预测一样是 AI 完备的

Justin 用 AI completeness 论证 Atlas 基元的地位:三 SAT 是 NP 完备的经典例子,因为任何 NP 难问题都能归约到它;下一 token 预测被认为 AI 完备,因为可以构造一个推理小说,最后一句是「凶手是」然后预测下一个 token。他说生成式新视角预测同样 AI 完备——你可以让 Martine 在黑板上写黎曼猜想的证明,Cameron 在隔壁白板把它解出来。Fei-Fei Li 补了进化论版本:大自然给了动物眼睛却没给树眼睛,因为动物会动,动了就能看到新视角。

— Justin Johnson / Fei-Fei Li

原话 · 已逐字校验

But now with Atlas, we can do this with as few as three cameras. So no studio capture, no green screen, no expensive calibration.

但现在用 Atlas,三台摄像机就能做到。不需要摄影棚采集,不需要绿幕,不需要昂贵的标定。

Justin Johnson3:18

With Atlas, every image actually has an associated three-dimensional camera pose.

在 Atlas 里,每一张图像实际上都关联着一个三维相机位姿。

Ben Mildenhall4:25

I've seen someone for their first time trying to scan a multi-room environment, spend like two hours walking through it and get enough coverage.

我见过有人第一次扫一个多房间环境,走了两个小时才拿到足够的覆盖。

Ben Mildenhall15:42

No, no, we're at the beginning.

不,不,我们才刚开始。

Justin Johnson22:56

That morning, the three of us looked at each other in the eyes and said, that's it, this is, we're going to build this. Like, we made a decision within five seconds.

那天早上,我们三个人对视,说就是它了,我们要做这个。我们五秒内就做了决定。

Fei-Fei Li23:56

We should zoom out and recognize the biggest problem right now in robotics is actually data. One day it'll be chips, but for now it's data.

我们应该拉远看,认清现在机器人最大的问题其实是数据。有一天会是芯片,但现在是数据。

Fei-Fei Li31:04

new view prediction, this primitive that we have in Atlas, especially generative new view prediction, this is also AI complete.

新视角预测,我们在 Atlas 里的这个基元,尤其是生成式新视角预测,同样是 AI 完备的。

Justin Johnson42:18

数字与实体

Atlas 复现子弹时间所需摄像机数3 台3:18
Atlas 支持的稀疏重建输入帧数上限最多 100 帧2:15
Atlas 相对稠密重建的采集量缩减50 到 100 倍15:42
World Labs 成立时长两年半10:30
Atlas 单次可处理的图像采集量64 张18:51
多房间房子飞越所需输入从两千张降到30 到 40 张19:53

术语

new view prediction新视角预测
给定若干视角或场景描述,预测任意时空点上虚拟摄像机应看到什么。
Gaussian splat高斯泼溅
一种 3D 场景表示,渲染高效、易在移动和 VR 设备上运行,Marble 的输出格式。
NeRF神经辐射场
Ben Mildenhall 参与开创的从图像重建 3D 场景的方法,需大量稠密视角。
AI completeAI 完备
类比图灵完备:某个 AI 任务若能在最一般意义上求解,就能解决任何智能任务。
spatial intelligence空间智能
生成空间、在其中推理、并编辑和交互的能力,World Labs 的长期目标。

收听指南

谁该听

做多模态、3D 生成、世界模型和机器人仿真的工程师与研究者;评估空间智能赛道投资机会的投资人。

可跳过

30:03 附近有一段明显转写乱码,可跳过,前后机器人数据讨论仍可听。