世界太吵,來原聲聽播客

a16z

世界模型的新基元:不是預測下一幀,而是預測下一個視角

語言模型靠預測下一個 token,Atlas 靠預測下一個視角。它把生成和重建放進同一個模型,用三臺 iPhone 復現《黑客帝國》幾百臺攝像機才拍出的子彈時間。

世界模型空間智能3D 重建機器人仿真多模態

原視頻在 YouTube 上放不出來,用音頻聽:

Fei-Fei Li 和 World Labs 三位聯創親自講清新模型 Atlas 的技術選擇與取捨,含具體數字和內部決策時刻,信息密度高。

核心論點 · 點時間戳可跳到原聲

1:10

Atlas 把生成和重建塞進同一個模型

Justin 說 Atlas 有三件事:生成、重建、模擬。核心變化是它第一次把像素生成和像素重建統一在一個架構裡——歷史上重建是計算機視覺的獨立子領域,有自己的專門模型;生成則是擴散模型的強項。Fei-Fei Li 強調這個統一「anchoring on viewpoints」,靠視角估計把兩條傳統賽道縫在一起。為此模型從預訓練階段就是原生多模態:文本、圖像、視頻、相機位姿、3D 都是原生輸入,相機位姿作為預訓練輸入此前沒人做過。

— Justin Johnson / Fei-Fei Li
3:18

三臺 iPhone 拍出子彈時間

《黑客帝國》裡 Neo 後仰那一鏡,是綠幕前幾百臺攝像機圍成一圈拍的。Atlas 用三臺 iPhone 就能復現:拍下有人投籃、有人把草莓丟進牛奶,然後重新取景、凍結時間、讓鏡頭飛進牛奶濺起的瞬間。Ben 說這是「no studio capture, no green screen, no expensive calibration」。這個畫面是理解 Atlas 能力最直觀的入口——它不只是生成好看的像素,而是能在任意時空點重新架設虛擬攝像機。

— Justin Johnson
13:32

稠密重建要幾百張照片,Atlas 要三張

Ben 解釋稠密重建為什麼稠密:要讓某個東西出現在重建裡,你至少需要它的三四個視角。這個房間的麥克風底下、桌子底下、椅腿之間、植物葉子,全都要覆蓋到,訓練有素的人要拍幾分鐘,普通消費者第一次掃一個多房間環境可能花兩小時。Atlas 把這個數字壓到三張,Ben 說這是「50, 100 X reduction」。他拿自己以前拍的兩千張多房間房子的素材,砍到三四十張輸入,飛越效果基本一樣。

— Ben Mildenhall
17:47

重建必然有洞,所以必須生成

Justin 給出生成和重建必須耦合的機制:傳統重建靠多視角三角化同一個 3D 點,任何沒被輸入視角看到的像素就是洞。就算讓 Ben 拿單反拍幾百張,也永遠拍不到所有麥克風底下和桌腿之間。所以模型必須有生成能力去「想像」沒拍到的部分。他把這類比成 LLM 的上下文:重建就是上下文極長的生成,Atlas 能塞進 64 張圖的採集做整棟房子的飛越,而 Marble 時代根本塞不進超過幾張圖。

— Justin Johnson
22:56

瓶頸是算力,不是架構,也不是數據

被問是否到了這個架構的擴展盡頭,Justin 說「No, no, we're at the beginning」,而且不用改架構。他明確說當前主要瓶頸是訓練算力:開發時訓了一串模型,每加大、每訓久、每上更多芯片,都顯著變好;這次發布的模型大小是被發布日期倒推決定的,不是被規模或數據限制的。Fei-Fei Li 補充,他們早期就押注兩個假設——scaling law 和 next viewpoint prediction,但沒料到第一輪預訓練就能到這個質量。

— Justin Johnson / Fei-Fei Li
23:56

那張桌子下的鏡頭讓三人五秒內拍板

Fei-Fei Li 講了一個內部時刻:初夏某天,還不是現在這個 Atlas 規模,是個更小的模型,Ben 把視角生成接進去,用 Nerf 論文那張著名的花園桌子,鏡頭從桌子底下飛過,還帶著一個足球。她強調「no one has ever seen this result」。那天早上三個人對視,說就是它了,五秒內做了決定。這個細節說明技術判斷不是靠路線圖,是靠一個具體畫面。

— Fei-Fei Li
29:03

機器人最大的瓶頸是數據,不是芯片

Fei-Fei Li 說機器人現在最大的問題是數據,芯片是以後的事。要訓一個做線纜操作的機械臂,需要真實到仿真、仿真到真實的循環,還要做 randomization——同一根線纜要能往不同方向彎,盒子要有不同尺寸、顏色、蓋子。收購的 Cinex 團隊原本就在做稠密重建,極其痛苦、拖慢仿真速度,Atlas 是這一環的下一代技術。Justin 補充機器人和別的 AI 應用本質不同:策略不是產出靜態 artifact,而是要在真實世界裡行動、遭遇意外,所以必須靠仿真暴露所有可能的失敗。

— Fei-Fei Li / Justin Johnson
41:18

新視角預測和下一 token 預測一樣是 AI 完備的

Justin 用 AI completeness 論證 Atlas 基元的地位:三 SAT 是 NP 完備的經典例子,因為任何 NP 難問題都能歸約到它;下一 token 預測被認為 AI 完備,因為可以構造一個推理小說,最後一句是「兇手是」然後預測下一個 token。他說生成式新視角預測同樣 AI 完備——你可以讓 Martine 在黑板上寫黎曼猜想的證明,Cameron 在隔壁白板把它解出來。Fei-Fei Li 補了進化論版本:大自然給了動物眼睛卻沒給樹眼睛,因為動物會動,動了就能看到新視角。

— Justin Johnson / Fei-Fei Li

原話 · 已逐字校驗

But now with Atlas, we can do this with as few as three cameras. So no studio capture, no green screen, no expensive calibration.

但現在用 Atlas,三臺攝像機就能做到。不需要攝影棚採集,不需要綠幕,不需要昂貴的標定。

Justin Johnson3:18

With Atlas, every image actually has an associated three-dimensional camera pose.

在 Atlas 裡,每一張圖像實際上都關聯著一個三維相機位姿。

Ben Mildenhall4:25

I've seen someone for their first time trying to scan a multi-room environment, spend like two hours walking through it and get enough coverage.

我見過有人第一次掃一個多房間環境,走了兩個小時才拿到足夠的覆蓋。

Ben Mildenhall15:42

No, no, we're at the beginning.

不,不,我們才剛開始。

Justin Johnson22:56

That morning, the three of us looked at each other in the eyes and said, that's it, this is, we're going to build this. Like, we made a decision within five seconds.

那天早上,我們三個人對視,說就是它了,我們要做這個。我們五秒內就做了決定。

Fei-Fei Li23:56

We should zoom out and recognize the biggest problem right now in robotics is actually data. One day it'll be chips, but for now it's data.

我們應該拉遠看,認清現在機器人最大的問題其實是數據。有一天會是芯片,但現在是數據。

Fei-Fei Li31:04

new view prediction, this primitive that we have in Atlas, especially generative new view prediction, this is also AI complete.

新視角預測,我們在 Atlas 裡的這個基元,尤其是生成式新視角預測,同樣是 AI 完備的。

Justin Johnson42:18

數字與實體

Atlas 復現子彈時間所需攝像機數3 臺3:18
Atlas 支持的稀疏重建輸入幀數上限最多 100 幀2:15
Atlas 相對稠密重建的採集量縮減50 到 100 倍15:42
World Labs 成立時長兩年半10:30
Atlas 單次可處理的圖像採集量64 張18:51
多房間房子飛越所需輸入從兩千張降到30 到 40 張19:53

術語

new view prediction新視角預測
給定若干視角或場景描述,預測任意時空點上虛擬攝像機應看到什麼。
Gaussian splat高斯潑濺
一種 3D 場景表示,渲染高效、易在移動和 VR 設備上運行,Marble 的輸出格式。
NeRF神經輻射場
Ben Mildenhall 參與開創的從圖像重建 3D 場景的方法,需大量稠密視角。
AI completeAI 完備
類比圖靈完備:某個 AI 任務若能在最一般意義上求解,就能解決任何智能任務。
spatial intelligence空間智能
生成空間、在其中推理、並編輯和交互的能力,World Labs 的長期目標。

收聽指南

誰該聽

做多模態、3D 生成、世界模型和機器人仿真的工程師與研究者;評估空間智能賽道投資機會的投資人。

可跳過

30:03 附近有一段明顯轉寫亂碼,可跳過,前後機器人數據討論仍可聽。