世界模型的新基元:不是預測下一幀,而是預測下一個視角
語言模型靠預測下一個 token,Atlas 靠預測下一個視角。它把生成和重建放進同一個模型,用三臺 iPhone 復現《黑客帝國》幾百臺攝像機才拍出的子彈時間。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
Atlas 把生成和重建塞進同一個模型
Justin 說 Atlas 有三件事:生成、重建、模擬。核心變化是它第一次把像素生成和像素重建統一在一個架構裡——歷史上重建是計算機視覺的獨立子領域,有自己的專門模型;生成則是擴散模型的強項。Fei-Fei Li 強調這個統一「anchoring on viewpoints」,靠視角估計把兩條傳統賽道縫在一起。為此模型從預訓練階段就是原生多模態:文本、圖像、視頻、相機位姿、3D 都是原生輸入,相機位姿作為預訓練輸入此前沒人做過。
— Justin Johnson / Fei-Fei Li三臺 iPhone 拍出子彈時間
《黑客帝國》裡 Neo 後仰那一鏡,是綠幕前幾百臺攝像機圍成一圈拍的。Atlas 用三臺 iPhone 就能復現:拍下有人投籃、有人把草莓丟進牛奶,然後重新取景、凍結時間、讓鏡頭飛進牛奶濺起的瞬間。Ben 說這是「no studio capture, no green screen, no expensive calibration」。這個畫面是理解 Atlas 能力最直觀的入口——它不只是生成好看的像素,而是能在任意時空點重新架設虛擬攝像機。
— Justin Johnson稠密重建要幾百張照片,Atlas 要三張
Ben 解釋稠密重建為什麼稠密:要讓某個東西出現在重建裡,你至少需要它的三四個視角。這個房間的麥克風底下、桌子底下、椅腿之間、植物葉子,全都要覆蓋到,訓練有素的人要拍幾分鐘,普通消費者第一次掃一個多房間環境可能花兩小時。Atlas 把這個數字壓到三張,Ben 說這是「50, 100 X reduction」。他拿自己以前拍的兩千張多房間房子的素材,砍到三四十張輸入,飛越效果基本一樣。
— Ben Mildenhall重建必然有洞,所以必須生成
Justin 給出生成和重建必須耦合的機制:傳統重建靠多視角三角化同一個 3D 點,任何沒被輸入視角看到的像素就是洞。就算讓 Ben 拿單反拍幾百張,也永遠拍不到所有麥克風底下和桌腿之間。所以模型必須有生成能力去「想像」沒拍到的部分。他把這類比成 LLM 的上下文:重建就是上下文極長的生成,Atlas 能塞進 64 張圖的採集做整棟房子的飛越,而 Marble 時代根本塞不進超過幾張圖。
— Justin Johnson瓶頸是算力,不是架構,也不是數據
被問是否到了這個架構的擴展盡頭,Justin 說「No, no, we're at the beginning」,而且不用改架構。他明確說當前主要瓶頸是訓練算力:開發時訓了一串模型,每加大、每訓久、每上更多芯片,都顯著變好;這次發布的模型大小是被發布日期倒推決定的,不是被規模或數據限制的。Fei-Fei Li 補充,他們早期就押注兩個假設——scaling law 和 next viewpoint prediction,但沒料到第一輪預訓練就能到這個質量。
— Justin Johnson / Fei-Fei Li那張桌子下的鏡頭讓三人五秒內拍板
Fei-Fei Li 講了一個內部時刻:初夏某天,還不是現在這個 Atlas 規模,是個更小的模型,Ben 把視角生成接進去,用 Nerf 論文那張著名的花園桌子,鏡頭從桌子底下飛過,還帶著一個足球。她強調「no one has ever seen this result」。那天早上三個人對視,說就是它了,五秒內做了決定。這個細節說明技術判斷不是靠路線圖,是靠一個具體畫面。
— Fei-Fei Li機器人最大的瓶頸是數據,不是芯片
Fei-Fei Li 說機器人現在最大的問題是數據,芯片是以後的事。要訓一個做線纜操作的機械臂,需要真實到仿真、仿真到真實的循環,還要做 randomization——同一根線纜要能往不同方向彎,盒子要有不同尺寸、顏色、蓋子。收購的 Cinex 團隊原本就在做稠密重建,極其痛苦、拖慢仿真速度,Atlas 是這一環的下一代技術。Justin 補充機器人和別的 AI 應用本質不同:策略不是產出靜態 artifact,而是要在真實世界裡行動、遭遇意外,所以必須靠仿真暴露所有可能的失敗。
— Fei-Fei Li / Justin Johnson新視角預測和下一 token 預測一樣是 AI 完備的
Justin 用 AI completeness 論證 Atlas 基元的地位:三 SAT 是 NP 完備的經典例子,因為任何 NP 難問題都能歸約到它;下一 token 預測被認為 AI 完備,因為可以構造一個推理小說,最後一句是「兇手是」然後預測下一個 token。他說生成式新視角預測同樣 AI 完備——你可以讓 Martine 在黑板上寫黎曼猜想的證明,Cameron 在隔壁白板把它解出來。Fei-Fei Li 補了進化論版本:大自然給了動物眼睛卻沒給樹眼睛,因為動物會動,動了就能看到新視角。
— Justin Johnson / Fei-Fei Li原話 · 已逐字校驗
But now with Atlas, we can do this with as few as three cameras. So no studio capture, no green screen, no expensive calibration.
但現在用 Atlas,三臺攝像機就能做到。不需要攝影棚採集,不需要綠幕,不需要昂貴的標定。
Justin Johnson3:18
With Atlas, every image actually has an associated three-dimensional camera pose.
在 Atlas 裡,每一張圖像實際上都關聯著一個三維相機位姿。
Ben Mildenhall4:25
I've seen someone for their first time trying to scan a multi-room environment, spend like two hours walking through it and get enough coverage.
我見過有人第一次掃一個多房間環境,走了兩個小時才拿到足夠的覆蓋。
Ben Mildenhall15:42
No, no, we're at the beginning.
不,不,我們才剛開始。
Justin Johnson22:56
That morning, the three of us looked at each other in the eyes and said, that's it, this is, we're going to build this. Like, we made a decision within five seconds.
那天早上,我們三個人對視,說就是它了,我們要做這個。我們五秒內就做了決定。
Fei-Fei Li23:56
We should zoom out and recognize the biggest problem right now in robotics is actually data. One day it'll be chips, but for now it's data.
我們應該拉遠看,認清現在機器人最大的問題其實是數據。有一天會是芯片,但現在是數據。
Fei-Fei Li31:04
new view prediction, this primitive that we have in Atlas, especially generative new view prediction, this is also AI complete.
新視角預測,我們在 Atlas 裡的這個基元,尤其是生成式新視角預測,同樣是 AI 完備的。
Justin Johnson42:18
數字與實體
| Atlas 復現子彈時間所需攝像機數 | 3 臺 | 3:18 |
| Atlas 支持的稀疏重建輸入幀數上限 | 最多 100 幀 | 2:15 |
| Atlas 相對稠密重建的採集量縮減 | 50 到 100 倍 | 15:42 |
| World Labs 成立時長 | 兩年半 | 10:30 |
| Atlas 單次可處理的圖像採集量 | 64 張 | 18:51 |
| 多房間房子飛越所需輸入從兩千張降到 | 30 到 40 張 | 19:53 |
術語
- new view prediction新視角預測
- 給定若干視角或場景描述,預測任意時空點上虛擬攝像機應看到什麼。
- Gaussian splat高斯潑濺
- 一種 3D 場景表示,渲染高效、易在移動和 VR 設備上運行,Marble 的輸出格式。
- NeRF神經輻射場
- Ben Mildenhall 參與開創的從圖像重建 3D 場景的方法,需大量稠密視角。
- AI completeAI 完備
- 類比圖靈完備:某個 AI 任務若能在最一般意義上求解,就能解決任何智能任務。
- spatial intelligence空間智能
- 生成空間、在其中推理、並編輯和交互的能力,World Labs 的長期目標。
收聽指南
做多模態、3D 生成、世界模型和機器人仿真的工程師與研究者;評估空間智能賽道投資機會的投資人。
30:03 附近有一段明顯轉寫亂碼,可跳過,前後機器人數據討論仍可聽。