世界太吵,來原聲聽播客

a16z

世界模型不是視頻生成:Atlas 把 3D 控制做成了輸入

語言模型處理 token,世界模型處理物理空間。Atlas 的關鍵不是生成更長的視頻,而是把相機和參考圖放進 3D 座標裡當輸入,讓生成從老虎機變成導演。

世界模型3D 生成機器人仿真VFXAtlas

原視頻在 YouTube 上放不出來,用音頻聽:

23 分鐘信息密度中等,但 Justin 把世界模型和視頻生成的分野講得很清楚,做 3D、機器人、VFX 的人值得聽。

核心論點 · 點時間戳可跳到原聲

1:05

Atlas 是模型發布,不是產品發布

Justin 開場就澄清:Atlas 不是產品,是 World Labs 的基座模型,產品後面才來。它做三件事——生成不存在的世界、從真實空間重建、在重建空間裡做仿真。生成可以從文本或圖像起步,然後直接操控相機飛過這個世界;重建可以只用一張照片,也可以給到一百張以上,照片越多重建越準;仿真則面向 VFX 和機器人。這個順序本身說明 World Labs 不打算先做消費級應用,而是先把橫向基座模型立住,再讓產品長在上面。

— Justin Johnson
4:09

參考圖被釘在 3D 空間裡,不是餵給模型

視頻模型生成到十秒左右容易開始跑偏、自己幻覺出方向,Justin 說 Atlas 的解法是 spatial context:你給的參考圖不是普通圖像,而是被 grounded 在 3D 空間裡,可以指定「這張放這裡、那張放那裡」。生成視頻時你也不只是給文本提示,而是直接操控相機,要求它往這個方向、那個方向飛,做到精確的像素級控制。所以哪怕生成到一分鐘,也不是拉老虎機,而是你在生成、在導演、在控制模型輸出什麼。

— Justin Johnson
7:10

Atlas 把 2D 和 3D 的分叉提前了

和 World Labs 第一個產品 Marble 相比,Atlas 是完全重建的模型棧。Marble 把 Gaussian splat 放在中心,輸出視頻、3D 場景、mesh 都要先經過 Gaussian 表示,再渲染回圖像或視頻。Atlas 要打破這個依賴:架構更統一、更容易擴展,2D 和 3D 的分叉發生在更早的位置。生成 2D 或視頻輸出時不再瓶頸在 Gaussian 場景上,模型直接給出 2D 像素;只有在你確實需要 3D 的應用裡,才把它提升到 3D。

— Justin Johnson
8:10

Gaussian 沒被淘汰,只是不再是必經之路

Justin 不認為 Gaussian 被 outgrow 了,它就是個工具,要用對地方。VFX 的最終產物是 2D 圖像或視頻,也許根本不需要顯式 3D。但實時應用、嵌入式設備上,Gaussian 和 mesh 這類顯式 3D 表示仍有位置:未來也許能從服務器農場實時流式傳像素,但現在還沒到,而且會很貴,所以客戶端渲染、移動端和 VR 設備上,Gaussian 或 mesh 依然有用。另一個作用是接入現有工作流——遊戲、VFX、設計、建築的人已經有基於 3D 表示的管線,與其讓他們一次性切換到全 AI 原生,不如讓 AI 進入他們的工作流。

— Justin Johnson
11:13

仿真補的是機器人訓練的最後一段路

real to sim 對機器人的價值,Justin 說首先是評估:機器人最終要在特定工廠、特定機器、特定環境裡工作,你得確保它恰好在這個環境裡能用。所以仿真在訓練和評估的最後一段路很有用——建一個儘可能貼近最終用例的仿真,然後要麼在這個仿真裡直接微調預訓練的機器人基礎模型,要麼做評估確認它能工作。這給了你一條不同於「收集大量演示或人工遙操作」的路徑。他還描述了一個更激進的版本:拿手機拍幾張照片或幾段隨手視頻,用 Atlas 重建空間,用自然語言描述任務,讓 agent 去搭仿真、做 RL 微調,幾分鐘內就得到一個適配這個空間的機器人。

— Justin Johnson
14:16

OpenAI 放下世界模型,可能是創新者困境

主持人問為什麼 OpenAI 當年把 Sora 那篇「視頻生成模型即世界模擬器」的方向做成了消費產品、現在又不做世界模型了。Justin 說不評論 OpenAI 內部策略,但給出一個解釋:可能存在創新者困境——你手裡握著 LLM 這個很強的東西,而且在這個方向上領先,那麼去投資下一個東西就不一定划算。而 World Labs 的判斷是,這裡存在另一類模型,有大量機會,他們想去做抓住機會的人。

— Justin Johnson
18:21

三臺 iPhone 拍出子彈時間,比預期好太多

被問到難物理時,Justin 說黑洞他沒試過,猜不會太驚豔。但真正讓他意外的是 bullet time:用三臺 iPhone 架在三腳架上做同步拍攝,再用 Atlas 做凍結幀、繞飛的重構圖。他舉了官方示例——草莓掉進燕麥奶,奶花濺起的瞬間凍結時間,繞著飛一圈,效果完全瘋狂。這個能力只需要三個輸入視角。這說明 Atlas 的價值不只在「生成新世界」,也在把少量真實拍攝變成傳統上需要大量相機陣列才能做的鏡頭。

— Justin Johnson
19:21

3D 在輸入端被低估了

Justin 說 3D 的價值有兩處,輸出端大家已經聊過——有時你就是需要顯式 3D 資產插進工作流或遊戲引擎。但輸入端 3D 的價值被低估了:哪怕最終輸出是 2D 的 VFX 鏡頭,讓模型提供 3D 控制面,也能幫導演決定模型該輸出什麼樣的場景。你不想只用文字寫「推進、拉遠、左移」,而是想直接抓住相機,讓它精確地按你要的方式變焦——這用文字根本描述不出來。所以 Atlas 把相機控制做成原生輸入類型,多模態裡的一模態就是相機。

— Justin Johnson

原話 · 已逐字校驗

language models are these general horizontal engines for processing streams of discrete tax, discrete tokens. Those have had tons of applications from everything that we know and love today. And our thesis is that there exists another category of model called world models that should be based in visual understanding, should be based in physical understanding that can be used to generate, simulate, reconstruct worlds.

語言模型是處理離散文本、離散 token 流的通用橫向引擎,今天我們所熟知和喜愛的一切應用都建立在它之上。我們的論點是,還存在另一類模型,叫世界模型,它應該建立在視覺理解、物理理解之上,可以用來生成、仿真、重建世界。

Justin Johnson3:07

when you give Atlas reference images, they aren't just images. They're actually grounded in 3D space. So you can stage those images in 3D and say, this reference image should be here.

當你給 Atlas 參考圖時,它們不只是圖像,它們實際上被錨定在 3D 空間裡。你可以在 3D 中擺放這些圖像,說這張參考圖應該在這裡。

Justin Johnson4:09

So the idea here is that even as you go to really long generations, it's not a slot machine. You're generating and directing and really controlling what the model outputs.

所以這裡的思路是,即使你生成很長的內容,它也不是老虎機。你在生成、在導演、在真正控制模型輸出什麼。

Justin Johnson5:09

Marble really put Gaussian splats really at the center of many things that it did. So Marble could output videos, Marble could output 3D scenes, Marble could output meshes, but everything was kind of bottlenecking through a 3D Gaussian splat representation.

Marble 把 Gaussian splat 放在它做的很多事情的中心。Marble 能輸出視頻、能輸出 3D 場景、能輸出 mesh,但所有東西都在某種程度上瓶頸在 3D Gaussian splat 表示上。

Justin Johnson7:10

I think there is maybe a sense of a bit of innovators dilemma, right? Like you're sitting on LLMs and you've got this as a really powerful thing and you're, you're leading the pack there. It doesn't necessarily make sense to try to invest in that next thing.

我覺得這裡可能有一點創新者困境的味道。你手裡握著 LLM,它是非常強大的東西,而且你在那裡領先。去投資下一個東西就不一定划算了。

Justin Johnson14:16

I think there's an underappreciated value of 3D on the input side as well. Right. Like even even in a situation like a VFX shot or something like that or the ultimate output is 2D. It's. useful for the model to offer these 3D control surfaces to let the human director figure out what kind of scene the model should output.

我認為 3D 在輸入端的價值也被低估了。哪怕是在 VFX 鏡頭這種最終輸出是 2D 的場景裡,讓模型提供這些 3D 控制面、讓人類導演去決定模型該輸出什麼樣的場景,也是有用的。

Justin Johnson19:21

you can control precisely where does the camera move because I don't just want to write in text like pan in, pan out, truck left. I want to be able to grab the camera and make it zoom exactly as I like. And there's really no way to describe that explicitly in text.

你可以精確控制相機往哪移動,因為我不想只在文字裡寫「推進、拉遠、左移」。我想能直接抓住相機,讓它完全按我喜歡的方式變焦。而這用文字根本沒法明確描述出來。

Justin Johnson20:21

數字與實體

Atlas 重建所需輸入照片數少至 1 張,多至 100 張以上2:06
Atlas 生成視頻時長示例最長約 1 分鐘4:09
bullet time 所需輸入視角3 個18:21

術語

world model世界模型
基於視覺與物理理解、可生成/仿真/重建世界的橫向基座模型。
Gaussian splat高斯潑濺
一種顯式 3D 表示,用大量高斯點重建場景,便於客戶端渲染。
real to sim實拍到仿真
用真實拍攝的照片或視頻重建 3D 空間,再在其中做機器人仿真。
bullet time子彈時間
凍結瞬間並繞場景飛行的鏡頭效果,傳統上需相機陣列。
SFT監督微調
用標註數據對預訓練模型做監督微調,Justin 說牛頓物理問題大概一次 SFT 就能解決。

收聽指南

誰該聽

做 3D 生成、VFX、遊戲引擎、機器人仿真的工程師和創業者,以及想理解世界模型與視頻模型分野的投資人。

可跳過

開頭 0:00-1:05 是節目預告和嘉賓介紹,可跳過。