世界太吵,來原聲聽播客

Latent Space

Runway 賭上 1000 張 A100:世界模型繞開數字孿生

Runway 在 Series B 階段就簽下 1000 張 A100 集群,賭視頻 scaling law 成立;如今世界模型只需一張環境照片就能 rollout 策略,繞開了為每個任務建數字孿生的老路。

世界模型視頻生成機器人算力實時模型

原視頻在 YouTube 上放不出來,用音頻聽:

Anastasis 罕見地講了 Runway 從 Gen-1 到實時世界模型的完整技術決策鏈,包括幾次差點死掉的時刻和機器人數據的分歧。

核心論點 · 點時間戳可跳到原聲

0:00

內容終將生成,工具必須重做

Runway 的起點不是做工具,而是一個外推判斷:2016、2017 年看到早期生成模型後,他們假設分辨率與質量會可預測地隨時間提升,於是推出「大部分內容終將被生成」,因此創意工具必須被重新設計。Anastasis 說這是「a matter of when, not if」。這個論點後來被證明適用範圍遠超創意工具本身——他們建研究組織後發現模型在真實世界場景裡同樣有用,於是繞了一圈又回到起點。

— Anastasis
8:12

Series B 就簽下 1000 張 A100

2022 年中,Runway 判斷 scaling law 會像作用於語言一樣作用於圖像和視頻生成,於是簽下建一個 1000 張 A100 集群的協議——當時公司還是 Series B。Anastasis 自己說這「slightly irrational」。他們設的目標是:視頻版的 latent diffusion / Stable Diffusion 時刻長什麼樣。當時最好的視頻模型是 CogVideo,只有 256×256、質量很差。他們先做 video-to-video 而非 text-to-video,因為條件更強、問題更容易,Gen-1 於 2023 年 1 月發布。

— Anastasis
20:09

Gen-2 是週末 hack 的兩段式管線

Gen-2 在 Gen-1 正式可用之前就發布了,中間只隔兩個月。原因是 text-to-video 直接做不出來,Anastasis 用一個週末項目把兩段拼起來:先讓模型從文本生成 depth map,再用 Gen-1 把 depth map 轉成 RGB。他承認這個兩段式管線會讓視頻結構偶爾看起來不對,因為必須先出深度。有意思的是這個思路後來回歸:Reve 的 text-to-image 用 planner model 先生成 bounding box 再餵給 diffusion transformer,Ideogram 同一天也發了同樣的創新。

— Anastasis
23:56

相機控制是世界模型研究的種子

Anastasis 說 camera control 是第一次讓人感覺不是在「生成一段視頻」,而是在「世界裡穿行」——這成了 world models 研究方向的種子。Runway 在 2023 年底專門成立研究組做世界模型。他們的論證是:要預測好視頻,就必須以越來越強的能力模擬世界;如果 scaling law 在視頻上成立,模型就能越來越可預測地模擬物理、人類動作與動態。他反駁「生成可愛視頻不等於理解世界」:視頻模型可以靠連續切鏡藏住物理缺陷,所以別被當前表現騙到。

— Anastasis
34:58

Sora 發布後三個月把模型放大 10 倍

Gen-3 是 2024 年、Sora 發布幾個月後推出的。Sora 最大的變化之一是用 diffusion transformer 取代 convnet,Runway 意識到必須投入模型並行與分布式訓練基礎設施,整個 2023 年秋天都在建,期間有大量 false starts 和失敗。2024 年 2 月 Sora 出來,Twitter 上到處是「Runway 完了」。Anastasis 說那幾小時是 existential crisis,但團隊用三個月把模型規模和訓練算力放大 10 倍,做出了比 Sora 更好的模型,那個夏天發布 Gen-3。

— Anastasis
44:09

界面世界模型:直接生成像素

Runway 的 interface world model 把軟件前端整個替換掉:沒有 HTML、CSS、React,界面像素直接由實時視頻生成模型輸出,點擊、拖拽、滾動都作為輸入。你可以用 prompt 描述每個元素的行為——按這個按鈕應該發生什麼。它同時是視頻音頻生成模型,能描述點擊後的視覺結果和音效。Anastasis 的表述是「為什麼要生成產生像素的代碼?直接生成像素」。目前它更貴,因為跑實時視頻模型的計算需求遠高於渲染 HTML。

— Anastasis
58:40

世界模型繞開了數字孿生

傳統模擬器要精確描述剛體物理,可以用 Isaac Sim 或 MuJoCo,但遇到布料、溼滑表面這類複雜操作就很難,要為每個環境和任務建數字孿生,非常耗時。世界模型只需要給第一幀,就能在裡面 rollout 策略——拍一張環境的照片就能測策略表現。Runway 用 Roborina benchmark 的相同場景、設置和 embodiment,測了動作模型在世界模型裡和真實世界裡的表現相關性,得到很好的相關性。這是他們模型對機器人有用的第一個信號。

— Anastasis
1:01:55

第三人稱視頻數據才是最大來源

Anastasis 把機器人數據分成幾類:遙操作數據、人類用機械臂做任務的 humie 數據、頭上戴 GoPro 的 egocentric 數據。他說這些都有用,但世界上第三人稱視頻數據比 egocentric 數據多三個數量級。人類學做事也主要靠觀察別人,不是第一人稱。所以他們的論點是:視頻預訓練之後,只需幾百小時機器人數據微調,而從頭預訓練機器人模型要十萬到百萬小時量級。他明確說「最豐富的數據源最終會贏」。

— Anastasis

原話 · 已逐字校驗

There’s gonna be a point where most of content will be generated, and that was maybe the initial thesis of Runway was we will need, as a result of those generative models, rethink how creative tools are made.

會有一個時間點,大部分內容都將被生成出來,這也許就是 Runway 最初的論點:由於這些生成模型,我們需要重新思考創意工具是怎麼做的。

Anastasis0:00

we signed this deal to build a cluster of a thousand A100s, which at the time we were a Series B startup. That was a almost, slightly irrational decision maybe, but we really believed that if we trained a video model at a large scale, we would get, like, a great model at the end.

我們簽了建一個一千張 A100 集群的協議,當時我們還是一家 Series B 創業公司。那也許是一個幾乎有點不理性的決定,但我們真的相信,如果大規模訓練一個視頻模型,最終會得到一個很棒的模型。

Anastasis8:12

There were a lot of, a lot of chatter on Twitter about Runway. Runway’s done. like, there is no way Runway will catch up.

Twitter 上有很多很多議論,說 Runway 完了,Runway 不可能追得上了。

Anastasis34:58

It’s the end-to-end philosophy applying applied to front ends.

這是把端到端哲學應用到前端上。

Anastasis45:18

the most plentiful source of data will ultimately wins.

最豐富的數據源最終會贏。

Anastasis1:01:55

I call it the lucid dream test.

我把它叫做清醒夢測試。

Anastasis1:07:47

Like one nice thing about image and video models is you can immediately tell with your eyes like what feels good from an aesthetic standpoint.

圖像和視頻模型的一個好處是,你一眼就能看出什麼在審美上是對的。

Anastasis1:23:12

And now my sense is increasingly people are gonna care about latency more and more. As those models become better, the ability to iterate very quickly becomes more important.

現在我的感覺是,人們會越來越在乎延遲。隨著模型變好,快速迭代的能力會變得更重要。

Anastasis1:26:08

數字與實體

Gen-1 發布2023 年 1 月8:12
CogVideo 分辨率256×2568:12
Gen-3 相對此前模型規模與算力提升10x34:58
character 模型自迴歸生成視頻時長最長 30 分鐘53:40
GWM Worlds 開放式世界探索生成時長幾分鐘量級53:40
Grok 視頻上下文10 到 20 秒53:40
Genie 生成時長上限最多 1 分鐘53:40
模型可接受的參考數量上限501:24:48
Runway 電影節舉辦頻率every May or June1:35:45

術語

lucid dream test清醒夢測試
分不清眼前是真實 pass-through 還是生成渲染,就說明世界模型夠好了。
step distillation步數蒸餾
把擴散模型的多步採樣壓縮成少步,以降低服務成本、提高生成速度。
error accumulation誤差累積
自迴歸生成中,每幀的小誤差被喂回模型,隨時間不斷放大。
counterfactual generation反事實生成
讓模型生成「沒發生」的結果,比如沒進球,用於模擬失敗和在線 RL。

收聽指南

誰該聽

關注視頻生成、世界模型與機器人基礎模型的創業者和工程師,以及想了解 Runway 技術路線與算力賭注的投資人。

可跳過

1:33:40 之後關於 AlphaFold 式專用架構的討論較泛,可跳過。