視頻生成不缺速度了,缺的是導演手裡的控制權
FAL 把開源視頻模型後訓練到比原版快一個數量級、便宜一個數量級,然後判斷:速度已經不是瓶頸,接下來拼的是相機、燈光、角色和動作的可控性。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
開源權重才是後訓練的前提
FAL 之前也給別的模型實驗室跑推理,但沒有權限在模型上疊加能力。Minimax H3 是第一個真正開源、且屬於最新一代的視頻模型,能接受參考圖、架構和其他視頻模型類似,這才讓 FAL 決定 all in 做後訓練。Gorka 說,這次所有優化能湊到一起,最大的原因就是 H3 是第一個真正下一代的開源視頻模型——沒有權重,就沒有後訓練這門生意。
— Gorka Mirdsevin整個行業從四月起被算力卡住
Gorka 提出一個判斷標準叫 token market fit:一個人能不能有生產力地消耗大量 token,量級在 10K 這種水平。視頻生成的需求足夠大,做這行的人整天坐在電腦前生成,花掉幾千美元。但從四月開始,整個行業和 FAL 自己都受算力約束,加多少算力就增長多少。所以 FAL 一直在找效率,把省下來的算力釋放給別的模型,或者讓 H3 Max 生成更多 token。
— Gorka Mirdsevin系統優化撞到屋頂線,後訓練把它頂穿
Batuan 說,過去三四年做的系統級優化,最多讓同一個模型快 2 到 3 倍,因為架構和約束沒變,只是把芯片榨得更幹,而這條屋頂線是存在的。新的後訓練加系統與模型協同設計,能越過這條屋頂線一個數量級。FAL 之前在開源圖像模型上練過手,做過 ideogram 和 flux 的版本,積累了後訓練基礎設施的經驗,這次加上一個前沿視頻模型,速度提升了一個數量級。
— Batuan Tashkaya先提質量,再壓步數,順序不能反
擴散模型從 50 步壓到 20 步會掉質量,所以 FAL 的做法是先跑後訓練和 L 管線把模型質量提上去,再疊加優化棧,讓最終結果質量持平甚至更高,同時快一個數量級。除了後訓練,還有 kernel 和系統工程把硬件利用率從推理負載常見的 30-40% 拉到 70-80% 的理論 MFU。而且視頻模型不是單次調用,底層是管線:先用大 LLM 擴寫 prompt,再在 latent 空間生成,再解碼回像素,按負載還可能加超分,每個組件默認都沒優化過。
— Batuan TashkayaTurbo 版五秒視頻一點五秒出
H3 Max 發布一週後,團隊發現能以 2 倍速度跑、質量還在 97 分位,於是公開了 H3 Max Turbo:生成五秒視頻只要 1.5 秒,成本也降一半。Gorka 的判斷是,今天這些模型已經足夠便宜足夠快,成本比前沿模型便宜一個數量級,速度比前沿快一個數量級以上,用戶不需要更快更便宜了。他的賭注是接下來要提升質量,以及可控性——這才是過去兩三週在推的方向。
— Gorka Mirdsevin連續視頻靠兩分鐘記憶,不是靠最後一幀
Rehan 和 levels io 各自做的直播,本質是獨立片段:一段結束,取最後一幀餵給下一段,第二段除了最後一幀不記得任何東西。FAL 內部 ML 團隊做的是另一套:過渡更無縫,有兩分鐘記憶,有人走進房間時所有人都會看向他,場景是連續的。它記住的是原始視頻的高度壓縮表示,兩分鐘以上則靠一個持續演化的 system prompt 維持整體連貫,所以能記住最近四到八個場景,並無限流下去。
— Gorka MirdsevinBlender 加視頻模型等於接近百分之百可控
專業工作流裡最流行的一種:先用 Blender 這類非 AI 技術渲染一個低分辨率場景,再把這段視頻作為參考餵給 AI 模型,基本能拿到接近 100% 的可控性。H3 Max 發布一週後,人們開始用 GPT Astra 在 Blender 裡生成場景,再交給 H3 Max,因為它足夠快,可以並行試很多次,於是打開了一條全新管線。Gorka 說接下來一兩個月會全力做可控性,讓工作室和專業創作者能拿到完全貼合自己用例的內容。
— Gorka Mirdsevin好萊塢要的是小點解決方案,不是從零生成
Gorka 說好萊塢是 FAL 增長最快的板塊,一年前使用量幾乎為零。Amazon MGM Studios 發布的 NARA 工具背後主要是 FAL 的基礎設施。好萊塢要的不是從零生成一切,而是把視頻延長一點、改相機控制、改燈光——這些小點解決方案。研究實驗室在做的和創作者真正需要的之間存在脫節,FAL 想用後訓練項目補上這個缺口。另一半問題是法律和數據駐留,Seedance 現在也有了美國託管,Gorka 認為好萊塢的 AI 使用量會在接下來幾個月漲 10 倍、100 倍。
— Gorka Mirdsevin原話 · 已逐字校驗
the biggest reason why everything came together for this particular moment was because H3 was the first truly next generation video model that's open-source.
所有事情能在這個時間點湊到一起,最大的原因是 H3 是第一個真正下一代的、開源的視頻模型。
Gorka Mirdsevin3:02
since around April, the whole industry and FAL itself, we've been compute constrained. We are growing as much as we are adding compute.
大概從四月開始,整個行業和 FAL 自己都受算力約束。我們加多少算力,就增長多少。
Gorka Mirdsevin4:02
this new set of post-training-related optimizations with system-slash-model co-design enables us to go beyond that roof line by an order of magnitude.
這套新的後訓練優化,加上系統與模型的協同設計,讓我們能越過那條屋頂線一個數量級。
Batuan Tashkaya5:04
we have a version called H3 Max Turbo that's public that can generate like a five second video in like 1.5 seconds, which is like insane.
我們有一個公開的版本叫 H3 Max Turbo,生成五秒視頻只要 1.5 秒,這簡直離譜。
Gorka Mirdsevin10:19
my bet today is we just need to improve quality more than like the speed at these speeds
我今天的賭注是,在這樣的速度下,我們更需要提升的是質量,而不是速度。
Gorka Mirdsevin11:25
everyone's waiting for a large consumer moment in AI. Now it's like good enough and cheap enough that like a truly novel social AI experience can be built on top of it.
所有人都在等 AI 的大型消費級時刻。現在它已經足夠好、足夠便宜,可以在上面搭建真正新穎的社交 AI 體驗了。
Gorka Mirdsevin25:55
Hollywood is our fastest growing segment. And there's a lot of noise about how AI might disrupt Hollywood, but Hollywood usage was non-existent a year ago.
好萊塢是我們增長最快的板塊。關於 AI 會如何顛覆好萊塢有很多噪音,但一年前好萊塢的使用量幾乎為零。
Gorka Mirdsevin34:03
數字與實體
| H3 Max 相對原版 Minimax H3 端點的加速倍數 | 35x | 6:09 |
| 硬件利用率提升區間 | 從 30-40% 提升到 70-80% | 7:10 |
| H3 Max Turbo 生成五秒視頻耗時 | 1.5 秒 | 10:19 |
| H3 Max Turbo 成本降幅 | 2x less | 10:19 |
| H3 Max Director 可連續生成的視頻時長 | 最長 60 分鐘 | 19:47 |
| H3 Max Director 的記憶窗口 | 2 分鐘 | 18:45 |
| H3 Max 在 FAL 平臺上的使用量領先幅度 | 是第二名的兩倍多 | 22:54 |
| Hopper 到 Blackwell 的硬件提升 | 2 到 3 倍 | 9:15 |
術語
- token market fittoken 市場契合
- FAL 的定義:一個人能否有生產力地消耗大量 token,量級約 10K。
- MFU模型浮點利用率
- 衡量芯片算力被實際利用程度的指標,70-80% 已接近理論上限。
- roofline屋頂線
- 同一模型架構下,靠系統優化能榨出的性能上限。
- LoRa低秩適配微調
- 在基礎模型上疊加的小型微調,用來加相機角度、風格等特定能力。
- VAE變分自編碼器
- 視頻管線裡把 latent 表示解碼回像素的組件。
收聽指南
做視頻生成、推理基礎設施或 AI 工具鏈的工程師和創業者,以及關注 Hollywood 與生成式媒體結合的投資者。
開頭兩分鐘的主持人介紹和結尾的播客宣傳可以跳過。