Sora 是 GPT-3 時刻,不是 ChatGPT 時刻
Sora 展現的是湧現出來的能力,不是可用的產品;它把大模型戰爭推到新高度,但一年追上過於樂觀,因為能做和真做出來之間隔著大量 know how。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
Sora 是 GPT-3 時刻,不是 ChatGPT 時刻
季逸超把 Sora 類比成 GPT-3:它是一個湧現出某些能力的模型,而不是一個產品。ChatGPT 是把 GPT 對齊成 Chat 形式的產品革新,用戶能對話、能產生更多 input 和 feedback;而 Sora 現在生成一個視頻就沒了,跟用戶沒有互動。所以它要變成產品還有很遠的過程,湧現看到的只是火花。這個區分決定了怎麼給 Sora 定價:它證明已知的模型結構能做出 Sora,但不等於馬上能收錢。
— 季逸超模型規模約 6B,算力一兩千張 H100
採樣下來,模型參數量大概 6B 左右,依據是 Tech Report 裡 4 倍、16 倍 compute 的 scaling 例子,按 DiT paper 做 baseline 推算。訓練算力可能是一兩千張 H100 的規模,也就是幾千萬美金量級,不是十億美金才能做。但做實驗和最後訓一遍是兩回事,OpenAI 已部署的卡估計二十幾萬張,可以用更多卡平行做實驗。數據是現在大家最關注的,因為模型 size 沒有顯著提高,進展一般就在數據和數據處理方式上。
— 季逸超能做和真做出來之間隔著 know how
戴雨森認為 6 到 12 個月追上 Sora 過於樂觀。大方向知道,但具體地方怎麼調優不知道,就是要畫桌的。去年 GPT-4 出來之後很多公司說年底追上,現在 2024 年了,真正全面達到 GPT-4 水平的可能也就 Google 的 Gemini 1.5,而且還沒用上實際產品。季逸超補充,OpenAI 的起點比國內公司高很多,Sora 用了 DALL·E 3 的 recaptioning,語言 conditioning 部分也許用了 GPT 的權重,所以即使有 Sora 在這,仍需要投入很長時間才能接近。
— 戴雨森Sora 把戰爭推到新高度,也引來監管
Sora 發布對全球大模型戰局的影響,首先是把這個戰爭推到新的高度。一線公司都知道多模態會有這樣的突破,只是時間提前了,很多原來的計劃都得變。它不像 ChatGPT 是交互模型,作為純粹的生成模型,生成之後接下來做什麼還未知。但它如此直觀地呈現出一個這麼好的視頻,對創業公司、應用公司、文娛影視行業、政府部門衝擊都很大,也會引來更多對 AI 監管的擔憂,廣電等部門對 Sora 的出現非常關注。
— 戴雨森世界模擬器分物理、社交、長時間三層
季逸超把世界模擬分成不同層次:第一階段是航拍空景這種偏靜態的景色;第二階段是物理因果,比如杯子裝水落地打碎,但 Sora 這個例子效果很不好,杯子不知道怎麼碎;再下個層面是社交因果,比如沙灘上出現鯊魚會驚訝,出現海豚會覺得可愛,出現鱷魚會逃跑,或者嬰兒打爸爸一拳和壯漢打瘦人一拳含義完全不同;再進一步是電影裡開頭和結尾的呼應。他認為 Sora 現在體現的還是湧現的能力,真正要用到花的時間挺長。
— 季逸超大一統模型還沒找到可行路徑
語言是離散的,圖片和音頻是自然的連續信號,把所有不同輸入放到一個特徵空間裡本身就是難點。更難的是訓練目標:語言模型預測下一個單詞,Diffusion 模型學會造或預測噪音,如何設計一個 Loss 或任務讓它同時實現多模態理解和多模態輸出,非常難且值得研究。目前還沒有確切證據表明把多種模態一起訓練能讓模型能力獲得更高突破,多模態模型主要能力還是來自語言的 backbone,更可能的結果是縫合或外掛形式推進。
— 季逸超泡沫不可怕,它帶來基建
戴雨森說泡沫會帶來重要的基建,基建為未來的應用打下基礎,泡沫中死掉的 99% 會死掉,但 1% 留下來的可能就是偉大公司。互聯網泡沫破滅之後留下來的是亞馬遜、Google,雅虎當時也存續了很長時間。現在遠沒有到達泡沫比較瘋狂的時候,因為互聯網真正的高峰來自第一波互聯網 Native 應用真正落地、真正上市的時候。為什麼不等泡沫破裂再投?因為完全不投會錯過亞馬遜、Google,而且過程中獲得的行業認知很重要,很難只吃第五個包子。
— 戴雨森AI 應用有用更慢,擴散更快
季逸超用移動互聯網類比:iPhone 時刻之後還有 App Store 時刻和 iPhone 4 時刻,現在 GPT 有 GPT store 但完全不能跟 App Store 類比,可能處在 0708 年的時間點。戴雨森認為在現有範式下,AI 應用出現有用的時間點會比移動互聯網慢,因為需要模型到達一定能力程度才能從沒用湧現成有用;但一旦變得有用,擴散速度可能遠快於移動互聯網,因為互聯網和移動互聯網是軟件和硬件都要擴散的過程,而 AI 只要設備沒變化,跑在手機上,有用就可能一兩年席捲幾億人。
— 戴雨森原話 · 已逐字校驗
Sora現在也是一個湧現出來了某些能力的一個模型 但是它要變成一個產品 其實這個過程中還有很遠的過程
Sora 現在也是一個湧現出某些能力的模型,但它要變成一個產品,其實這個過程中還有很遠的過程。
季逸超4:07
因為我覺得能做和真能做出來 其實中間隔很多know how
因為我覺得能做和真能做出來,其實中間隔很多 know how。
戴雨森29:16
泡沫不可怕 我們泡沫會帶來重要的基建 基建會為未來的應用打下基礎 就泡沫中死掉的99%會死掉 但是1%留下來的可能就是偉大公司
泡沫不可怕,泡沫會帶來重要的基建,基建會為未來的應用打下基礎,泡沫中死掉的 99% 會死掉,但 1% 留下來的可能就是偉大公司。
戴雨森56:19
我們要避免一個陷阱 就是在技術還不夠好的時候 過分雕花
我們要避免一個陷阱,就是在技術還不夠好的時候,過分雕花。
戴雨森1:09:39
在現有的範式下 AI應用 它可能應用出現 有用的時間點 會比移動互聯網要慢 因為它需要模型 到達一定的能力程度 它才能從沒用 湧現成有用 但是當它一旦變得有用之後 它的擴散速度 可能會遠快於 移動互聯網的應用
在現有的範式下,AI 應用出現有用的時間點會比移動互聯網慢,因為它需要模型到達一定的能力程度,才能從沒用湧現成有用;但當它一旦變得有用之後,它的擴散速度可能會遠快於移動互聯網的應用。
戴雨森1:14:27
如果你把你現在 年富力強的時候的思路 交給未來的一個AI的話 其實你一定程度上 能獲得一個數字的一個永生
如果你把你現在年富力強的時候的思路交給未來的一個 AI 的話,其實你一定程度上能獲得一個數字的永生。
季逸超1:30:45
數字與實體
| Sora 訓練算力推測 | 一兩千張 H100 | 28:54 |
| Sora 訓練成本推測 | 幾千萬美金量級 | 28:54 |
| OpenAI 已部署卡數量估計 | 二十幾萬張 | 23:45 |
| Sora 生成一分鐘視頻推理時間 | 現實中約 20 分鐘 | 33:18 |
| Sora 生成視頻時長 | 60 秒 | 27:16 |
| 國內大模型融資規模 | 百億美金級 | 52:32 |
| 全球大模型融資規模 | 幾百億美金 | 52:32 |
| ChatGPT 用戶數 | 一億多人用過 | 1:32:45 |
術語
- DiTDiffusion Transformer
- 用 Transformer 架構做擴散生成的模型結構,Sora 的骨幹。
- recaptioning重寫描述
- 用 GPT-4 給訓練素材寫更詳細的文字描述,增強生成真實度。
- native resolution原生分辨率
- 模型訓練和推理支持各種分辨率,直接輸出適合設備的分辨率。
- cherry picking挑選展示
- 從多次生成結果裡挑最好的展示,外界看不到失敗案例。
- alignment對齊
- 讓模型行為符合人類意圖和價值觀,涉及與誰對齊的問題。
收聽指南
關注大模型戰局的投資人、做視頻生成或多模態的工程師、想判斷 Sora 追趕時間表的創業者。
1:31:43 起聊即刻和估值方法偏閒聊,可跳過。