Sora 是 GPT-3 时刻,不是 ChatGPT 时刻
Sora 展现的是涌现出来的能力,不是可用的产品;它把大模型战争推到新高度,但一年追上过于乐观,因为能做和真做出来之间隔着大量 know how。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
Sora 是 GPT-3 时刻,不是 ChatGPT 时刻
季逸超把 Sora 类比成 GPT-3:它是一个涌现出某些能力的模型,而不是一个产品。ChatGPT 是把 GPT 对齐成 Chat 形式的产品革新,用户能对话、能产生更多 input 和 feedback;而 Sora 现在生成一个视频就没了,跟用户没有互动。所以它要变成产品还有很远的过程,涌现看到的只是火花。这个区分决定了怎么给 Sora 定价:它证明已知的模型结构能做出 Sora,但不等于马上能收钱。
— 季逸超模型规模约 6B,算力一两千张 H100
采样下来,模型参数量大概 6B 左右,依据是 Tech Report 里 4 倍、16 倍 compute 的 scaling 例子,按 DiT paper 做 baseline 推算。训练算力可能是一两千张 H100 的规模,也就是几千万美金量级,不是十亿美金才能做。但做实验和最后训一遍是两回事,OpenAI 已部署的卡估计二十几万张,可以用更多卡平行做实验。数据是现在大家最关注的,因为模型 size 没有显著提高,进展一般就在数据和数据处理方式上。
— 季逸超能做和真做出来之间隔着 know how
戴雨森认为 6 到 12 个月追上 Sora 过于乐观。大方向知道,但具体地方怎么调优不知道,就是要画桌的。去年 GPT-4 出来之后很多公司说年底追上,现在 2024 年了,真正全面达到 GPT-4 水平的可能也就 Google 的 Gemini 1.5,而且还没用上实际产品。季逸超补充,OpenAI 的起点比国内公司高很多,Sora 用了 DALL·E 3 的 recaptioning,语言 conditioning 部分也许用了 GPT 的权重,所以即使有 Sora 在这,仍需要投入很长时间才能接近。
— 戴雨森Sora 把战争推到新高度,也引来监管
Sora 发布对全球大模型战局的影响,首先是把这个战争推到新的高度。一线公司都知道多模态会有这样的突破,只是时间提前了,很多原来的计划都得变。它不像 ChatGPT 是交互模型,作为纯粹的生成模型,生成之后接下来做什么还未知。但它如此直观地呈现出一个这么好的视频,对创业公司、应用公司、文娱影视行业、政府部门冲击都很大,也会引来更多对 AI 监管的担忧,广电等部门对 Sora 的出现非常关注。
— 戴雨森世界模拟器分物理、社交、长时间三层
季逸超把世界模拟分成不同层次:第一阶段是航拍空景这种偏静态的景色;第二阶段是物理因果,比如杯子装水落地打碎,但 Sora 这个例子效果很不好,杯子不知道怎么碎;再下个层面是社交因果,比如沙滩上出现鲨鱼会惊讶,出现海豚会觉得可爱,出现鳄鱼会逃跑,或者婴儿打爸爸一拳和壮汉打瘦人一拳含义完全不同;再进一步是电影里开头和结尾的呼应。他认为 Sora 现在体现的还是涌现的能力,真正要用到花的时间挺长。
— 季逸超大一统模型还没找到可行路径
语言是离散的,图片和音频是自然的连续信号,把所有不同输入放到一个特征空间里本身就是难点。更难的是训练目标:语言模型预测下一个单词,Diffusion 模型学会造或预测噪音,如何设计一个 Loss 或任务让它同时实现多模态理解和多模态输出,非常难且值得研究。目前还没有确切证据表明把多种模态一起训练能让模型能力获得更高突破,多模态模型主要能力还是来自语言的 backbone,更可能的结果是缝合或外挂形式推进。
— 季逸超泡沫不可怕,它带来基建
戴雨森说泡沫会带来重要的基建,基建为未来的应用打下基础,泡沫中死掉的 99% 会死掉,但 1% 留下来的可能就是伟大公司。互联网泡沫破灭之后留下来的是亚马逊、Google,雅虎当时也存续了很长时间。现在远没有到达泡沫比较疯狂的时候,因为互联网真正的高峰来自第一波互联网 Native 应用真正落地、真正上市的时候。为什么不等泡沫破裂再投?因为完全不投会错过亚马逊、Google,而且过程中获得的行业认知很重要,很难只吃第五个包子。
— 戴雨森AI 应用有用更慢,扩散更快
季逸超用移动互联网类比:iPhone 时刻之后还有 App Store 时刻和 iPhone 4 时刻,现在 GPT 有 GPT store 但完全不能跟 App Store 类比,可能处在 0708 年的时间点。戴雨森认为在现有范式下,AI 应用出现有用的时间点会比移动互联网慢,因为需要模型到达一定能力程度才能从没用涌现成有用;但一旦变得有用,扩散速度可能远快于移动互联网,因为互联网和移动互联网是软件和硬件都要扩散的过程,而 AI 只要设备没变化,跑在手机上,有用就可能一两年席卷几亿人。
— 戴雨森原话 · 已逐字校验
Sora现在也是一个涌现出来了某些能力的一个模型 但是它要变成一个产品 其实这个过程中还有很远的过程
Sora 现在也是一个涌现出某些能力的模型,但它要变成一个产品,其实这个过程中还有很远的过程。
季逸超4:07
因为我觉得能做和真能做出来 其实中间隔很多know how
因为我觉得能做和真能做出来,其实中间隔很多 know how。
戴雨森29:16
泡沫不可怕 我们泡沫会带来重要的基建 基建会为未来的应用打下基础 就泡沫中死掉的99%会死掉 但是1%留下来的可能就是伟大公司
泡沫不可怕,泡沫会带来重要的基建,基建会为未来的应用打下基础,泡沫中死掉的 99% 会死掉,但 1% 留下来的可能就是伟大公司。
戴雨森56:19
我们要避免一个陷阱 就是在技术还不够好的时候 过分雕花
我们要避免一个陷阱,就是在技术还不够好的时候,过分雕花。
戴雨森1:09:39
在现有的范式下 AI应用 它可能应用出现 有用的时间点 会比移动互联网要慢 因为它需要模型 到达一定的能力程度 它才能从没用 涌现成有用 但是当它一旦变得有用之后 它的扩散速度 可能会远快于 移动互联网的应用
在现有的范式下,AI 应用出现有用的时间点会比移动互联网慢,因为它需要模型到达一定的能力程度,才能从没用涌现成有用;但当它一旦变得有用之后,它的扩散速度可能会远快于移动互联网的应用。
戴雨森1:14:27
如果你把你现在 年富力强的时候的思路 交给未来的一个AI的话 其实你一定程度上 能获得一个数字的一个永生
如果你把你现在年富力强的时候的思路交给未来的一个 AI 的话,其实你一定程度上能获得一个数字的永生。
季逸超1:30:45
数字与实体
| Sora 训练算力推测 | 一两千张 H100 | 28:54 |
| Sora 训练成本推测 | 几千万美金量级 | 28:54 |
| OpenAI 已部署卡数量估计 | 二十几万张 | 23:45 |
| Sora 生成一分钟视频推理时间 | 现实中约 20 分钟 | 33:18 |
| Sora 生成视频时长 | 60 秒 | 27:16 |
| 国内大模型融资规模 | 百亿美金级 | 52:32 |
| 全球大模型融资规模 | 几百亿美金 | 52:32 |
| ChatGPT 用户数 | 一亿多人用过 | 1:32:45 |
术语
- DiTDiffusion Transformer
- 用 Transformer 架构做扩散生成的模型结构,Sora 的骨干。
- recaptioning重写描述
- 用 GPT-4 给训练素材写更详细的文字描述,增强生成真实度。
- native resolution原生分辨率
- 模型训练和推理支持各种分辨率,直接输出适合设备的分辨率。
- cherry picking挑选展示
- 从多次生成结果里挑最好的展示,外界看不到失败案例。
- alignment对齐
- 让模型行为符合人类意图和价值观,涉及与谁对齐的问题。
收听指南
关注大模型战局的投资人、做视频生成或多模态的工程师、想判断 Sora 追赶时间表的创业者。
1:31:43 起聊即刻和估值方法偏闲聊,可跳过。