杨植麟:模型公司是炼油厂,值钱的是化工厂和汽车公司
商业史上第一波跑出来的公司几乎从不是下个阶段的赢家。模型公司是提炼基础油的炼油厂,真正值钱的是化工厂和汽车公司——所以月之暗面只做 to C,且只做 to C。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
AI Lab 能出 Transformer,出不了 GPT
杨植麟把「突破发生在产业界」拆成两层:一是领域发展的必然规律,探索性研究逐渐转移到工业化过程;二是组织形态的局限。Google Brain 本质是把一个研究型组织安插在大公司里,这种组织方式能探索出新想法,但很难产生伟大的系统——「它可能能产生 Transformer,但可能产生不了 GPT」。他判断科研系统、教育系统后面会转变职能,更多以培养人才为主。这也是他解释为什么 AGI 需要新组织:技术决定生产方式,组织必须适配技术,不匹配就没法有效产出。
— 杨植麟从无限的雕花中把自己释放出来
这是他在 Google 学到的最重要一课。他给的画面是:眼前有十条路,一般人考虑的是走这条路时前面有个行人要怎么刹车,但十条路里到底选哪一条才是最重要的。当时这个领域的问题就是关注点不对——在一两百万个 token 的数据集上把 loss 降得更低、发明各种诡异的 architecture 和正则化方式,都是雕花技巧,数据集上变好了但没看到问题本质。本质是找第一性原理:一个结构只要足够通用(所有问题都能放进来建模)且可规模化(投入足够算力就能变好),就不该在上层做过度雕花。他引用的那句话是:如果你能用 scale 解决的问题,你就不要用新的算法去解决它。
— 杨植麟第一轮融资的窗口只有一个月
杨植麟把 timing 讲得非常具体:2 月份开始集中做第一轮融资,这个窗口很短——delay 到 4 月份基本没机会,但 12 月或 1 月去做也没机会,因为当时还有 covid,大家还没反应过来。国内是 2 月份爆的,前年 11 月份还没什么反应,所以真正的窗口就是一个月。他在美国每个晚上做了一笔精确计算:算对应多少 flops、多少 training cost、多少 inference、多少用户量,算完的结论是至少要在几个月内拿到 1 亿美元。当时很多人觉得不一定能融到这么多,后来证明可以,甚至更多。融资窗口之后紧接着是 3、4 月份的招人窗口。
— 杨植麟招人先找 genius,再补下限
杨植麟说招人是核心的核心,人不对的话用最高超的管理技巧也没用。世界上真正有 AGI 经验的人非常有限,所以他们早期画像很专注:直接找对口的 genius——有对模型动手术的能力、有训练超大规模的直接经验,就能很快做出来。团队很长一段时间是三四十人,现在八十人,刻意追求人才密度,不希望有太多人。他给的参照是 Google 现在好几千人在干这个事,如果砍成一百人五十人可能很快就成功了。后期才开始补产品、运营、leader 型人才和能把事情做到极致的 animal,补的是下限。
— 杨植麟长文本是新计算机的内存
为什么第一件事做长文本?杨植麟的类比是:它是新计算机的内存,老计算机的内存过去几十年涨了好几个数量级,同样的事会发生在新计算机上。它解决两个本质问题——通用性和个性化。通用性上,当你有足够无损压缩的 long context,多模态架构里甚至不再需要 tokenizer,可以把原始信号直接放进去;个性化上,AI 最核心的价值落脚点是个性化互动,而个性化不是通过微调实现的,是靠很长的 context 定义的一种无法被复刻的过程。他强调这个技术已经做了半年多,不是看到风口再召集两个团队快速开发,两者有很大区别。
— 杨植麟接下来两个 milestone:统一世界模型与无人类数据进化
杨植麟给出两个最重大的技术 milestone:第一是一个真正的统一的世界模型,能统一各种不同的模态,是一个真正 scalable 和 general 的 architecture;第二是能在没有人类数据输入的情况下让 AI 持续进化。他的判断是,今天谈的很多 reasoning、agent 问题,都是这两个问题解决之后的产物,可能还要再做一些雕花,但不会有 fundamental blocker。他也用这个标准衡量产品价值:如果产品最核心的价值只有百分之十或二十来自 AI,那这个事就不成立,智能永远是最核心的增量价值。
— 杨植麟开源追不上闭源,因为开源本身还是中心化
杨植麟给的理由不是资源多少,而是开发方式变了:以前是所有人都可以 contribute 到开源里,现在开源本质还是一个中心化,需要资源、人才和资本的聚集,所以闭源更好,会是一个 consolidation 的过程。他补了一个角度:如果今天有一个很领先的模型还开源出来,大概率是不合理的。这条直接支撑了他对「用开源模型做超级应用」的否定——没有技术能力去找超级应用是不可能的。
— 杨植麟着急找 PMF 会被降维打击
针对「10 个人找不到 PMF,100 个人也找不到,关键是找不找得到 PMF」这类只投应用的观点,杨植麟的回应是 AGI 的上限远高于现在看到的一切,得用 10 到 20 年的思维。他举的历史案例是以前做对话系统、客服系统、slot filling 的公司,有些规模还不错,但全被降维打击了,因为不会有人再用那种技术。而且今天还在变化过程中——context 越来越长、instruction following 越来越强,定制一个客服系统的难度会越来越低、准确率越来越高,所以这是 100% 的降维打击。他承认只关注应用存在商业上成立的机会,但最大的机会不在这。
— 杨植麟原话 · 已逐字校验
它可能能产生Transformer 但可能产生不了GPT
它可能能产生 Transformer,但可能产生不了 GPT。
杨植麟6:05
如果你能用scale解决的问题 你就不要用新的算法去解决它
如果你能用 scale 解决的问题,你就不要用新的算法去解决它。
杨植麟14:13
你就是一个颠覆性的东西 它才配得上AGI这三个字 否则我们今天所有说的这些事情都没有什么意义
只有一个颠覆性的东西,才配得上 AGI 这三个字,否则我们今天所有说的这些事情都没有什么意义。
杨植麟43:36
如果是着急的去找一个PMF 你很有可能最后发现 又被降维打击了
如果是着急地去找一个 PMF,你很有可能最后发现,又被降维打击了。
杨植麟48:36
数字与实体
| 月之暗面团队规模 | 早期三四十人,访谈时约 80 人 | 28:26 |
| 月之暗面两轮融资总额 | 接近 20 亿人民币 | 26:25 |
| 杨植麟在美国算出的融资目标 | 至少几个月内拿到 1 亿美元 | 22:17 |
| 第一轮融资窗口 | 约一个月(2 月份) | 22:17 |
| 单台机器价格波动 | 一天 260,次日 340,过两天又跌回来 | 30:27 |
| 杨植麟论文引用次数 | 超过 22000 次 | 1:02 |
术语
- scaling law规模定律
- 只要往模型里投入足够多算力,效果就会变好。
- long context长上下文
- 模型一次能处理的文本长度,杨植麟称其为新计算机的内存。
- PMF产品市场契合
- 产品找到真正被市场需要的场景。
- DiT扩散 Transformer
- Sora 使用的架构,杨植麟认为它还不是通用架构。
- next token prediction下一词预测
- 语言模型唯一被验证有效的基本原理。
收听指南
适合正在判断大模型创业窗口、组织形态和 to C 路线的创始人与投资人,尤其是纠结要不要追 PMF 的人。
1:15 之后的中美生态与 2024 预测较泛,可只听 Sora 技术判断部分。