李志飞劝退通用大模型:中国不会有第二个 OpenAI
他一个月前说要当中国 OpenAI,现在说这个命题大概率不存在——因为共识达成太快、难度被开源和算力迅速拉低,而 OpenAI 自己能不能从商业上笑到最后都不好说。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
ChatGPT 的真正革新是「大一统」
李志飞把这一波和过去十年最大的区别归为「通用」:以前语音识别一个团队、机器翻译一个团队,在 Google 里也是完全不同的团队,各自有单独的训练数据、单独的代码系统;而大模型未来可能用一个大一统的系统同时做语音、图像、翻译、聊天、蛋白质结构预测。他同意微软那篇说 GPT-4 是 AGI 火花的文章,理由是通用智能要的几件事——通用、高度抽象而非记住表层、规划能力、自由组合任务做新任务——GPT-4 都已经具备。
— 李志飞自监督就是互联网每一步都在给反馈
他给了一个比「把孩子扔进海里学游泳」更准确的解释:基于前面的词预测下一个词。我们正在聊天,说到「聊」后面跟「天」,互联网上有海量这样的文本,AI 预测对了就给奖励、错了就给惩罚。所谓自监督,是因为这些数据不是被标出来的——不像机器翻译要提供一句中文标注一句英文、语音识别要提供音频标注文字,而是从互联网直接拿到序列文本,每预测下一个词时数据本身就给了明显反馈。
— 李志飞Google 的问题是组织形态,不是实力
他判断 Google 在实力上可以碾压 OpenAI:能做事的人的数量可能是 OpenAI 的十倍,算力、数据某种程度上都能碾压。但组织形态不一定竞争得过——研究部门跟产品完全分开,要调动 YouTube、搜索、Cloud 的数据和资源,甚至把产品上线都是跨部门的难事;部门内部聪明人太多,每个人都有自己的方法论,有人要用 GPT、有人要用 BERT、有人要用 T5。而 OpenAI 有信念、又是产品驱动迭代,在方法论、信仰、执行上非常聚焦、思想统一。他的原话是:一个强十倍的对手,在这种非常不确定性的事情上不一定打得过你。
— 李志飞共识达成太快,把壁垒冲掉了
他一个月前的判断是壁垒极高、早期投入极大、真正愿意做的人没几个。过去一两个月全变了:第一,做的人会很多,十几家都不止,因为这件事被太快地达成共识——是未来十年二十年最重要的一件事;第二,难度取决于你怎么做,如果像 OpenAI 或 Google 那样不停刷能力天花板当然极难,但结合自己的应用场景做,难度大幅降低,因为开源模型、英伟达更强的计算平台、无数人的解读和论文都在把算力、算法、数据三个层面的门槛往下拉。所以他不再认为必须一开始单独做一个公司、找最厉害的人、与世隔绝跌十二个月。
— 李志飞中国不存在一个 OpenAI 式的组织
他直接说「中国是不是一定存在一个跟美国 OpenAI 一样的这种组织,我觉得大概率是不存在的」,并称要做中国 OpenAI 是个伪命题。他认可中国需要很多大模型,但不确定有没有能力做那种探索能力天花板的模型,强调做大模型不是只有一条路。对 Robin 说的「中国不需要第二个大模型」,他的回应是:中国肯定需要很多大模型,但能不能做出 OpenAI 那样牛的、探索天花板的,他不确定。他还说哪怕在全世界,OpenAI 也不一定笑到最后。
— 李志飞这一代 AI 公司供给也是上一代的十倍
他把上一代 AI 公司的共同挑战概括为商业模式不行:投入很高、产出很低,所有公司都处在商业化非常糟糕的状况。这一代好的方面是应用场景肯定远超上一代,需求可能是以前的十倍百倍;坏的方面是供给可能也是上一代的十倍,这会让很多做 AI 的公司像上一代一样痛苦。他 2012 年做 AI 时,中国做大公司语音识别、语音助手的凤毛麟角,二线互联网和传统公司更不用说;今天大模型出来以后共识远超当年,而共识太强、在太短时间内达成,对行业和社会是好事,对局内玩家则意味着投入和竞争会非常惨烈。
— 李志飞劝退:别高举高打,先想清楚落地
他说希望劝一些人不要做通用大模型,并强调这跟个人竞争无关,因为他跟他们没有任何冲突。理由有两条:难度很大,以及商业上会竞争得非常激烈——如果你做的是非常通用的大模型,却没仔细想过最好落地在什么场景、商业模式怎么做,后面会非常痛苦。他给的建议是:第一不要高举高打,在投入和招人上不计一切、不计成本;第二尽量多想想怎么落地和商业模式。他还说 OpenAI 如果没有微软也很痛苦,甚至到今天他对 OpenAI 的商业模式仍然挺悲观,相对它的投入,能不能从商业上笑到最后真不好说。
— 李志飞巨头里他押字节,因为张一鸣自己读论文
被问巨头格局时,他说字节可能是全村的希望,理由是「人家懂啊,自己读论文啊,自己天天跟别人聊啊,找工程师」,并点名张一鸣执行力很强,是大力出奇迹的中国最厉害的选手。对阿里,他的判断是必须弄,因为云服务以后必须有这么一个大模型去 empower 合作伙伴,否则很难说云服务有竞争力。他进一步说,对巨头来说大模型是标配,只是份额大小之分;而且比较确定的是,过一年或半年,如果你在大模型上没有模型或没有动作,资本市场就完全不看你了。
— 李志飞原话 · 已逐字校验
中国是不是一定存在一个跟美国OpenAI一样的这种组织,我觉得大概率是不存在的
中国是不是一定存在一个跟美国 OpenAI 一样的组织,我觉得大概率是不存在的。
李志飞34:58
需求可能是以前的十倍百倍,这个肯定是好的,但是坏的地方呢,我觉得供给可能也是上一代的十倍
需求可能是以前的十倍百倍,这肯定是好的;但坏的地方是,我觉得供给可能也是上一代的十倍。
李志飞43:36
如果说你现在去做的,就是一个非常通用的大模型,但是你没有仔细想过,我最好落地在什么场景下,我的商业模式怎么做的话,你后面会非常痛苦
如果你现在做的是一个非常通用的大模型,却没有仔细想过最好落地在什么场景、商业模式怎么做,后面会非常痛苦。
李志飞1:03:42
如果说,过一年,或者半年以后,你在大模型上,没有模型,或者没有动作,那资本市场就是,完全不看你了
如果过一年或半年以后,你在大模型上没有模型、没有动作,资本市场就完全不看你了。
李志飞1:06:23
数字与实体
| 他判断大模型相对 Google 这类对手的 lead time | 至少六个月八个月以上 | 22:19 |
| 出门问问大模型参数规模 | 几百亿 | 1:05:40 |
| 他预计两年后中国做大模型的公司数量 | 50 家以上 | 44:28 |
| 他给的中国竞争烈度结论 | 中国是美国的十倍竞争(创业供给约两倍 × 客单价约五分之一) | 1:01:36 |
| 出门问问 2020 年做大模型的持续时间 | 约 8 个月后停掉 | 29:23 |
术语
- self-supervised自监督
- 不靠人工标注,用序列文本预测下一个词,数据本身每一步都给反馈。
- in-context learning上下文学习
- 模型不改参数,仅凭提示里的示例就能学会新任务的能力。
- AGI通用人工智能
- 一个系统能通用地完成多种任务,而非每个任务单独训练一个模型。
收听指南
正在评估要不要做大模型的创业者、看 AI 赛道的投资人,以及想理解「共识过快如何摧毁壁垒」这一判断的人。
1:47–9:06 的 NLP 求学与技术迭代史,属于个人背景铺垫。