世界太吵,来原声听播客

罗永浩的十字路口

缩放定律最早在百度被发现,但做出GPT的却是美国公司

MiniMax创始人严俊杰说,奠定大模型根基的缩放定律2014年就已经在百度被发现,但真正做出GPT的却是没有历史包袱的美国创业公司。

大模型成本结构组织管理开源策略产品逻辑

原视频在 YouTube 上放不出来,用音频听:

创始人拆解了中国大模型低成本追赶的具体机制,以及DeepSeek冲击下连OKR、KPI都被抛弃的组织重构细节。

核心论点 · 点时间戳可跳到原声

4:01

中国大模型烧钱是美国零头,差距仅5%

严俊杰说,美国真正能做大模型的公司只有四家:谷歌、OpenAI、Anthropic、xAI。这几家公司的估值是中国同类创业公司的100倍,收入也差不多是100倍,研发投入是50到100倍,但技术水平只领先5%,而且这个差距在过去一年还在不断缩小。他把原因归结为中国的人才密度,以及算力受限逼出来的工程创新——不是简单照搬美国的方法,而是在每个模块上都走出了不同的技术路线。

— 严俊杰
11:05

Scaling抛弃了过去十年的学术积累

严俊杰说公司成立时打下的第一个认知,是做大模型不能迷信过去的经验。此前的人工智能追求写很多数学公式、理论漂亮;而这一代AI的核心是scaling——用最简单的方法,让效果随数据和算力增长持续变好。他坦言自己此前十年的人工智能研究经历「很多东西其实是没用的」,真正重要的是找到一种能规模化组织团队、技术路线和业务的全新认知体系。

— 严俊杰
14:06

模型本身才是产品,传统产品只是渠道

面对罗永浩「产品经理会不会被淘汰」的焦虑,严俊杰的判断是:大模型时代真正的产品其实是模型本身,因为大模型提供的是智能,而这个智能是模型算出来的。传统意义上理解的产品——App、界面——更像是一个渠道,公司自己做的产品只是自营的一家店,合作伙伴用模型做的产品则是另一个渠道。这个判断决定了MiniMax始终把算法团队放在最核心位置。

— 严俊杰
58:24

大模型核心定律2014年就在百度出现过

严俊杰回忆,2014年他在百度实习时,公司有当时国内唯一的大规模GPU集群,他一个实习生就能用掉其中三分之一的卡做实验。后来他才知道,Anthropic的CEO当时也在百度做语音,正是在那里发现了缩放定律——大模型最核心的那条规律,比它真正引爆业界早了六年。但做出GPT-3.5的是美国公司而不是中国公司,他认为这里面偶然性很大,也是中国这一波的遗憾。

— 严俊杰
1:21:32

技术驱动与互联网打法没法共存

公司早期曾设想,既然要做2C、做国际化,那就照搬中国最成功的国际化2C路径——移动互联网打法,AI人才加互联网人才拼在一起就能成。但实践后发现根本不work:靠模型能力把产品做好,和靠复制移动互联网的经典打法把产品做好,两条路可能都对,但没法共存,驱动力只能二选一。这个认知让团队纠结了大半年,最终选择押注技术驱动,即便这条路代价和风险都更高。

— 严俊杰
2:45:29

DeepSeek倒逼他们扔掉了OKR和KPI

DeepSeek春节爆火后,给MiniMax带来的最大冲击不是追赶压力,而是组织方式的彻底重构:算法与基础设施必须是一体的,所有人只能服务同一个优化目标,而不是每个人、每个团队各自有自己的指标。严俊杰说他们试过用OKR管理,发现根本行不通,KPI更行不通,因为下一代模型能不能做出来本身是不确定的。结果是公司现在没有管理工具可用,一些不认同这种打法的人也因此离开了。

— 严俊杰
3:06:37

公司内部一度有一半人想放弃语言模型

MiniMax的语言模型有大约两年时间对公司业务没有起到任何商业作用,却占用了公司最多的算力和人才——这成了公司历史上最痛苦的决策分歧之一,严俊杰说公司里至少有一半人认为应该放弃语言模型这条线。类似的分歧还发生在要不要坚持做国内业务上:国内业务的ROI明显低于海外,但严俊杰坚持认为中国终究是最大的单一市场,必须坚持到商业化模式跑通的那天。

— 严俊杰
3:15:43

最好模型吃下最贵场景,收入差距放大100倍

严俊杰解释中美大模型公司收入差距被进一步拉大的机制:中国模型能力只落后5%,但在最需要顶尖能力的高价值场景里,客户只会用最好的模型,这让目标场景的规模被放大了10倍,价格又被放大10倍,一乘就是100倍的商业化差距。这也是他认为接下来一年中国公司最值得争取的目标——在全球主流语言模型市场里,占到不止个位数的份额。

— 严俊杰

原话 · 已逐字校验

比如说美国最好的公司的估值 是中国 可能创业公司里面 大概是估值是100倍 啊 然后收入呢 基本上也是100倍 但是技术呢 可能就领先5%

美国最好的公司,估值大概是中国创业公司的100倍,收入基本上也是100倍,但技术大概只领先5%。

严俊杰4:01

真正重要的东西 就是找到一种能够 scaling规模化的方式 来组织我们的团队

真正重要的东西,是找到一种能够scaling规模化的方式来组织我们的团队。

严俊杰11:05

对只要是一个东西能被量化 我们认为就是模型它 一定会强于人 或者一定是能到最好的人的那样的水平

只要一件事能被量化,我们认为模型就一定会强于人,或者至少能达到最好的人的水平。

严俊杰30:14

比如说通过模型能力来 让这个产品变好 或者业务变好 和是说 比如说通过把这种 移动互联网的这些经典的东西 给复制过来 让它变好 这两个东西 有可能都是对的 但这两个东西 其实是没法共存的

靠模型能力把产品做好,和靠复制移动互联网的经典打法把产品做好,这两件事可能都对,但没法共存。

严俊杰1:21:32

我们试图用OKR 我发现根本行不通 那KPI更行不通 更行不通 所以我们就 需要全新工具 所以我们没有工具

我们试过用OKR,发现根本行不通,KPI更行不通,所以我们需要全新的工具——可现在我们没有工具。

严俊杰2:45:29

这是一个非常痛苦的一件事 可能会有 公司里面至少有一半的人认为 我们应该不做语言模型

这是一件非常痛苦的事:公司里至少有一半人认为,我们应该放弃语言模型。

严俊杰3:06:37

数字与实体

美国头部大模型公司估值相对中国创业公司约100倍4:01
中美顶尖大模型技术差距约5%4:01
中美大模型研发投入差距约50-100倍4:01
全球语言模型市场规模约200亿美元12:06
全球图片视频模型市场规模约二三十亿美元12:06
全球声音模型市场规模约3亿美元13:06
全球音乐模型市场规模几千万美元13:06
GPT-3研发成本约1亿美元1:00:24
MiniMax团队规模400多人1:44:48

术语

Scaling Law缩放定律
模型能力随数据和算力增长持续变好的规律,大模型技术路线的核心假设
AGI通用人工智能
能像人一样完成广泛任务的智能系统
Exploration/Exploitation探索与利用
强化学习术语:前者让模型广泛尝试,后者用已有经验优化特定目标
MOE混合专家模型
把不同任务分配给不同专家子网络处理的模型架构
OpenRouterOpenRouter
一个统一调用多家公司大模型API的开发者平台

收听指南

谁该听

想理解中国大模型公司真实成本结构、技术路线取舍和组织管理逻辑的创业者与投资人。

可跳过

32:00-52:00童年求学经历,个人色彩浓但商业技术信息密度较低。