縮放定律最早在百度被發現,但做出GPT的卻是美國公司
MiniMax創始人嚴俊傑說,奠定大模型根基的縮放定律2014年就已經在百度被發現,但真正做出GPT的卻是沒有歷史包袱的美國創業公司。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
中國大模型燒錢是美國零頭,差距僅5%
嚴俊傑說,美國真正能做大模型的公司只有四家:谷歌、OpenAI、Anthropic、xAI。這幾家公司的估值是中國同類創業公司的100倍,收入也差不多是100倍,研發投入是50到100倍,但技術水平只領先5%,而且這個差距在過去一年還在不斷縮小。他把原因歸結為中國的人才密度,以及算力受限逼出來的工程創新——不是簡單照搬美國的方法,而是在每個模塊上都走出了不同的技術路線。
— 嚴俊傑Scaling拋棄了過去十年的學術積累
嚴俊傑說公司成立時打下的第一個認知,是做大模型不能迷信過去的經驗。此前的人工智能追求寫很多數學公式、理論漂亮;而這一代AI的核心是scaling——用最簡單的方法,讓效果隨數據和算力增長持續變好。他坦言自己此前十年的人工智能研究經歷「很多東西其實是沒用的」,真正重要的是找到一種能規模化組織團隊、技術路線和業務的全新認知體系。
— 嚴俊傑模型本身才是產品,傳統產品只是渠道
面對羅永浩「產品經理會不會被淘汰」的焦慮,嚴俊傑的判斷是:大模型時代真正的產品其實是模型本身,因為大模型提供的是智能,而這個智能是模型算出來的。傳統意義上理解的產品——App、界面——更像是一個渠道,公司自己做的產品只是自營的一家店,合作伙伴用模型做的產品則是另一個渠道。這個判斷決定了MiniMax始終把算法團隊放在最核心位置。
— 嚴俊傑大模型核心定律2014年就在百度出現過
嚴俊傑回憶,2014年他在百度實習時,公司有當時國內唯一的大規模GPU集群,他一個實習生就能用掉其中三分之一的卡做實驗。後來他才知道,Anthropic的CEO當時也在百度做語音,正是在那裡發現了縮放定律——大模型最核心的那條規律,比它真正引爆業界早了六年。但做出GPT-3.5的是美國公司而不是中國公司,他認為這裡面偶然性很大,也是中國這一波的遺憾。
— 嚴俊傑技術驅動與互聯網打法沒法共存
公司早期曾設想,既然要做2C、做國際化,那就照搬中國最成功的國際化2C路徑——移動互聯網打法,AI人才加互聯網人才拼在一起就能成。但實踐後發現根本不work:靠模型能力把產品做好,和靠複製移動互聯網的經典打法把產品做好,兩條路可能都對,但沒法共存,驅動力只能二選一。這個認知讓團隊糾結了大半年,最終選擇押注技術驅動,即便這條路代價和風險都更高。
— 嚴俊傑DeepSeek倒逼他們扔掉了OKR和KPI
DeepSeek春節爆火後,給MiniMax帶來的最大沖擊不是追趕壓力,而是組織方式的徹底重構:算法與基礎設施必須是一體的,所有人只能服務同一個優化目標,而不是每個人、每個團隊各自有自己的指標。嚴俊傑說他們試過用OKR管理,發現根本行不通,KPI更行不通,因為下一代模型能不能做出來本身是不確定的。結果是公司現在沒有管理工具可用,一些不認同這種打法的人也因此離開了。
— 嚴俊傑公司內部一度有一半人想放棄語言模型
MiniMax的語言模型有大約兩年時間對公司業務沒有起到任何商業作用,卻佔用了公司最多的算力和人才——這成了公司歷史上最痛苦的決策分歧之一,嚴俊傑說公司裡至少有一半人認為應該放棄語言模型這條線。類似的分歧還發生在要不要堅持做國內業務上:國內業務的ROI明顯低於海外,但嚴俊傑堅持認為中國終究是最大的單一市場,必須堅持到商業化模式跑通的那天。
— 嚴俊傑最好模型吃下最貴場景,收入差距放大100倍
嚴俊傑解釋中美大模型公司收入差距被進一步拉大的機制:中國模型能力只落後5%,但在最需要頂尖能力的高價值場景裡,客戶只會用最好的模型,這讓目標場景的規模被放大了10倍,價格又被放大10倍,一乘就是100倍的商業化差距。這也是他認為接下來一年中國公司最值得爭取的目標——在全球主流語言模型市場裡,佔到不止個位數的份額。
— 嚴俊傑原話 · 已逐字校驗
比如說美國最好的公司的估值 是中國 可能創業公司裡面 大概是估值是100倍 啊 然後收入呢 基本上也是100倍 但是技術呢 可能就領先5%
美國最好的公司,估值大概是中國創業公司的100倍,收入基本上也是100倍,但技術大概只領先5%。
嚴俊傑4:01
真正重要的東西 就是找到一種能夠 scaling規模化的方式 來組織我們的團隊
真正重要的東西,是找到一種能夠scaling規模化的方式來組織我們的團隊。
嚴俊傑11:05
對只要是一個東西能被量化 我們認為就是模型它 一定會強於人 或者一定是能到最好的人的那樣的水平
只要一件事能被量化,我們認為模型就一定會強於人,或者至少能達到最好的人的水平。
嚴俊傑30:14
比如說通過模型能力來 讓這個產品變好 或者業務變好 和是說 比如說通過把這種 移動互聯網的這些經典的東西 給複製過來 讓它變好 這兩個東西 有可能都是對的 但這兩個東西 其實是沒法共存的
靠模型能力把產品做好,和靠複製移動互聯網的經典打法把產品做好,這兩件事可能都對,但沒法共存。
嚴俊傑1:21:32
我們試圖用OKR 我發現根本行不通 那KPI更行不通 更行不通 所以我們就 需要全新工具 所以我們沒有工具
我們試過用OKR,發現根本行不通,KPI更行不通,所以我們需要全新的工具——可現在我們沒有工具。
嚴俊傑2:45:29
這是一個非常痛苦的一件事 可能會有 公司裡面至少有一半的人認為 我們應該不做語言模型
這是一件非常痛苦的事:公司裡至少有一半人認為,我們應該放棄語言模型。
嚴俊傑3:06:37
數字與實體
| 美國頭部大模型公司估值相對中國創業公司 | 約100倍 | 4:01 |
| 中美頂尖大模型技術差距 | 約5% | 4:01 |
| 中美大模型研發投入差距 | 約50-100倍 | 4:01 |
| 全球語言模型市場規模 | 約200億美元 | 12:06 |
| 全球圖片視頻模型市場規模 | 約二三十億美元 | 12:06 |
| 全球聲音模型市場規模 | 約3億美元 | 13:06 |
| 全球音樂模型市場規模 | 幾千萬美元 | 13:06 |
| GPT-3研發成本 | 約1億美元 | 1:00:24 |
| MiniMax團隊規模 | 400多人 | 1:44:48 |
術語
- Scaling Law縮放定律
- 模型能力隨數據和算力增長持續變好的規律,大模型技術路線的核心假設
- AGI通用人工智能
- 能像人一樣完成廣泛任務的智能系統
- Exploration/Exploitation探索與利用
- 強化學習術語:前者讓模型廣泛嘗試,後者用已有經驗優化特定目標
- MOE混合專家模型
- 把不同任務分配給不同專家子網絡處理的模型架構
- OpenRouterOpenRouter
- 一個統一調用多家公司大模型API的開發者平臺
收聽指南
想理解中國大模型公司真實成本結構、技術路線取捨和組織管理邏輯的創業者與投資人。
32:00-52:00童年求學經歷,個人色彩濃但商業技術信息密度較低。