復刻 GPT-4 的只有三家,2024 年窗口就關了
全球只有 OpenAI、Anthropic、Google 做出了 GPT-4 水平的模型,而 2024 年跑完基本決定長期格局——未來 12 個月追不上去,後面再翻轉很難。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
核心 secret 只有一個:數據和 tokenizer
被問到 OpenAI、Anthropic、Google 三家最核心的 secret 是什麼,回答是短期看數據——預訓練數據的配比、tokenizer 怎麼做;如果只留一個能力,就是 reasoning 推理能力。這個判斷把「模型競賽」從算力敘事拉回到數據工程:全球真正知道 GPT-4 數據 secret 的只有兩三百人,幾乎都在前幾家模型公司,其他公司想搞清楚至少要做幾百次、幾千次充足實驗,小几萬張卡是必要條件。
— 李廣密復刻 GPT-4 的決賽圈只有三家
把復刻 GPT-4 當作進入決賽圈的門檻,全球範圍只有 OpenAI、Anthropic、Google 三家做出了 GPT-4 水平的模型。時間線上:OpenAI 是一年前做出 GPT-4,Anthropic 是半年前,Google 是下個月才能 deliver,全球其他團隊可能還需要 6 到 12 個月。Google 舉全公司之力搞了一年也才勉強接近。高潛黑馬點了三家:馬斯克的 XAI、Transformer 核心貢獻者 Norm 做的 Character、以及 Bidance。
— 李廣密能做大模型的天才只有兩三百人
大模型的人才壁壘極高,全球範圍真能對大模型有實際大貢獻的天才 researcher 可能就兩三百人,其中一百多人在 OpenAI,二三十人在 Google,Meta、AWS、NVIDIA 可能沒有。而且聚集效應很強——這種人和這種文化非常重要,所以沒那麼看好其他巨頭自身能做好大模型。判斷標準不是 CEO,而是這家模型公司至少有一個天才科學家:OpenAI 有 Ilya,Anthropic 有 Dario,Runway、Ideogram、Pika Labs 的 CTO 也都是各自方向上的關鍵人物。
— 李廣密下一代訓練成本會從兩三億跳到十億
如果 Claude 3 和 GPT-4.5 的訓練成本是 2 到 3 億美元,那再往後 2025、2026 年下一代的模型訓練成本至少可能是 10 億美元,甚至 30 到 50 億美元。訓練成本分兩塊:四分之三花在實驗(小尺寸模型反覆試錯),四分之一花在最終那次大訓練——像一次火箭發射。GPT-4 當年公開的 rumor 是 2.2 萬張 A100 訓練 100 天,純大訓練成本差不多 8000 萬美金,但最大的成本是前期實驗。700 億參數是個分界點,以下能容忍很多錯誤,以上每往上擴,訓練難度指數級提升。
— 李廣密2024 年跑完,格局就定了
2024 年跑完基本決定大概的格局,窗口可能就是未來 12 個月,如果未來 12 個月追不上去,後面再翻轉很難。最理想化的格局是很可能只剩一家——最領先的模型又最便宜,沒有理由用第二家;但因為陣營抗衡,實際可能兩到三家。陣營劃分:微軟和 OpenAI 一派,亞馬遜和 Google 一起支持 Anthropic 一派,Google 自成一派,Apple 和 Tesla 代表終端一派。Meta 不一定是大模型公司,它是一個用 AI 做好自身業務的公司。
— 李廣密成本是被忽視的隱形競爭力
大模型往後走有兩條主線:明線是智能 capability 提升,每提升一部分就解鎖一些新應用;隱線是成本下降,模型訓練成本過去 18 個月降了 4 到 5 倍,推理成本過去 18 個月降了得有 10 倍,再優化兩三輪問題不大。這兩條主線決定 AI native 應用大爆發的幅度。成本降低的核心是工程問題——GPU 利用率、架構優化、精度調節。如果能把成本做得極低、模型還不輸,這就是極強的核心競爭力,非常像芯片,頭部公司身上已經看到了一定的規模效應。
— 李廣密模型公司八成以上會被收購
硅谷的模型公司今天更像一個 research lab,除了 ChatGPT 意外的爆紅以外,商業模式還是不清楚的。即便硅谷的大模型公司獨立 IPO 可能也很難,80% 到 90% 大概率還是被收購,所以大模型公司還是要抱大腿。硅谷 VC 幾乎都錯過了大模型投資,就像他們也錯過了 Tesla 和 SpaceX——這是兩個產品不 match 的問題:大模型這種高風險、高投入、看不清商業模式的公司,不符合 VC 這個金融產品的典型投資。
— 李廣密ChatGPT 看不到網絡效應和數據飛輪
互聯網講究網絡效應、數據飛輪、規模效應,但大模型和 AI 今天好像還看不到這些。ChatGPT 可能更像一個消費品,它只知道一些用戶 query 的分布,能更好地指導訓練、哪些數據重要哪些不重要,也可以 distill 去做一些小模型滿足頭部 query,但還不像數據飛輪、網絡效應很強的產品。移動互聯網時代最核心的是全球多出了四五十億用戶、手機上能採集更多數據做機器學習和推薦;這一波最隱形的一個核心競爭力可能是成本。
— 李廣密年初低估了 GPT-4 難度,高估了應用速度
復盤這一年,年初低估了做到 GPT-4 的難度,高估了應用大爆發的速度。今天真正 AI native 的產品還是太少,就頭部那幾家——ChatGPT、Character、Perplexity,還得再等個一兩代的模型,會有更多 native 的產品出來。企業級探索大模型的 use case 現在成功的還不多,只有微軟和 Adobe 比較激進。大模型今天還在早期,很像芯片:要等芯片的能力和成本再迭代個兩三代,上面的消費電子才會慢慢爆發。
— 李廣密AI 創造的增量 GDP 是互聯網的 5 到 10 倍
對未來 20 年的推演:AI 創造的直接增量 GDP 可能是比互聯網過去 20 年創造的增量 GDP 要大個 5 到 10 倍。算賬方式是——如果這一波 AI 替代 10 億白領,每個白領年薪 3 到 5 萬美元,這就是 30 到 50 萬億美元的 market size;如果全球 GDP 翻倍,從今天的 96 萬億美元變成 200 萬億美元,增加 100 萬億,AI 切 10% 到 20% 就是 10 到 20 萬億美元的 revenue,再乘以 10 的 multiple,會誕生很多大公司。另外數據中心用電量今天占人類總能源的 2% 到 3%,未來漲到 10% 到 20% 可預見性也蠻高。
— 李廣密原話 · 已逐字校驗
所以我覺得大模型今天是人類 一個千億美金的BET
所以我覺得大模型今天是人類一個千億美金的 BET。
李廣密45:35
大家都把chatGPT和character當應用 我覺得這就是噪音 其實它兩個是模型公司
大家都把 ChatGPT 和 Character 當應用,我覺得這就是噪音,其實它兩個是模型公司。
李廣密1:26:05
喬布斯和馬斯克 好像在硅谷沒有朋友 但Sam在硅谷所有人都是朋友
喬布斯和馬斯克好像在硅谷沒有朋友,但 Sam 在硅谷所有人都是朋友。
李廣密1:28:07
當你看到硅谷那麼牛逼的公司 那麼天才的科學家都一往無前很相信 我覺得從他們的眼睛裡是看到了光和希望吧
當你看到硅谷那麼牛逼的公司、那麼天才的科學家都一往無前很相信,我覺得從他們的眼睛裡是看到了光和希望吧。
李廣密1:30:07
數字與實體
| OpenAI 年化收入 | 十多億美元,明年可能五六十億美元 | 12:09 |
| ChatGPT 穩定 MAU | 兩個多億 | 4:04 |
| ChatGPT 佔 Chat 流量 | 百分之七八十 | 12:09 |
| GPT-4 訓練規模 | 2.2 萬張 A100 訓練 100 天 | 40:33 |
| 模型訓練成本降幅 | 過去 18 個月降了 4 到 5 倍 | 38:31 |
| 模型推理成本降幅 | 過去 18 個月降了得有 10 倍 | 38:31 |
| 全球大模型投入 | 未來幾年三到五年至少要花一千億美金 | 44:35 |
術語
- Scaling Law規模定律
- 模型能力隨參數量、數據、算力擴大而提升的經驗規律,目前還沒有理論支撐。
- Tokenizer分詞器
- 把文本切成模型可處理單元的方法,直接影響訓練效果。
- MoE混合專家
- 一種模型架構,由 Norm 提出,讓不同專家網絡處理不同輸入。
- Diffusion Model擴散模型
- 圖像生成主流方案,加時間維度後可做視頻生成。
- AI nativeAI 原生
- 從模型能力出發設計的產品,而非在舊產品上疊加 AI 功能。
收聽指南
關注大模型賽道判斷的創業者、投資人和工程師,尤其是想搞清楚 2024 年格局窗口、模型公司終局和成本曲線的人。
1:15:00 到 1:17:00 聊車企和自動駕駛,與主線關係較弱。