世界太吵,來原聲聽播客

張小珺·商業訪談錄

楊植麟:模型公司是煉油廠,值錢的是化工廠和汽車公司

商業史上第一波跑出來的公司幾乎從不是下個階段的贏家。模型公司是提煉基礎油的煉油廠,真正值錢的是化工廠和汽車公司——所以月之暗面只做 to C,且只做 to C。

大模型AGI創業融資長文本組織設計
楊植麟少見的把技術判斷、組織設計和融資時間窗講成一條線,後半段關於 Sora、世界模型和開源追不上閉源的推理密度最高。

核心論點 · 點時間戳可跳到原聲

6:05

AI Lab 能出 Transformer,出不了 GPT

楊植麟把「突破發生在產業界」拆成兩層:一是領域發展的必然規律,探索性研究逐漸轉移到工業化過程;二是組織形態的侷限。Google Brain 本質是把一個研究型組織安插在大公司裡,這種組織方式能探索出新想法,但很難產生偉大的系統——「它可能能產生 Transformer,但可能產生不了 GPT」。他判斷科研系統、教育系統後面會轉變職能,更多以培養人才為主。這也是他解釋為什麼 AGI 需要新組織:技術決定生產方式,組織必須適配技術,不匹配就沒法有效產出。

— 楊植麟
13:12

從無限的雕花中把自己釋放出來

這是他在 Google 學到的最重要一課。他給的畫面是:眼前有十條路,一般人考慮的是走這條路時前面有個行人要怎麼剎車,但十條路里到底選哪一條才是最重要的。當時這個領域的問題就是關注點不對——在一兩百萬個 token 的數據集上把 loss 降得更低、發明各種詭異的 architecture 和正則化方式,都是雕花技巧,數據集上變好了但沒看到問題本質。本質是找第一性原理:一個結構只要足夠通用(所有問題都能放進來建模)且可規模化(投入足夠算力就能變好),就不該在上層做過度雕花。他引用的那句話是:如果你能用 scale 解決的問題,你就不要用新的算法去解決它。

— 楊植麟
22:17

第一輪融資的窗口只有一個月

楊植麟把 timing 講得非常具體:2 月份開始集中做第一輪融資,這個窗口很短——delay 到 4 月份基本沒機會,但 12 月或 1 月去做也沒機會,因為當時還有 covid,大家還沒反應過來。國內是 2 月份爆的,前年 11 月份還沒什麼反應,所以真正的窗口就是一個月。他在美國每個晚上做了一筆精確計算:算對應多少 flops、多少 training cost、多少 inference、多少用戶量,算完的結論是至少要在幾個月內拿到 1 億美元。當時很多人覺得不一定能融到這麼多,後來證明可以,甚至更多。融資窗口之後緊接著是 3、4 月份的招人窗口。

— 楊植麟
27:25

招人先找 genius,再補下限

楊植麟說招人是核心的核心,人不對的話用最高超的管理技巧也沒用。世界上真正有 AGI 經驗的人非常有限,所以他們早期畫像很專注:直接找對口的 genius——有對模型動手術的能力、有訓練超大規模的直接經驗,就能很快做出來。團隊很長一段時間是三四十人,現在八十人,刻意追求人才密度,不希望有太多人。他給的參照是 Google 現在好幾千人在幹這個事,如果砍成一百人五十人可能很快就成功了。後期才開始補產品、運營、leader 型人才和能把事情做到極致的 animal,補的是下限。

— 楊植麟
32:27

長文本是新計算機的內存

為什麼第一件事做長文本?楊植麟的類比是:它是新計算機的內存,老計算機的內存過去幾十年漲了好幾個數量級,同樣的事會發生在新計算機上。它解決兩個本質問題——通用性和個性化。通用性上,當你有足夠無損壓縮的 long context,多模態架構裡甚至不再需要 tokenizer,可以把原始信號直接放進去;個性化上,AI 最核心的價值落腳點是個性化互動,而個性化不是通過微調實現的,是靠很長的 context 定義的一種無法被複刻的過程。他強調這個技術已經做了半年多,不是看到風口再召集兩個團隊快速開發,兩者有很大區別。

— 楊植麟
42:36

接下來兩個 milestone:統一世界模型與無人類數據進化

楊植麟給出兩個最重大的技術 milestone:第一是一個真正的統一的世界模型,能統一各種不同的模態,是一個真正 scalable 和 general 的 architecture;第二是能在沒有人類數據輸入的情況下讓 AI 持續進化。他的判斷是,今天談的很多 reasoning、agent 問題,都是這兩個問題解決之後的產物,可能還要再做一些雕花,但不會有 fundamental blocker。他也用這個標準衡量產品價值:如果產品最核心的價值只有百分之十或二十來自 AI,那這個事就不成立,智能永遠是最核心的增量價值。

— 楊植麟
47:36

開源追不上閉源,因為開源本身還是中心化

楊植麟給的理由不是資源多少,而是開發方式變了:以前是所有人都可以 contribute 到開源裡,現在開源本質還是一箇中心化,需要資源、人才和資本的聚集,所以閉源更好,會是一個 consolidation 的過程。他補了一個角度:如果今天有一個很領先的模型還開源出來,大概率是不合理的。這條直接支撐了他對「用開源模型做超級應用」的否定——沒有技術能力去找超級應用是不可能的。

— 楊植麟
48:36

著急找 PMF 會被降維打擊

針對「10 個人找不到 PMF,100 個人也找不到,關鍵是找不找得到 PMF」這類只投應用的觀點,楊植麟的回應是 AGI 的上限遠高於現在看到的一切,得用 10 到 20 年的思維。他舉的歷史案例是以前做對話系統、客服系統、slot filling 的公司,有些規模還不錯,但全被降維打擊了,因為不會有人再用那種技術。而且今天還在變化過程中——context 越來越長、instruction following 越來越強,定製一個客服系統的難度會越來越低、準確率越來越高,所以這是 100% 的降維打擊。他承認只關注應用存在商業上成立的機會,但最大的機會不在這。

— 楊植麟

原話 · 已逐字校驗

它可能能產生Transformer 但可能產生不了GPT

它可能能產生 Transformer,但可能產生不了 GPT。

楊植麟6:05

如果你能用scale解決的問題 你就不要用新的算法去解決它

如果你能用 scale 解決的問題,你就不要用新的算法去解決它。

楊植麟14:13

你就是一個顛覆性的東西 它才配得上AGI這三個字 否則我們今天所有說的這些事情都沒有什麼意義

只有一個顛覆性的東西,才配得上 AGI 這三個字,否則我們今天所有說的這些事情都沒有什麼意義。

楊植麟43:36

如果是著急的去找一個PMF 你很有可能最後發現 又被降維打擊了

如果是著急地去找一個 PMF,你很有可能最後發現,又被降維打擊了。

楊植麟48:36

數字與實體

月之暗面團隊規模早期三四十人,訪談時約 80 人28:26
月之暗面兩輪融資總額接近 20 億人民幣26:25
楊植麟在美國算出的融資目標至少幾個月內拿到 1 億美元22:17
第一輪融資窗口約一個月(2 月份)22:17
單臺機器價格波動一天 260,次日 340,過兩天又跌回來30:27
楊植麟論文引用次數超過 22000 次1:02

術語

scaling law規模定律
只要往模型裡投入足夠多算力,效果就會變好。
long context長上下文
模型一次能處理的文本長度,楊植麟稱其為新計算機的內存。
PMF產品市場契合
產品找到真正被市場需要的場景。
DiT擴散 Transformer
Sora 使用的架構,楊植麟認為它還不是通用架構。
next token prediction下一詞預測
語言模型唯一被驗證有效的基本原理。

收聽指南

誰該聽

適合正在判斷大模型創業窗口、組織形態和 to C 路線的創始人與投資人,尤其是糾結要不要追 PMF 的人。

可跳過

1:15 之後的中美生態與 2024 預測較泛,可只聽 Sora 技術判斷部分。