李志飛勸退通用大模型:中國不會有第二個 OpenAI
他一個月前說要當中國 OpenAI,現在說這個命題大概率不存在——因為共識達成太快、難度被開源和算力迅速拉低,而 OpenAI 自己能不能從商業上笑到最後都不好說。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
ChatGPT 的真正革新是「大一統」
李志飛把這一波和過去十年最大的區別歸為「通用」:以前語音識別一個團隊、機器翻譯一個團隊,在 Google 裡也是完全不同的團隊,各自有單獨的訓練數據、單獨的代碼系統;而大模型未來可能用一個大一統的系統同時做語音、圖像、翻譯、聊天、蛋白質結構預測。他同意微軟那篇說 GPT-4 是 AGI 火花的文章,理由是通用智能要的幾件事——通用、高度抽象而非記住表層、規劃能力、自由組合任務做新任務——GPT-4 都已經具備。
— 李志飛自監督就是互聯網每一步都在給反饋
他給了一個比「把孩子扔進海里學游泳」更準確的解釋:基於前面的詞預測下一個詞。我們正在聊天,說到「聊」後面跟「天」,互聯網上有海量這樣的文本,AI 預測對了就給獎勵、錯了就給懲罰。所謂自監督,是因為這些數據不是被標出來的——不像機器翻譯要提供一句中文標註一句英文、語音識別要提供音頻標註文字,而是從互聯網直接拿到序列文本,每預測下一個詞時數據本身就給了明顯反饋。
— 李志飛Google 的問題是組織形態,不是實力
他判斷 Google 在實力上可以碾壓 OpenAI:能做事的人的數量可能是 OpenAI 的十倍,算力、數據某種程度上都能碾壓。但組織形態不一定競爭得過——研究部門跟產品完全分開,要調動 YouTube、搜索、Cloud 的數據和資源,甚至把產品上線都是跨部門的難事;部門內部聰明人太多,每個人都有自己的方法論,有人要用 GPT、有人要用 BERT、有人要用 T5。而 OpenAI 有信念、又是產品驅動迭代,在方法論、信仰、執行上非常聚焦、思想統一。他的原話是:一個強十倍的對手,在這種非常不確定性的事情上不一定打得過你。
— 李志飛共識達成太快,把壁壘沖掉了
他一個月前的判斷是壁壘極高、早期投入極大、真正願意做的人沒幾個。過去一兩個月全變了:第一,做的人會很多,十幾家都不止,因為這件事被太快地達成共識——是未來十年二十年最重要的一件事;第二,難度取決於你怎麼做,如果像 OpenAI 或 Google 那樣不停刷能力天花板當然極難,但結合自己的應用場景做,難度大幅降低,因為開源模型、英偉達更強的計算平臺、無數人的解讀和論文都在把算力、算法、數據三個層面的門檻往下拉。所以他不再認為必須一開始單獨做一個公司、找最厲害的人、與世隔絕跌十二個月。
— 李志飛中國不存在一個 OpenAI 式的組織
他直接說「中國是不是一定存在一個跟美國 OpenAI 一樣的這種組織,我覺得大概率是不存在的」,並稱要做中國 OpenAI 是個偽命題。他認可中國需要很多大模型,但不確定有沒有能力做那種探索能力天花板的模型,強調做大模型不是只有一條路。對 Robin 說的「中國不需要第二個大模型」,他的回應是:中國肯定需要很多大模型,但能不能做出 OpenAI 那樣牛的、探索天花板的,他不確定。他還說哪怕在全世界,OpenAI 也不一定笑到最後。
— 李志飛這一代 AI 公司供給也是上一代的十倍
他把上一代 AI 公司的共同挑戰概括為商業模式不行:投入很高、產出很低,所有公司都處在商業化非常糟糕的狀況。這一代好的方面是應用場景肯定遠超上一代,需求可能是以前的十倍百倍;壞的方面是供給可能也是上一代的十倍,這會讓很多做 AI 的公司像上一代一樣痛苦。他 2012 年做 AI 時,中國做大公司語音識別、語音助手的鳳毛麟角,二線互聯網和傳統公司更不用說;今天大模型出來以後共識遠超當年,而共識太強、在太短時間內達成,對行業和社會是好事,對局內玩家則意味著投入和競爭會非常慘烈。
— 李志飛勸退:別高舉高打,先想清楚落地
他說希望勸一些人不要做通用大模型,並強調這跟個人競爭無關,因為他跟他們沒有任何衝突。理由有兩條:難度很大,以及商業上會競爭得非常激烈——如果你做的是非常通用的大模型,卻沒仔細想過最好落地在什麼場景、商業模式怎麼做,後面會非常痛苦。他給的建議是:第一不要高舉高打,在投入和招人上不計一切、不計成本;第二儘量多想想怎麼落地和商業模式。他還說 OpenAI 如果沒有微軟也很痛苦,甚至到今天他對 OpenAI 的商業模式仍然挺悲觀,相對它的投入,能不能從商業上笑到最後真不好說。
— 李志飛巨頭裡他押字節,因為張一鳴自己讀論文
被問巨頭格局時,他說字節可能是全村的希望,理由是「人家懂啊,自己讀論文啊,自己天天跟別人聊啊,找工程師」,並點名張一鳴執行力很強,是大力出奇跡的中國最厲害的選手。對阿里,他的判斷是必須弄,因為雲服務以後必須有這麼一個大模型去 empower 合作伙伴,否則很難說雲服務有競爭力。他進一步說,對巨頭來說大模型是標配,只是份額大小之分;而且比較確定的是,過一年或半年,如果你在大模型上沒有模型或沒有動作,資本市場就完全不看你了。
— 李志飛原話 · 已逐字校驗
中國是不是一定存在一個跟美國OpenAI一樣的這種組織,我覺得大概率是不存在的
中國是不是一定存在一個跟美國 OpenAI 一樣的組織,我覺得大概率是不存在的。
李志飛34:58
需求可能是以前的十倍百倍,這個肯定是好的,但是壞的地方呢,我覺得供給可能也是上一代的十倍
需求可能是以前的十倍百倍,這肯定是好的;但壞的地方是,我覺得供給可能也是上一代的十倍。
李志飛43:36
如果說你現在去做的,就是一個非常通用的大模型,但是你沒有仔細想過,我最好落地在什麼場景下,我的商業模式怎麼做的話,你後面會非常痛苦
如果你現在做的是一個非常通用的大模型,卻沒有仔細想過最好落地在什麼場景、商業模式怎麼做,後面會非常痛苦。
李志飛1:03:42
如果說,過一年,或者半年以後,你在大模型上,沒有模型,或者沒有動作,那資本市場就是,完全不看你了
如果過一年或半年以後,你在大模型上沒有模型、沒有動作,資本市場就完全不看你了。
李志飛1:06:23
數字與實體
| 他判斷大模型相對 Google 這類對手的 lead time | 至少六個月八個月以上 | 22:19 |
| 出門問問大模型參數規模 | 幾百億 | 1:05:40 |
| 他預計兩年後中國做大模型的公司數量 | 50 家以上 | 44:28 |
| 他給的中國競爭烈度結論 | 中國是美國的十倍競爭(創業供給約兩倍 × 客單價約五分之一) | 1:01:36 |
| 出門問問 2020 年做大模型的持續時間 | 約 8 個月後停掉 | 29:23 |
術語
- self-supervised自監督
- 不靠人工標註,用序列文本預測下一個詞,數據本身每一步都給反饋。
- in-context learning上下文學習
- 模型不改參數,僅憑提示裡的示例就能學會新任務的能力。
- AGI通用人工智能
- 一個系統能通用地完成多種任務,而非每個任務單獨訓練一個模型。
收聽指南
正在評估要不要做大模型的創業者、看 AI 賽道的投資人,以及想理解「共識過快如何摧毀壁壘」這一判斷的人。
1:47–9:06 的 NLP 求學與技術迭代史,屬於個人背景鋪墊。