前沿科技創業的痛:上市那天,我覺得對不起這12年
出門問問創始人李志飛說,敲鐘那一刻他想的不是榮耀,而是「今天這個結果對得起我12年受的磨難嗎——對不起」。他把前沿科技創業的宿命總結成一塊隨時會化的浮冰。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
大部分前沿科技最後都會消失
李志飛提出一個「漏斗模型」:100個前沿科技,能從一個技術包裝成產品、形成商業模式、並且技術投入和商業價值匹配到可持續的,是極少數。大部分技術在當時那個時間點過不了漏斗的檢驗。但這不代表技術沒用——可能10年以後又回來了,因為環境變了、技術成熟了、需求成熟了,或者出現了新需求,這個技術又被重新拿出來過一遍漏斗。他用2013年的Google眼鏡舉例:當時大家literally看到了未來,但產品很快消失,AR、VR整個行業這麼多年都沒發展起來;而現在GPT-4o和Google又衍生出眼鏡,你又看到了未來,它回來了。
— 李志飛沒有路徑和節奏規劃的vision是耍流氓
李志飛說,講一個寬泛的未來很簡單——他2014年就說每個公司都會有人工智能部門,這種判斷正常人都不會差得太離譜。真正重要的是路徑和節奏的判斷:第一步幹什麼、第二步幹什麼。他給出兩種競爭情形:如果巨頭和創業公司同時達成一個共識、而這個共識是錯的,死的一定是創業公司,因為它熬不下去;如果創業公司先於巨頭半年到一年形成對未來的認知、並且有比較精確的規劃,那才有一定概率成功——前提是你能利用這一年的時間差建立某種壁壘,否則創業公司也會死。他還補了一句:就算這事一看沒希望,只要有投資者願意給你十億美金,也能給你續一條命。
— 李志飛GPT-4o 的關鍵是大一統加端到端
李志飛先聲明「我們也不知道,因為他沒有寫論文,我們都是猜測」。他判斷兩個核心點:第一,它是大一統的單一模型,各個模態在同一個模型裡;第二,大概率基於GPT架構,以語言模型作為認知的基礎,再加入別的感知模態。他用教猴子炒菜和教六歲小朋友炒菜作比——小朋友建立了對世界的認知模型,你用語言描述怎麼炒就行,猴子沒有認知基礎。為什麼難?要把所有模態都變成token,像文本一樣。他提到自己的模型工坊配音模型就是去年四月在語言模型基礎上加聲音訓練,但語言模型太小,只能做配音,做不了問答。而GPT-4o一方面能做語音生成和理解,另一方面文本認知能力沒下降,在MMLU上還強於GPT-4。
— 李志飛有聲音生成,卻沒有視頻生成
李志飛注意到一個細節:GPT-4o的助手模型裡沒有視頻生成,無論Google還是OpenAI,視頻生成都是另外單獨的一個模型。他解釋原因是Sora不是自迴歸架構,大概是用DiT、Diffusion的架構。他反覆強調自己的信仰:大一統模型應該基於自迴歸,把理解和生成放在一起。他猜測OpenAI內部一定有人在做這件事,但不確定是不是被當作all-in的方向——「工程師他也有自己的信仰嘛,他覺得自迴歸不幸福,他覺得Diffusion更幸福」。他還給出token長度的量級差異:文字一秒鐘幾個字,聲音一秒鐘幾十個token,視頻一秒鐘可能要幾百個token,每個都是至少一個數量級的提升,而token長度直接決定inference的成本和速度。
— 李志飛字節大降價是必然,API 商業模式不可持續
李志飛說字節大降價「必然就這樣子,而且會趨近於零,無限接近於零」。他講了一段往事:去年九、十月份他跟一個大模型創業者聊天,對方說除了APP收入還有API調用收入,一年能收不少錢。他當場建議對方直接把這個關掉,因為「沒有道理說你能夠到明年還能收到這個錢」。他說這種形式在AI 1.0時代就出現過——語音識別、TTS的調用,巨頭一進來就免費,一元中標都有過,只不過過去幾年經濟不好消停了。他的判斷是:對整個生態、對用戶都是好事,巨頭免費請大家用大模型挺好的;但對以API為商業模式的公司不是好事,你得重新想想你的商業模式是啥。
— 李志飛做智能手錶時沒想過生態位
李志飛用智能手錶復盤自己的戰略失誤:2015年做智能手錶,從戰略角度來說也許就是不對的。為什麼?五年以後在充分競爭的情況下沒有所謂的生態位——手機廠商都會做,而且是順帶做就能做得很好,因為能力和它的手機完全通用、重合。他說如果當時有戰略六要素這個方法,可能會更努力去思考:選擇做智能手錶,五年以後當巨頭都充分投入的時候,我怎麼站住一個位置?那可能會想更多差異化,執行路徑也會不一樣。他假設當年第一天就all in做海外、不做國內、不做那麼多智能硬件,利用有限的時間差建立壁壘,狀態可能會更成功。核心是「它逼得你思考」。
— 李志飛曾鳴說我們在一塊浮冰上
李志飛在湖畔大學把「AIGC時代三五年後我們這些AI工具還有沒有生態位」當作案例提出來,曾鳴的回答是「一定沒有」,但「我覺得你已經做到最好了」。曾鳴的比喻是:你今天在一個局勢特別不明朗的大海中,你是在一塊浮冰上,至少你不在水下,你在冰上;但這個冰隨時可能化掉或者翻。所以你要有的姿態是低功耗運轉,同時非常敏銳地觀察周邊有沒有堅冰,一旦有堅冰,你要準備好、你還有能力跳上去。李志飛說今天所有的大模型公司可能都得用這種姿態——就算找到了商業模式、有了用戶量,你也是在一塊浮冰上。
— 李志飛看見創業死亡的那一刻,我抑鬱了
李志飛說2019年是真真切切感受到公司會死掉:賬上只剩三四個億人民幣,但工資一年就花三個多億,還有4億的庫存,一千多個人,還有20個線下門店。他回憶Google沒給錢也會死,可能賬上只剩三四個月的錢,只是他沒去看而已;2014年4月大眾給1.8億美金,如果晚給四個月可能也掛了。2020年疫情來了,不但沒觸底反彈,底還有那麼深,他說「我覺得我都抑鬱了」,不想跟任何人說話,表現出來就是CEO已經不想幹活了。他的應對是繼續裁員、戰略性躺平、算P&L——把每個產品線、每個小業務的成本分攤算清楚,算下來虧錢的,從此沒有人找他要人。他還舉了個例子:當時公司有四個IT,搬個家還得請外包,現在一個IT搬家也不請外面公司。
— 李志飛原話 · 已逐字校驗
有一句話 沒有路徑和節奏規劃的Vision 都是耍流氓
有一句話:沒有路徑和節奏規劃的Vision,都是耍流氓。
李志飛12:38
必然就這樣子嘛 這有什麼 自己的大降價 必然這樣子 而且會趨勸於零 無限接近於零
必然就這樣子嘛,這有什麼。字節大降價,必然這樣子,而且會趨近於零,無限接近於零。
李志飛46:46
你今天就是在一個局勢特別不明朗的大海中 你呢 是在一塊浮冰上 就你現在做的事情在一塊浮冰上 但至少你不在水下 你在冰上 但是呢 你這個東西隨時可能 這個冰就會化掉 或者會翻
你今天就是在一個局勢特別不明朗的大海中,你是在一塊浮冰上,就你現在做的事情在一塊浮冰上,但至少你不在水下,你在冰上。但是你這個東西隨時可能化掉,或者會翻。
李志飛1:00:51
這可能是我最近兩個月以來 第一次看到太陽降落的狀態
這可能是我最近兩個月以來,第一次看到太陽降落的狀態。
李志飛1:09:32
你發現 創業者真的是有的時候 最近這一個月 收了一千萬 就開始想 哦 那我平均一個月 估計接下來做兩千萬 一年 有十二個月 那我就 接下來一年的收入 有兩點四個億
你發現創業者真的是有的時候,最近這一個月收了一千萬,就開始想:那我平均一個月估計接下來做兩千萬,一年有十二個月,那我接下來一年的收入有兩點四個億。
李志飛1:13:32
很多公司 就是科技公司 它從第一天就進入了負循環
很多公司,就是科技公司,它從第一天就進入了負循環。
李志飛1:25:16
今天這個結果 對得起我過去的努力嗎 對得我過去受的 這個12年受的磨難嗎 我覺得是對不起的
今天這個結果,對得起我過去的努力嗎?對得起我過去這12年受的磨難嗎?我覺得是對不起的。
李志飛1:27:06
數字與實體
| 出門問問上市啟動到交表 | 去年三月份啟動,六月份交表,接近一年 | 2:02 |
| IPO 中介數量 | 四五十個中介(私募融資通常三四個) | 3:02 |
| 大眾投資出門問問 | 1.8億美金(2014年4月) | 1:11:32 |
| 2019 年出門問問庫存 | 4億 | 1:11:32 |
| 2019 年出門問問員工數 | 1000多人 | 1:11:32 |
| 2020 年裁員後員工數 | 不到300人 | 1:16:32 |
| Google 模型上下文長度 | 兩百萬 token | 26:13 |
術語
- VLA視覺-語言-動作模型
- 以語言模型為基礎,加入視覺和動作模態的模型架構。
- DiTDiffusion Transformer
- 基於 Diffusion 的架構,Sora 據稱採用,而非自迴歸。
- In Context Learning上下文學習
- 通過 prompt 或舉例,模型無需重訓即可學會新任務。
- codec編解碼器
- 把聲音等模態壓縮成 token 表示的技術。
- P&L損益表
- 按產品線核算成本與收入,判斷每條業務是否虧錢。
收聽指南
正在做大模型或AI應用、糾結要不要 all in 的創業者,以及想看AI公司真實財務與戰略困境的投資人。
開頭2:00-8:36上市流程細節可快進,信息密度低。