世界太吵,来原声听播客

张小珺·商业访谈录

前沿科技创业的痛:上市那天,我觉得对不起这12年

出门问问创始人李志飞说,敲钟那一刻他想的不是荣耀,而是「今天这个结果对得起我12年受的磨难吗——对不起」。他把前沿科技创业的宿命总结成一块随时会化的浮冰。

前沿科技创业大模型GPT-4o战略IPO

原视频在 YouTube 上放不出来,用音频听:

一个熬了12年、刚把公司送上市的AI创业者,罕见地讲了失败、抑郁和战略误判。信息密度高,后半段比前半段值钱。

核心论点 · 点时间戳可跳到原声

10:17

大部分前沿科技最后都会消失

李志飞提出一个「漏斗模型」:100个前沿科技,能从一个技术包装成产品、形成商业模式、并且技术投入和商业价值匹配到可持续的,是极少数。大部分技术在当时那个时间点过不了漏斗的检验。但这不代表技术没用——可能10年以后又回来了,因为环境变了、技术成熟了、需求成熟了,或者出现了新需求,这个技术又被重新拿出来过一遍漏斗。他用2013年的Google眼镜举例:当时大家literally看到了未来,但产品很快消失,AR、VR整个行业这么多年都没发展起来;而现在GPT-4o和Google又衍生出眼镜,你又看到了未来,它回来了。

— 李志飞
12:38

没有路径和节奏规划的vision是耍流氓

李志飞说,讲一个宽泛的未来很简单——他2014年就说每个公司都会有人工智能部门,这种判断正常人都不会差得太离谱。真正重要的是路径和节奏的判断:第一步干什么、第二步干什么。他给出两种竞争情形:如果巨头和创业公司同时达成一个共识、而这个共识是错的,死的一定是创业公司,因为它熬不下去;如果创业公司先于巨头半年到一年形成对未来的认知、并且有比较精确的规划,那才有一定概率成功——前提是你能利用这一年的时间差建立某种壁垒,否则创业公司也会死。他还补了一句:就算这事一看没希望,只要有投资者愿意给你十亿美金,也能给你续一条命。

— 李志飞
19:07

GPT-4o 的关键是大一统加端到端

李志飞先声明「我们也不知道,因为他没有写论文,我们都是猜测」。他判断两个核心点:第一,它是大一统的单一模型,各个模态在同一个模型里;第二,大概率基于GPT架构,以语言模型作为认知的基础,再加入别的感知模态。他用教猴子炒菜和教六岁小朋友炒菜作比——小朋友建立了对世界的认知模型,你用语言描述怎么炒就行,猴子没有认知基础。为什么难?要把所有模态都变成token,像文本一样。他提到自己的模型工坊配音模型就是去年四月在语言模型基础上加声音训练,但语言模型太小,只能做配音,做不了问答。而GPT-4o一方面能做语音生成和理解,另一方面文本认知能力没下降,在MMLU上还强于GPT-4。

— 李志飞
23:20

有声音生成,却没有视频生成

李志飞注意到一个细节:GPT-4o的助手模型里没有视频生成,无论Google还是OpenAI,视频生成都是另外单独的一个模型。他解释原因是Sora不是自回归架构,大概是用DiT、Diffusion的架构。他反复强调自己的信仰:大一统模型应该基于自回归,把理解和生成放在一起。他猜测OpenAI内部一定有人在做这件事,但不确定是不是被当作all-in的方向——「工程师他也有自己的信仰嘛,他觉得自回归不幸福,他觉得Diffusion更幸福」。他还给出token长度的量级差异:文字一秒钟几个字,声音一秒钟几十个token,视频一秒钟可能要几百个token,每个都是至少一个数量级的提升,而token长度直接决定inference的成本和速度。

— 李志飞
46:46

字节大降价是必然,API 商业模式不可持续

李志飞说字节大降价「必然就这样子,而且会趋近于零,无限接近于零」。他讲了一段往事:去年九、十月份他跟一个大模型创业者聊天,对方说除了APP收入还有API调用收入,一年能收不少钱。他当场建议对方直接把这个关掉,因为「没有道理说你能够到明年还能收到这个钱」。他说这种形式在AI 1.0时代就出现过——语音识别、TTS的调用,巨头一进来就免费,一元中标都有过,只不过过去几年经济不好消停了。他的判断是:对整个生态、对用户都是好事,巨头免费请大家用大模型挺好的;但对以API为商业模式的公司不是好事,你得重新想想你的商业模式是啥。

— 李志飞
55:35

做智能手表时没想过生态位

李志飞用智能手表复盘自己的战略失误:2015年做智能手表,从战略角度来说也许就是不对的。为什么?五年以后在充分竞争的情况下没有所谓的生态位——手机厂商都会做,而且是顺带做就能做得很好,因为能力和它的手机完全通用、重合。他说如果当时有战略六要素这个方法,可能会更努力去思考:选择做智能手表,五年以后当巨头都充分投入的时候,我怎么站住一个位置?那可能会想更多差异化,执行路径也会不一样。他假设当年第一天就all in做海外、不做国内、不做那么多智能硬件,利用有限的时间差建立壁垒,状态可能会更成功。核心是「它逼得你思考」。

— 李志飞
1:00:51

曾鸣说我们在一块浮冰上

李志飞在湖畔大学把「AIGC时代三五年后我们这些AI工具还有没有生态位」当作案例提出来,曾鸣的回答是「一定没有」,但「我觉得你已经做到最好了」。曾鸣的比喻是:你今天在一个局势特别不明朗的大海中,你是在一块浮冰上,至少你不在水下,你在冰上;但这个冰随时可能化掉或者翻。所以你要有的姿态是低功耗运转,同时非常敏锐地观察周边有没有坚冰,一旦有坚冰,你要准备好、你还有能力跳上去。李志飞说今天所有的大模型公司可能都得用这种姿态——就算找到了商业模式、有了用户量,你也是在一块浮冰上。

— 李志飞
1:11:06

看见创业死亡的那一刻,我抑郁了

李志飞说2019年是真真切切感受到公司会死掉:账上只剩三四个亿人民币,但工资一年就花三个多亿,还有4亿的库存,一千多个人,还有20个线下门店。他回忆Google没给钱也会死,可能账上只剩三四个月的钱,只是他没去看而已;2014年4月大众给1.8亿美金,如果晚给四个月可能也挂了。2020年疫情来了,不但没触底反弹,底还有那么深,他说「我觉得我都抑郁了」,不想跟任何人说话,表现出来就是CEO已经不想干活了。他的应对是继续裁员、战略性躺平、算P&L——把每个产品线、每个小业务的成本分摊算清楚,算下来亏钱的,从此没有人找他要人。他还举了个例子:当时公司有四个IT,搬个家还得请外包,现在一个IT搬家也不请外面公司。

— 李志飞

原话 · 已逐字校验

有一句话 没有路径和节奏规划的Vision 都是耍流氓

有一句话:没有路径和节奏规划的Vision,都是耍流氓。

李志飞12:38

必然就这样子嘛 这有什么 自己的大降价 必然这样子 而且会趋劝于零 无限接近于零

必然就这样子嘛,这有什么。字节大降价,必然这样子,而且会趋近于零,无限接近于零。

李志飞46:46

你今天就是在一个局势特别不明朗的大海中 你呢 是在一块浮冰上 就你现在做的事情在一块浮冰上 但至少你不在水下 你在冰上 但是呢 你这个东西随时可能 这个冰就会化掉 或者会翻

你今天就是在一个局势特别不明朗的大海中,你是在一块浮冰上,就你现在做的事情在一块浮冰上,但至少你不在水下,你在冰上。但是你这个东西随时可能化掉,或者会翻。

李志飞1:00:51

这可能是我最近两个月以来 第一次看到太阳降落的状态

这可能是我最近两个月以来,第一次看到太阳降落的状态。

李志飞1:09:32

你发现 创业者真的是有的时候 最近这一个月 收了一千万 就开始想 哦 那我平均一个月 估计接下来做两千万 一年 有十二个月 那我就 接下来一年的收入 有两点四个亿

你发现创业者真的是有的时候,最近这一个月收了一千万,就开始想:那我平均一个月估计接下来做两千万,一年有十二个月,那我接下来一年的收入有两点四个亿。

李志飞1:13:32

很多公司 就是科技公司 它从第一天就进入了负循环

很多公司,就是科技公司,它从第一天就进入了负循环。

李志飞1:25:16

今天这个结果 对得起我过去的努力吗 对得我过去受的 这个12年受的磨难吗 我觉得是对不起的

今天这个结果,对得起我过去的努力吗?对得起我过去这12年受的磨难吗?我觉得是对不起的。

李志飞1:27:06

数字与实体

出门问问上市启动到交表去年三月份启动,六月份交表,接近一年2:02
IPO 中介数量四五十个中介(私募融资通常三四个)3:02
大众投资出门问问1.8亿美金(2014年4月)1:11:32
2019 年出门问问库存4亿1:11:32
2019 年出门问问员工数1000多人1:11:32
2020 年裁员后员工数不到300人1:16:32
Google 模型上下文长度两百万 token26:13

术语

VLA视觉-语言-动作模型
以语言模型为基础,加入视觉和动作模态的模型架构。
DiTDiffusion Transformer
基于 Diffusion 的架构,Sora 据称采用,而非自回归。
In Context Learning上下文学习
通过 prompt 或举例,模型无需重训即可学会新任务。
codec编解码器
把声音等模态压缩成 token 表示的技术。
P&L损益表
按产品线核算成本与收入,判断每条业务是否亏钱。

收听指南

谁该听

正在做大模型或AI应用、纠结要不要 all in 的创业者,以及想看AI公司真实财务与战略困境的投资人。

可跳过

开头2:00-8:36上市流程细节可快进,信息密度低。