世界太吵,来原声听播客

张小珺·商业访谈录

Manus 决定出售前最后访谈:AI 没有蛮荒期,因为没新平台

移动互联网的蛮荒期来自硬件换代,桌面到手机让巨头和个人开发者众生平等;AI 技术突破更大,却没有出现全新平台,所以巨头、创业公司、个人开发者反应一样快,蛮荒期不存在。

AI AgentManus创业模型产品
季超和张涛在 Manus 出售前最后一次长谈,把做通用 agent 两年踩过的坑、算过的账、吵过的架全摊开了,信息密度极高。

核心论点 · 点时间戳可跳到原声

4:03

AI 没有蛮荒期,因为没新平台

季超把移动互联网的机会归因于硬件媒介换代:桌面到手机,BAT 和海外大厂跟个人开发者一样众生平等,谁都在试,所以有一段蛮荒期。他认为 AI 虽然技术突破更大,但没有出现一个全新的平台,结果巨头、创业公司、个人开发者反应一样快、动作一样干脆,蛮荒期不存在。这个判断直接解释了他后来为什么不做模型、只做应用。

— 季超
20:12

GPT-3 让他当场决定卖掉公司

Maggie 团队从 2014 年底做到 2018 年,自研两个约 0.3B 的模型,从预训练做起,还自己解决 16K 长上下文。拿到 GPT-3 early access 后,他随便写了个 prompt,发现对方跟他们自训的端到端模型五五开。他意识到:虽然现在很贵,但它是通解。此前 NLP 圈做信息抽取、机器翻译、客服系统的人泾渭分明,GPT-3 把这条心摁死了。他的第一反应是赶紧卖掉公司。

— 季超
23:12

搜索引擎不是技术问题,是数据源问题

Maggie 从爬虫到索引全部自建,没用任何第三方搜索,他称那是自己工程能力的巅峰。但结论是:再做一个新搜索引擎不看好,因为很多数据源跟 Google 已经形成互利互惠的可循环关系,搅局者无法重复 Google 过去二十年积累数据源这件事。他由此总结产品失败的两个原因——技术和非技术,以及「早一步是先驱,早十步是先裂」。

— 季超
33:19

浏览器插件是绝佳的观察窗口

他选 Monica 的理由不是产品形态,而是观测无偏:它不改变用户习惯,用户仍在用 Gmail、看 YouTube,轨迹没被强行改。更关键的是插件按 context 分发功能——视频理解只在看 YouTube 时出现,改写只在 Gmail 或 Google Docs 里出现,消解了功能叠加带来的复杂度爆炸。他引用 GitHub 那句话:Everything added dilutes Everything else。插件甚至不算产品形态,是一个空的 container、空的画布。

— 季超
1:04:30

发一款不酷的产品会把你拖进自证循环

放弃 AI 浏览器后他给出的判断:如果一个产品做完你自己觉得不太酷,就别发——你本该是最喜欢它的人,你都不喜欢,怎么奢望用户喜欢。更实际的理由是机会成本:负责任的团队发了产品就要持续维护,会进入自证循环,错过明明更有价值的新机会。但他也留了分歧面:如果别的团队已经把浏览器做到自己满意的程度,进入自证循环是对的,沿着那条路可能长出完全不同的产品形态。

— 季超
1:08:30

Cursor 暴露了编程是通用能力

让团队转向 Manus 的观察是:公司里运营同事用 Cursor 写博客,数据分析同事用它做分析和可视化。Cursor 本来是最专业的 IDE 形态,却涌进大量非目标用户。他们站在同事身后看:左边是代码,右边是跟 AI 聊天的窗口,不会写代码的人靠对话让 AI 以代码为媒介完成非编码任务。结论是编程不是垂直能力,是解决通用任务的媒介;Cursor 的形态对他们不是最优——应该跑在云上、代码不该是主要呈现、面向 prosumer 而非专业工程师。

— 季超
1:11:34

Manus 一月就做完了,故意压到三月发

Manus 从 2024 年 9 月底开始做,到 2025 年 1 月中基本做完,但季超决定不马上发。当时能拿到的最好模型是 Claude 3.5 Sonnet V2,初步具备 agentic 能力但缺乏真正的 reasoning。他听到 rumor 说两个月后会有一次模型发布,于是选择多花一个半月打磨产品,把发布时间跟下一次模型迭代对齐,让产品发布一瞬间享受最大的代际提升、吃到模型溢出。

— 季超
1:12:36

Monica 的 1200 万 ARR 让他们敢豪赌

做浏览器烧的钱不多,投入人力也就十几个人。当时 Monica 已有接近 12 个 million、即 1200 万美金的 ARR,而且是盈利产品。他强调口径:ARR 是 MRR 乘以 12,不能把一个月内获得的年付算进当月,内部只看 Stripe 和移动端的 MRR 数据,否则有太多种方法把数字造大,那是自己骗自己。正因为有正向现金流产品,做第二曲线时才能既大胆又理智。

— 季超
1:31:42

agent 的 input/output 比例是 100:1 到 1000:1

chatbot 时代做成本估算,input 和 output 的 token 比例一般按 3:1 算——因为 transformer 里 input 是 prefilling,可并行、compute bound,output 是 decoding,bandwidth bound,定价差很多。但在 Manus 这样的 agent 中,input 跟 output 的比例是 100:1 到 1000:1,取决于 task type。output 长度差不多的情况下,input 长度就是几十倍甚至上百倍的差距。这解释了为什么 2025 年初没人预料到 token 消耗量会指数级增长——输入输出比例变了。

— 张涛
1:35:45

200k 以上的 context 已经不重要了

他提了一个暴论:比起更长的 context,更重要的是让模型具备 compaction awareness,也就是对压缩这件事的意识。如果上下文长度无限单调递增,即使有 kv cache 让延迟和成本较低,它仍然是一个增长的过程,不值得。更重要的应该是让模型知道「我现在 context 已经很长了」,能不能把一些信息 offload 到文件系统里,就像人把记忆整理成文档放进 Notion,下次知道什么时候去拿回来。模型要能明白这段东西不是凭空消失了,是被压缩了。

— 张涛
1:37:46

reasoning model 平移到 agent 场景效果反而下降

把为解决竞赛编程或数学而设计的 reasoning model 直接平移到 agent 场景,效果是下降的:instruction following 能力下降,出现幻觉和幻觉攻击调用的概率提升。正确的做法是 interleave thinking——按 ReAct 的框架,获得一个 observation 之后不要立即预测下一个 action,而是做一段相对短暂的中间 reasoning,想想之前做了这些事、下一步该做什么。而不是像 O 系列模型解数学题那样,用户给了很短的问题,哗就想了几千个 token 全在脑内。

— 张涛
1:45:51

Remote Labor Index 上 Manus 是 SOTA,完成率 2.5%

scale.ai 发布了一个新 benchmark 叫 RLI(remote labor index,远程劳动力指标),Manus 是 SOTA 第一名,战胜了 Claude、Gemini 这些竞争对手。评判标准是:这个 AI 系统完成的工作,能否让一个现实的客户愿意为之付款,且无法区分是人类还是 AI 完成的。但完成率只有 2.5%,离百分百很远。他看中这个 benchmark 是因为它契合通用 agent 的衡量指标——能完成多少远程工作者能完成的事。乐观一点,也许到 26 年能刷到 20、30。

— 张涛
1:52:53

不要把人因为生而为人的限制搬给 agent

很多做 agent 的公司有惯性思维,要让 multi agent 系统分为 designer、programmer、manager 这些角色。他认为这不对:人类社会会有分工,是因为哪个人都不太全能,组织架构下大量信息在通信之间损失了,合作中增加了很多摩擦。而模型是比人更加全能的东西,应该充分利用模型的优势,不要生搬硬套人带来的这套约束。做通用 agent 是在做一个能完成人做的事情的系统,但不该用人的分工或特化去要求模型。

— 张涛
2:13:03

邀请码不是营销,是云厂商说放开会挂

发布前跟所有云厂商和 inference provider 聊完,惊讶地发现世界上能够在第二天立即到位的算力比想象中少太多。所有使用的云和模型厂商都没法提供这个量,Cloud 说你们千万别放开,你如果放开我们会挂。所以唯一的选择就是控量,控量的方法就是邀请码。他承认有更好的做法,比如定向邀请而不是明确的码。后来不到一个月就把邀请码去掉了。他直接说:如果我们在三月份发布的时候,如果没有任何付费宣传我死全家。

— 张涛
2:56:26

大规模个性化不必走参数更新

他判断 mass personalization 不一定要用 online learning 或参数化方式完成——给每个用户挂一套不可复用的参数(如 multi-lora 方案)反而拉低推理效率,因为降成本、降 latency 靠的是规模效应。真正值得区分的是「持续学习」和「在线学习」:只有当任务的理想分布随时间改变时(他举金融市场,今天的正确答案不一定是明天的正确答案),在线学习才有价值。现在很多所谓 online learning 的实践,本质只是 on policy 的数据收集加周期性优化,任务本身没有动态性,很快会把 benchmark 打透,没有持续提升空间。

2:57:27

他给 agentic 模型的四条建议

第一,与其无限扩展 context window,不如让模型学会 compaction awareness——意识到自己的上下文可能被压缩,并知道如何向文件系统 offload 和 retrieve。第二,reasoning 的优化目标不要做成纯「缸中之脑」,要考虑结合 observation,即 TIR(Tool Integrated Reasoning),这跟完全靠 RLVR 去解竞赛编程和数学是两条路。第三,交互模式:chatbot 场景是用户与模型交替执行、你等我我等你,而 Manus 刚出来时让人新奇的是 agent 持续工作时用户可以随时插嘴——改目标、补信息甚至终结它,很多模型还没掌握这种异步交互。第四,error resilience:真实环境里错误是常态,最好的模型应该永远能找到另一条路去尝试,这需要专门训练。

3:00:29

从 CBA 打到 NBA 的自我定位

他把这次创业描述为第一次充分参与全球竞争,内部开玩笑说是「从 CBA 打到了 NBA」。即便 Manus 现在可能已经 100 个 millionaire(他原话如此),横向看各行各业的头部选手,又觉得自己不算什么,可能只是 NBA 的平均水平。成本结构也完全不同:移动互联网时代看得到 IGA 行为、边际成本很低,现在从 Manus 上线第一天起基本就是几十万美金、几十万美金在烧,上来就是挺重资产的投入。

3:03:32

技术对产品有一票否决权

产品和模型谁话语权更大?他的回答是技术服务于产品,但技术对很多事有一票否决权:产品可能有一些非常诱人的快糙猛做法,比如是否放弃纯沙箱这个想法改用快速 fix,这种情况无论他还是技术都会站出来直接阻止。他明确反对投票这个概念,认为投票是在异化团队——大家会为自己的观点服务,应该看着目标而不是投票的手段,目标一致就一定能达成共识。讨论中没有人强势,但会期待 Red 来做最终拍板;讨论的价值不是讨论出结果,而是提供更多 alternatives。

3:14:40

Manus 最大的隐忧是失去特色

从外看,他心里的最大隐忧是 Manus 失去特色;从内看,最害怕的是 Manus 变得复杂。他引用 GitHub 那句话——每增加一个功能,都在吸食所有别的东西——所以希望 Manus 保持克制走下去,但又不能因为克制而影响持续增长。至于会不会死于竞争,他认为 Manus 更大的可能性不是因为竞争而输掉,而是失去独有的价值之后用户离开,那也算竞争,所以答案是:Manus 有可能因为竞争而死掉。

3:18:45

杨乐坤离开 Meta 是积极信号

他认为杨乐坤在业界是值得尊敬的泰斗,但在一家商业机构内做这样的角色自有其痛苦之处,能找到自由空间去做研究挺好,同时也给 Meta 解放了很多思想负担,Meta 可能会投入到一些更朴素且有快速成效的工作中。谈到田渊栋,他特别推崇 latent reasoning 方向:RLVR 本质上是增加模型在 pass@1 下的稳定性,让一次推理达到正确答案的概率更高,但模型能否解题仍取决于基座质量——非 RLVR 模型多次采样大概率也能采出正确轨迹,这说明 RLVR 接近于用搜索方式解决问题,而采样这一步本身就带来了塌缩;latent reasoning 不做这次 sample,可以在近乎平行的维度同时考虑多种可能性,reasoning 效率更高,还能解决用户视角下 latency 高的问题。

原话 · 已逐字校验

但是创业就是这样 你早一步就先裂 对吧 早一步是先驱 早十步就是先裂

但创业就是这样,你早一步就先裂,对吧。早一步是先驱,早十步就是先裂。

季超23:12

如果一个产品做完 你觉得不太酷就别发 你都觉得不酷 没人会觉得酷

如果一个产品做完,你觉得不太酷就别发。你都觉得不酷,没人会觉得酷。

季超1:04:30

agent chatbot的最大区别是什么 就是chatbot这整个系统里只有两个元素 人用户以及模型 你们两个之间以往复的形式去交互 但其实agent有一个第三个元素 是环境或者叫run time

agent 和 chatbot 最大的区别是什么?chatbot 这整个系统里只有两个元素:人(用户)以及模型,你们两个之间以往复的形式交互。但其实 agent 有第三个元素,是环境,或者叫 runtime。

季超1:17:38

就像我有一部分 记忆就像人一样 我这个东西 不用脑子里一直装着 人的记忆其实挺差的 就是我的工作内存很差 但是我会知道 这个事我可以整理成一个文档 放在我的notion里头 我下次我知道 我该什么时候去拿回来

就像我有一部分记忆,就像人一样,这个东西不用脑子里一直装着。人的记忆其实挺差的,我的工作内存很差,但是我会知道,这个事我可以整理成一个文档,放在我的 Notion 里头,我下次知道该什么时候去拿回来。

张涛1:36:46

实际上模型是比人更加全能的一个东西 所以你应该充分利用模型的优势 而不要生搬硬套人带来这套约束

实际上模型是比人更加全能的一个东西,所以你应该充分利用模型的优势,而不要生搬硬套人带来的这套约束。

张涛1:52:53

如果我们在三月份发布的时候 如果没有任何付费宣传我死全家

如果我们在三月份发布的时候,如果没有任何付费宣传,我死全家。

张涛2:17:05

讨论的价值我觉得不是说讨论出一个结果 而是说更多人提供出更多的方案

讨论的价值我觉得不是说讨论出一个结果,而是说更多人提供出更多的方案。

Manus更大的可能性 不是因为竞争而输掉 而是因为

Manus 更大的可能性,不是因为竞争而输掉,而是因为……

数字与实体

Manus 当前 ARR超过 1 亿美金1:13:36
Manus 的 input/output token 比例100:1 到 1000:11:31:42
chatbot 的 input/output token 比例3:11:31:42
Manus 在 Remote Labor Index 上的完成率2.5%1:45:51
Manus 1.5 平均体感提速3 到 5 倍2:29:10
Manus 上线首日起的日投入几十万美金3:00:29
Manus 的 millionaire 数量100 个3:00:29
公司规模100 人3:04:33
此前带过的最大团队规模10 人左右3:04:33

术语

compaction awareness压缩意识
模型意识到自己的上下文可能被压缩,并知道如何向文件系统 offload 和 retrieve。
Remote Labor Index远程劳动力指标
scale.ai 发布的 benchmark,衡量 AI 完成远程工作者任务、且客户愿意付款的比例。
TIR工具集成推理
Tool Integrated Reasoning,reasoning 结合 observation,而非纯靠 RLVR 解数学题。
RLVR可验证奖励强化学习
用可验证的奖励信号做强化学习,本质是增加模型在 pass@1 下的稳定性。
latent reasoning隐空间推理
不做采样,在近乎平行的维度同时考虑多种可能性,reasoning 效率更高。

收听指南

谁该听

正在做 AI 应用或 agent 的创业者、投资人和工程师,尤其是关心通用 agent 技术路线、成本结构和产品取舍的人。

可跳过

3:18:45 之后关于杨乐坤、田渊栋和 latent reasoning 的闲聊,信息密度较低。