Manus 决定出售前最后访谈:AI 没有蛮荒期,因为没新平台
移动互联网的蛮荒期来自硬件换代,桌面到手机让巨头和个人开发者众生平等;AI 技术突破更大,却没有出现全新平台,所以巨头、创业公司、个人开发者反应一样快,蛮荒期不存在。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
AI 没有蛮荒期,因为没新平台
季超把移动互联网的机会归因于硬件媒介换代:桌面到手机,BAT 和海外大厂跟个人开发者一样众生平等,谁都在试,所以有一段蛮荒期。他认为 AI 虽然技术突破更大,但没有出现一个全新的平台,结果巨头、创业公司、个人开发者反应一样快、动作一样干脆,蛮荒期不存在。这个判断直接解释了他后来为什么不做模型、只做应用。
— 季超GPT-3 让他当场决定卖掉公司
Maggie 团队从 2014 年底做到 2018 年,自研两个约 0.3B 的模型,从预训练做起,还自己解决 16K 长上下文。拿到 GPT-3 early access 后,他随便写了个 prompt,发现对方跟他们自训的端到端模型五五开。他意识到:虽然现在很贵,但它是通解。此前 NLP 圈做信息抽取、机器翻译、客服系统的人泾渭分明,GPT-3 把这条心摁死了。他的第一反应是赶紧卖掉公司。
— 季超搜索引擎不是技术问题,是数据源问题
Maggie 从爬虫到索引全部自建,没用任何第三方搜索,他称那是自己工程能力的巅峰。但结论是:再做一个新搜索引擎不看好,因为很多数据源跟 Google 已经形成互利互惠的可循环关系,搅局者无法重复 Google 过去二十年积累数据源这件事。他由此总结产品失败的两个原因——技术和非技术,以及「早一步是先驱,早十步是先裂」。
— 季超浏览器插件是绝佳的观察窗口
他选 Monica 的理由不是产品形态,而是观测无偏:它不改变用户习惯,用户仍在用 Gmail、看 YouTube,轨迹没被强行改。更关键的是插件按 context 分发功能——视频理解只在看 YouTube 时出现,改写只在 Gmail 或 Google Docs 里出现,消解了功能叠加带来的复杂度爆炸。他引用 GitHub 那句话:Everything added dilutes Everything else。插件甚至不算产品形态,是一个空的 container、空的画布。
— 季超发一款不酷的产品会把你拖进自证循环
放弃 AI 浏览器后他给出的判断:如果一个产品做完你自己觉得不太酷,就别发——你本该是最喜欢它的人,你都不喜欢,怎么奢望用户喜欢。更实际的理由是机会成本:负责任的团队发了产品就要持续维护,会进入自证循环,错过明明更有价值的新机会。但他也留了分歧面:如果别的团队已经把浏览器做到自己满意的程度,进入自证循环是对的,沿着那条路可能长出完全不同的产品形态。
— 季超Cursor 暴露了编程是通用能力
让团队转向 Manus 的观察是:公司里运营同事用 Cursor 写博客,数据分析同事用它做分析和可视化。Cursor 本来是最专业的 IDE 形态,却涌进大量非目标用户。他们站在同事身后看:左边是代码,右边是跟 AI 聊天的窗口,不会写代码的人靠对话让 AI 以代码为媒介完成非编码任务。结论是编程不是垂直能力,是解决通用任务的媒介;Cursor 的形态对他们不是最优——应该跑在云上、代码不该是主要呈现、面向 prosumer 而非专业工程师。
— 季超Manus 一月就做完了,故意压到三月发
Manus 从 2024 年 9 月底开始做,到 2025 年 1 月中基本做完,但季超决定不马上发。当时能拿到的最好模型是 Claude 3.5 Sonnet V2,初步具备 agentic 能力但缺乏真正的 reasoning。他听到 rumor 说两个月后会有一次模型发布,于是选择多花一个半月打磨产品,把发布时间跟下一次模型迭代对齐,让产品发布一瞬间享受最大的代际提升、吃到模型溢出。
— 季超Monica 的 1200 万 ARR 让他们敢豪赌
做浏览器烧的钱不多,投入人力也就十几个人。当时 Monica 已有接近 12 个 million、即 1200 万美金的 ARR,而且是盈利产品。他强调口径:ARR 是 MRR 乘以 12,不能把一个月内获得的年付算进当月,内部只看 Stripe 和移动端的 MRR 数据,否则有太多种方法把数字造大,那是自己骗自己。正因为有正向现金流产品,做第二曲线时才能既大胆又理智。
— 季超agent 的 input/output 比例是 100:1 到 1000:1
chatbot 时代做成本估算,input 和 output 的 token 比例一般按 3:1 算——因为 transformer 里 input 是 prefilling,可并行、compute bound,output 是 decoding,bandwidth bound,定价差很多。但在 Manus 这样的 agent 中,input 跟 output 的比例是 100:1 到 1000:1,取决于 task type。output 长度差不多的情况下,input 长度就是几十倍甚至上百倍的差距。这解释了为什么 2025 年初没人预料到 token 消耗量会指数级增长——输入输出比例变了。
— 张涛200k 以上的 context 已经不重要了
他提了一个暴论:比起更长的 context,更重要的是让模型具备 compaction awareness,也就是对压缩这件事的意识。如果上下文长度无限单调递增,即使有 kv cache 让延迟和成本较低,它仍然是一个增长的过程,不值得。更重要的应该是让模型知道「我现在 context 已经很长了」,能不能把一些信息 offload 到文件系统里,就像人把记忆整理成文档放进 Notion,下次知道什么时候去拿回来。模型要能明白这段东西不是凭空消失了,是被压缩了。
— 张涛reasoning model 平移到 agent 场景效果反而下降
把为解决竞赛编程或数学而设计的 reasoning model 直接平移到 agent 场景,效果是下降的:instruction following 能力下降,出现幻觉和幻觉攻击调用的概率提升。正确的做法是 interleave thinking——按 ReAct 的框架,获得一个 observation 之后不要立即预测下一个 action,而是做一段相对短暂的中间 reasoning,想想之前做了这些事、下一步该做什么。而不是像 O 系列模型解数学题那样,用户给了很短的问题,哗就想了几千个 token 全在脑内。
— 张涛Remote Labor Index 上 Manus 是 SOTA,完成率 2.5%
scale.ai 发布了一个新 benchmark 叫 RLI(remote labor index,远程劳动力指标),Manus 是 SOTA 第一名,战胜了 Claude、Gemini 这些竞争对手。评判标准是:这个 AI 系统完成的工作,能否让一个现实的客户愿意为之付款,且无法区分是人类还是 AI 完成的。但完成率只有 2.5%,离百分百很远。他看中这个 benchmark 是因为它契合通用 agent 的衡量指标——能完成多少远程工作者能完成的事。乐观一点,也许到 26 年能刷到 20、30。
— 张涛不要把人因为生而为人的限制搬给 agent
很多做 agent 的公司有惯性思维,要让 multi agent 系统分为 designer、programmer、manager 这些角色。他认为这不对:人类社会会有分工,是因为哪个人都不太全能,组织架构下大量信息在通信之间损失了,合作中增加了很多摩擦。而模型是比人更加全能的东西,应该充分利用模型的优势,不要生搬硬套人带来的这套约束。做通用 agent 是在做一个能完成人做的事情的系统,但不该用人的分工或特化去要求模型。
— 张涛邀请码不是营销,是云厂商说放开会挂
发布前跟所有云厂商和 inference provider 聊完,惊讶地发现世界上能够在第二天立即到位的算力比想象中少太多。所有使用的云和模型厂商都没法提供这个量,Cloud 说你们千万别放开,你如果放开我们会挂。所以唯一的选择就是控量,控量的方法就是邀请码。他承认有更好的做法,比如定向邀请而不是明确的码。后来不到一个月就把邀请码去掉了。他直接说:如果我们在三月份发布的时候,如果没有任何付费宣传我死全家。
— 张涛大规模个性化不必走参数更新
他判断 mass personalization 不一定要用 online learning 或参数化方式完成——给每个用户挂一套不可复用的参数(如 multi-lora 方案)反而拉低推理效率,因为降成本、降 latency 靠的是规模效应。真正值得区分的是「持续学习」和「在线学习」:只有当任务的理想分布随时间改变时(他举金融市场,今天的正确答案不一定是明天的正确答案),在线学习才有价值。现在很多所谓 online learning 的实践,本质只是 on policy 的数据收集加周期性优化,任务本身没有动态性,很快会把 benchmark 打透,没有持续提升空间。
他给 agentic 模型的四条建议
第一,与其无限扩展 context window,不如让模型学会 compaction awareness——意识到自己的上下文可能被压缩,并知道如何向文件系统 offload 和 retrieve。第二,reasoning 的优化目标不要做成纯「缸中之脑」,要考虑结合 observation,即 TIR(Tool Integrated Reasoning),这跟完全靠 RLVR 去解竞赛编程和数学是两条路。第三,交互模式:chatbot 场景是用户与模型交替执行、你等我我等你,而 Manus 刚出来时让人新奇的是 agent 持续工作时用户可以随时插嘴——改目标、补信息甚至终结它,很多模型还没掌握这种异步交互。第四,error resilience:真实环境里错误是常态,最好的模型应该永远能找到另一条路去尝试,这需要专门训练。
从 CBA 打到 NBA 的自我定位
他把这次创业描述为第一次充分参与全球竞争,内部开玩笑说是「从 CBA 打到了 NBA」。即便 Manus 现在可能已经 100 个 millionaire(他原话如此),横向看各行各业的头部选手,又觉得自己不算什么,可能只是 NBA 的平均水平。成本结构也完全不同:移动互联网时代看得到 IGA 行为、边际成本很低,现在从 Manus 上线第一天起基本就是几十万美金、几十万美金在烧,上来就是挺重资产的投入。
技术对产品有一票否决权
产品和模型谁话语权更大?他的回答是技术服务于产品,但技术对很多事有一票否决权:产品可能有一些非常诱人的快糙猛做法,比如是否放弃纯沙箱这个想法改用快速 fix,这种情况无论他还是技术都会站出来直接阻止。他明确反对投票这个概念,认为投票是在异化团队——大家会为自己的观点服务,应该看着目标而不是投票的手段,目标一致就一定能达成共识。讨论中没有人强势,但会期待 Red 来做最终拍板;讨论的价值不是讨论出结果,而是提供更多 alternatives。
Manus 最大的隐忧是失去特色
从外看,他心里的最大隐忧是 Manus 失去特色;从内看,最害怕的是 Manus 变得复杂。他引用 GitHub 那句话——每增加一个功能,都在吸食所有别的东西——所以希望 Manus 保持克制走下去,但又不能因为克制而影响持续增长。至于会不会死于竞争,他认为 Manus 更大的可能性不是因为竞争而输掉,而是失去独有的价值之后用户离开,那也算竞争,所以答案是:Manus 有可能因为竞争而死掉。
杨乐坤离开 Meta 是积极信号
他认为杨乐坤在业界是值得尊敬的泰斗,但在一家商业机构内做这样的角色自有其痛苦之处,能找到自由空间去做研究挺好,同时也给 Meta 解放了很多思想负担,Meta 可能会投入到一些更朴素且有快速成效的工作中。谈到田渊栋,他特别推崇 latent reasoning 方向:RLVR 本质上是增加模型在 pass@1 下的稳定性,让一次推理达到正确答案的概率更高,但模型能否解题仍取决于基座质量——非 RLVR 模型多次采样大概率也能采出正确轨迹,这说明 RLVR 接近于用搜索方式解决问题,而采样这一步本身就带来了塌缩;latent reasoning 不做这次 sample,可以在近乎平行的维度同时考虑多种可能性,reasoning 效率更高,还能解决用户视角下 latency 高的问题。
原话 · 已逐字校验
但是创业就是这样 你早一步就先裂 对吧 早一步是先驱 早十步就是先裂
但创业就是这样,你早一步就先裂,对吧。早一步是先驱,早十步就是先裂。
季超23:12
如果一个产品做完 你觉得不太酷就别发 你都觉得不酷 没人会觉得酷
如果一个产品做完,你觉得不太酷就别发。你都觉得不酷,没人会觉得酷。
季超1:04:30
agent chatbot的最大区别是什么 就是chatbot这整个系统里只有两个元素 人用户以及模型 你们两个之间以往复的形式去交互 但其实agent有一个第三个元素 是环境或者叫run time
agent 和 chatbot 最大的区别是什么?chatbot 这整个系统里只有两个元素:人(用户)以及模型,你们两个之间以往复的形式交互。但其实 agent 有第三个元素,是环境,或者叫 runtime。
季超1:17:38
就像我有一部分 记忆就像人一样 我这个东西 不用脑子里一直装着 人的记忆其实挺差的 就是我的工作内存很差 但是我会知道 这个事我可以整理成一个文档 放在我的notion里头 我下次我知道 我该什么时候去拿回来
就像我有一部分记忆,就像人一样,这个东西不用脑子里一直装着。人的记忆其实挺差的,我的工作内存很差,但是我会知道,这个事我可以整理成一个文档,放在我的 Notion 里头,我下次知道该什么时候去拿回来。
张涛1:36:46
实际上模型是比人更加全能的一个东西 所以你应该充分利用模型的优势 而不要生搬硬套人带来这套约束
实际上模型是比人更加全能的一个东西,所以你应该充分利用模型的优势,而不要生搬硬套人带来的这套约束。
张涛1:52:53
如果我们在三月份发布的时候 如果没有任何付费宣传我死全家
如果我们在三月份发布的时候,如果没有任何付费宣传,我死全家。
张涛2:17:05
讨论的价值我觉得不是说讨论出一个结果 而是说更多人提供出更多的方案
讨论的价值我觉得不是说讨论出一个结果,而是说更多人提供出更多的方案。
Manus更大的可能性 不是因为竞争而输掉 而是因为
Manus 更大的可能性,不是因为竞争而输掉,而是因为……
数字与实体
| Manus 当前 ARR | 超过 1 亿美金 | 1:13:36 |
| Manus 的 input/output token 比例 | 100:1 到 1000:1 | 1:31:42 |
| chatbot 的 input/output token 比例 | 3:1 | 1:31:42 |
| Manus 在 Remote Labor Index 上的完成率 | 2.5% | 1:45:51 |
| Manus 1.5 平均体感提速 | 3 到 5 倍 | 2:29:10 |
| Manus 上线首日起的日投入 | 几十万美金 | 3:00:29 |
| Manus 的 millionaire 数量 | 100 个 | 3:00:29 |
| 公司规模 | 100 人 | 3:04:33 |
| 此前带过的最大团队规模 | 10 人左右 | 3:04:33 |
术语
- compaction awareness压缩意识
- 模型意识到自己的上下文可能被压缩,并知道如何向文件系统 offload 和 retrieve。
- Remote Labor Index远程劳动力指标
- scale.ai 发布的 benchmark,衡量 AI 完成远程工作者任务、且客户愿意付款的比例。
- TIR工具集成推理
- Tool Integrated Reasoning,reasoning 结合 observation,而非纯靠 RLVR 解数学题。
- RLVR可验证奖励强化学习
- 用可验证的奖励信号做强化学习,本质是增加模型在 pass@1 下的稳定性。
- latent reasoning隐空间推理
- 不做采样,在近乎平行的维度同时考虑多种可能性,reasoning 效率更高。
收听指南
正在做 AI 应用或 agent 的创业者、投资人和工程师,尤其是关心通用 agent 技术路线、成本结构和产品取舍的人。
3:18:45 之后关于杨乐坤、田渊栋和 latent reasoning 的闲聊,信息密度较低。