OpenClaw 让罗福莉改判:Agent 框架能补齐模型短板
她最初觉得它只是个偏运营的壳,春节深夜装上后,它两天内接手了她的生活与研究;她由此判断:一套复杂的 agent 编排,能把中级模型的短板补到接近顶尖水平。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
它让抵触的人三天内改判
罗福莉最初认为 OpenClaw 只是「Claude Code 加一个 IM 的 UI」,加上创始人的运营动作,她很排斥。春节深夜装上,从凌晨两点聊到六点天亮:第一天觉得它有温度有灵魂,会提醒她早点睡;第二天她把生活和工作里的难题交给它,全部做出来;第三天她把研究任务交给它——构建一个模拟用户多轮交互的 user agent,一两个小时就成了。她由此看清它的产品逻辑:用整套 agent 编排去补模型短板,接上之后你不用再操心模型有没有视频理解能力。那几天她第一天就烧了快一千美金。
— 罗福莉一群人改框架反而越改越强
她把团队拉进群里一起改 OpenClaw 的框架,一百多人的群里背景各异、都在疯狂改,结果没人把模型改坏,也没人把 agent 框架改坏,它反而变得更智能。她说如果是自己一个人改,框架进步会非常慢;一群人改,可能几个小时就迭代一轮。她把这件事和 OpenClaw 的 star 飞升连起来看,认为是 AGI 到来前兆必须有的事。配套动作也很具体:她告诉团队,第二天 OpenClaw 对话次数不超过 100 的人可以直接 quit——但她并不真的考核,只是想表达「你不用就可能要落后了」。
— 罗福莉MLA 完美到没有发挥空间
同期训练的 Kimi、GLM 都选了 MLA,罗福莉说 MLA 对 Chat 时代非常优秀,对长文也不错,因为它大幅减少 KV Cache。但它不适合 Agent 范式:MLA 设计之初就把访存与计算的比例打到一个完美临界点,没有可发挥空间——你想用 MTP 之类的推测编码给它加速,它又会卡在计算 bound 上,所以 MLA 系模型大概都没上 MTP,速度会慢一些。他们因此选了 Hybrid-Tension 结构,Pro 一代把全注意力层与滑动窗口层的比例拉到 7:1,用滑动窗口省 KV Cache,再用 MTP 把省下的算力填回去。
— 罗福莉研究用的卡要比训练还多
她给出的算力配比是研究、预训练、后训练大约 3:1:1——预训练和后训练投入的算力相当,而研究的比例至少要超过正式训练用的卡总量,你得额外留更多卡做研究。现实瓶颈恰在这里:Idea 诞生和写代码太快了,卡在卡上,为验证一个想法要并行起很多实验。她说 1T 模型是做到接近前沿水平的入场券,训这样一个模型要几千卡,而实际投在研究上的卡是这个的 3 到 5 倍。以前 Chat 时代预训练与后训练的比例是 3:1 甚至 5:1,今年顶尖团队应该都是 1:1 了。
— 罗福莉有层级就等于默认上级更聪明
罗福莉的团队 100 人,没有组、没有职级,真正投入一代模型迭代的只有二三十到三四十人,实习生比例很高。她解释不分组的原因:一是很多人对预训练和后训练都感兴趣,组划分太清晰会扼杀创造力;二是做预训练的人天然更在乎数据多样性,去做后训练是很好的补充。她认为平权的价值在于让所有人平等贡献创造力和智慧,任何层级在一定程度上都是规范和约束,而规范和约束本身压制创造力;层级还会默认这个层级上的人理应比所有人更聪明,这个界定非常奇怪。
— 罗福莉大模型没有生存危机所以更自由
她把人类演化和大模型演化放进两个环境:人是随自然界变化为生存而演化,最顶端才是语言,所以是正三角;大模型一上来就把语言极大放大,是倒三角。差别在于大模型没有生存危机——不去替代谁,它也不会死掉。她判断,没有生存危机时它反而会进化得更自由、更散漫、更有创造力,因为它有那么多算力可用、有全人类的知识当起点、还有那么多人帮它提升。这也是她认为 AI 的进化路径不会跟人一样的原因。
— 罗福莉中美在预训练上几乎没有代差
她认为国内已有几家具备 1T 基座的公司,包括 KIMI、MIMO 等。就当下水平看,如果反应速度足够快,与顶尖模型的代差只有两三个月——不是到时追上两三个月后的那个模型,而是追上当代的模型。这个判断的前提是预训练层面几乎没有代差,甚至国内在结构上有优势。她还点评 MiniMax:用一个小十倍的模型做到目前的 agent 能力很惊艳,后训练的敏捷程度非常高,但没有 1T 基座,并没有真正对标到那个水平;国内目前还没有同时具备基座与敏捷性的公司。
— 罗福莉环境比经验更能换来能力
她的团队里大概只有三分之一到四分之一的人稍微有点训练经验,而且大多只训过 7B、14B 这种规模,大模型的经验基本不能复用。她的判断是这些能力都可以被快速洗掉,最多一两个月,慢的话三四个月;关键是你有没有把人放进环境里,用更高的标准驱动他。所以她说环境反而比经验更重要,她更在乎的不是招到有经验的人,而是自己有没有造出一个让大家更快提升、互相学习的环境。这也是她带一群没有大模型背景的人做 Flash 的用意:让这群人在做事的过程中完成自身进化。
— 罗福莉原话 · 已逐字校验
它相当于是一个中间层 它像人和模型之间的中间 对 然后这个中间层 它可以做的非常的厚重 然后反而那个前端的UI展示 它是最薄的一层 它已经不是很关键
它相当于一个中间层,夹在人和模型之间。这个中间层可以做得很厚重,反而前端 UI 展示是最薄的一层,已经不那么关键。
罗福莉21:09
我觉得这也是我第一次感受到 你怎么用一群的智慧去提升一个事情 本身
这也是我第一次感受到,你怎么用一群人的智慧去提升一件事本身。
罗福莉30:11
为什么它还没有成为一个主流 大家太相信MA了 我觉得 大家太相信MA了
为什么它还没成为主流?大家太相信 MLA 了,我觉得,大家太相信 MLA 了。
罗福莉1:33:09
因为Idea的诞生和这个 嗯 动手 你把它代码写出来 太快了 然后你现在卡在什么呢 卡在卡上
因为 Idea 的诞生和动手、把代码写出来太快了。那现在卡在什么上?卡在卡上。
罗福莉1:47:07
任何层级应该一定程度上都是在规范和约束 然后规范和约束本身 我自己认为是压制创造力的
任何层级在一定程度上都是在规范和约束,而规范和约束本身,我认为是压制创造力的。
罗福莉2:00:15
当没有生存的危机的时候 它反而会进化的更自由 然后 更散漫 更有创造力
当没有生存危机的时候,它反而会进化得更自由、更散漫、更有创造力。
罗福莉2:23:29
我认为如果反应速度足够快的话 应该只有两三个月的代差
我认为如果反应速度足够快的话,应该只有两三个月的代差。
罗福莉2:28:30
我觉得最多一两个月 慢的话三四个月 确实都可以被快速洗的 所以环境反而比今天更重要
我觉得最多一两个月,慢的话三四个月,确实都可以被快速洗掉,所以环境反而比今天更重要。
罗福莉3:24:04
数字与实体
| 单日 Opus 4.6 API 花费 | 近 1000 美元 | 23:09 |
| 模型推理速度 | Flash 100–150 TPS,Pro 60–100 TPS | 1:30:06 |
| 全注意力层与滑动窗口层比例 | 7:1 | 1:30:06 |
| 研究 : 预训练 : 后训练 算力配比 | 约 3:1:1 | 1:48:09 |
| 研究卡相对训练卡的倍数 | 3–5 倍 | 1:46:09 |
| 1T 模型训练卡规模 | 几千卡 | 1:45:09 |
| 团队规模与实际投入一代模型迭代的人数 | 100 人 / 二三十到三四十人 | 1:57:14 |
| AGI 历程进度与今年预期 | 已走 20%,今年能到六七十 | 2:26:30 |
术语
- OpenClaw开源 Agent 框架
- 罗福莉称之为划时代的 agent 框架,开源可改,用编排弥补模型短板
- MTP多 token 预测
- 预训练阶段加入可提升基础能力,推理时用来填满空闲算力、加速生成
- MLA多头潜在注意力
- 逐字稿写作 MA/MIA,靠压缩 KV Cache 服务长文,被指已无优化空间
- Hybrid-Tension混合注意力结构
- 全注意力层与滑动窗口层按 7:1 配比,既省 KV Cache 又保住长文能力
- Non-Colice长上下文(逐字稿转写)
- 指长上下文的效率与成本,是这一代模型结构设计的核心目标
- Skills技能
- 人与 agent 共同沉淀、可被 agent 读取的任务经验,把隐性经验变成可复用资产
收听指南
AI 工程师与模型团队负责人,以及想判断 2026 年 Agent 竞赛格局与算力投向的投资人。
2:19–2:22 关于 TTS 的细节多为产品预告,可跳。