OpenClaw 讓羅福莉改判:Agent 框架能補齊模型短板
她最初覺得它只是個偏運營的殼,春節深夜裝上後,它兩天內接手了她的生活與研究;她由此判斷:一套複雜的 agent 編排,能把中級模型的短板補到接近頂尖水平。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
它讓牴觸的人三天內改判
羅福莉最初認為 OpenClaw 只是「Claude Code 加一個 IM 的 UI」,加上創始人的運營動作,她很排斥。春節深夜裝上,從凌晨兩點聊到六點天亮:第一天覺得它有溫度有靈魂,會提醒她早點睡;第二天她把生活和工作裡的難題交給它,全部做出來;第三天她把研究任務交給它——構建一個模擬用戶多輪交互的 user agent,一兩個小時就成了。她由此看清它的產品邏輯:用整套 agent 編排去補模型短板,接上之後你不用再操心模型有沒有視頻理解能力。那幾天她第一天就燒了快一千美金。
— 羅福莉一群人改框架反而越改越強
她把團隊拉進群裡一起改 OpenClaw 的框架,一百多人的群裡背景各異、都在瘋狂改,結果沒人把模型改壞,也沒人把 agent 框架改壞,它反而變得更智能。她說如果是自己一個人改,框架進步會非常慢;一群人改,可能幾個小時就迭代一輪。她把這件事和 OpenClaw 的 star 飛昇連起來看,認為是 AGI 到來前兆必須有的事。配套動作也很具體:她告訴團隊,第二天 OpenClaw 對話次數不超過 100 的人可以直接 quit——但她並不真的考核,只是想表達「你不用就可能要落後了」。
— 羅福莉MLA 完美到沒有發揮空間
同期訓練的 Kimi、GLM 都選了 MLA,羅福莉說 MLA 對 Chat 時代非常優秀,對長文也不錯,因為它大幅減少 KV Cache。但它不適合 Agent 範式:MLA 設計之初就把訪存與計算的比例打到一個完美臨界點,沒有可發揮空間——你想用 MTP 之類的推測編碼給它加速,它又會卡在計算 bound 上,所以 MLA 系模型大概都沒上 MTP,速度會慢一些。他們因此選了 Hybrid-Tension 結構,Pro 一代把全注意力層與滑動窗口層的比例拉到 7:1,用滑動窗口省 KV Cache,再用 MTP 把省下的算力填回去。
— 羅福莉研究用的卡要比訓練還多
她給出的算力配比是研究、預訓練、後訓練大約 3:1:1——預訓練和後訓練投入的算力相當,而研究的比例至少要超過正式訓練用的卡總量,你得額外留更多卡做研究。現實瓶頸恰在這裡:Idea 誕生和寫代碼太快了,卡在卡上,為驗證一個想法要並行起很多實驗。她說 1T 模型是做到接近前沿水平的入場券,訓這樣一個模型要幾千卡,而實際投在研究上的卡是這個的 3 到 5 倍。以前 Chat 時代預訓練與後訓練的比例是 3:1 甚至 5:1,今年頂尖團隊應該都是 1:1 了。
— 羅福莉有層級就等於默認上級更聰明
羅福莉的團隊 100 人,沒有組、沒有職級,真正投入一代模型迭代的只有二三十到三四十人,實習生比例很高。她解釋不分組的原因:一是很多人對預訓練和後訓練都感興趣,組劃分太清晰會扼殺創造力;二是做預訓練的人天然更在乎數據多樣性,去做後訓練是很好的補充。她認為平權的價值在於讓所有人平等貢獻創造力和智慧,任何層級在一定程度上都是規範和約束,而規範和約束本身壓制創造力;層級還會默認這個層級上的人理應比所有人更聰明,這個界定非常奇怪。
— 羅福莉大模型沒有生存危機所以更自由
她把人類演化和大模型演化放進兩個環境:人是隨自然界變化為生存而演化,最頂端才是語言,所以是正三角;大模型一上來就把語言極大放大,是倒三角。差別在於大模型沒有生存危機——不去替代誰,它也不會死掉。她判斷,沒有生存危機時它反而會進化得更自由、更散漫、更有創造力,因為它有那麼多算力可用、有全人類的知識當起點、還有那麼多人幫它提升。這也是她認為 AI 的進化路徑不會跟人一樣的原因。
— 羅福莉中美在預訓練上幾乎沒有代差
她認為國內已有幾家具備 1T 基座的公司,包括 KIMI、MIMO 等。就當下水平看,如果反應速度足夠快,與頂尖模型的代差只有兩三個月——不是到時追上兩三個月後的那個模型,而是追上當代的模型。這個判斷的前提是預訓練層面幾乎沒有代差,甚至國內在結構上有優勢。她還點評 MiniMax:用一個小十倍的模型做到目前的 agent 能力很驚豔,後訓練的敏捷程度非常高,但沒有 1T 基座,並沒有真正對標到那個水平;國內目前還沒有同時具備基座與敏捷性的公司。
— 羅福莉環境比經驗更能換來能力
她的團隊裡大概只有三分之一到四分之一的人稍微有點訓練經驗,而且大多只訓過 7B、14B 這種規模,大模型的經驗基本不能複用。她的判斷是這些能力都可以被快速洗掉,最多一兩個月,慢的話三四個月;關鍵是你有沒有把人放進環境裡,用更高的標準驅動他。所以她說環境反而比經驗更重要,她更在乎的不是招到有經驗的人,而是自己有沒有造出一個讓大家更快提升、互相學習的環境。這也是她帶一群沒有大模型背景的人做 Flash 的用意:讓這群人在做事的過程中完成自身進化。
— 羅福莉原話 · 已逐字校驗
它相當於是一箇中間層 它像人和模型之間的中間 對 然後這個中間層 它可以做的非常的厚重 然後反而那個前端的UI展示 它是最薄的一層 它已經不是很關鍵
它相當於一箇中間層,夾在人和模型之間。這個中間層可以做得很厚重,反而前端 UI 展示是最薄的一層,已經不那麼關鍵。
羅福莉21:09
我覺得這也是我第一次感受到 你怎麼用一群的智慧去提升一個事情 本身
這也是我第一次感受到,你怎麼用一群人的智慧去提升一件事本身。
羅福莉30:11
為什麼它還沒有成為一個主流 大家太相信MA了 我覺得 大家太相信MA了
為什麼它還沒成為主流?大家太相信 MLA 了,我覺得,大家太相信 MLA 了。
羅福莉1:33:09
因為Idea的誕生和這個 嗯 動手 你把它代碼寫出來 太快了 然後你現在卡在什麼呢 卡在卡上
因為 Idea 的誕生和動手、把代碼寫出來太快了。那現在卡在什麼上?卡在卡上。
羅福莉1:47:07
任何層級應該一定程度上都是在規範和約束 然後規範和約束本身 我自己認為是壓制創造力的
任何層級在一定程度上都是在規範和約束,而規範和約束本身,我認為是壓制創造力的。
羅福莉2:00:15
當沒有生存的危機的時候 它反而會進化的更自由 然後 更散漫 更有創造力
當沒有生存危機的時候,它反而會進化得更自由、更散漫、更有創造力。
羅福莉2:23:29
我認為如果反應速度足夠快的話 應該只有兩三個月的代差
我認為如果反應速度足夠快的話,應該只有兩三個月的代差。
羅福莉2:28:30
我覺得最多一兩個月 慢的話三四個月 確實都可以被快速洗的 所以環境反而比今天更重要
我覺得最多一兩個月,慢的話三四個月,確實都可以被快速洗掉,所以環境反而比今天更重要。
羅福莉3:24:04
數字與實體
| 單日 Opus 4.6 API 花費 | 近 1000 美元 | 23:09 |
| 模型推理速度 | Flash 100–150 TPS,Pro 60–100 TPS | 1:30:06 |
| 全注意力層與滑動窗口層比例 | 7:1 | 1:30:06 |
| 研究 : 預訓練 : 後訓練 算力配比 | 約 3:1:1 | 1:48:09 |
| 研究卡相對訓練卡的倍數 | 3–5 倍 | 1:46:09 |
| 1T 模型訓練卡規模 | 幾千卡 | 1:45:09 |
| 團隊規模與實際投入一代模型迭代的人數 | 100 人 / 二三十到三四十人 | 1:57:14 |
| AGI 歷程進度與今年預期 | 已走 20%,今年能到六七十 | 2:26:30 |
術語
- OpenClaw開源 Agent 框架
- 羅福莉稱之為劃時代的 agent 框架,開源可改,用編排彌補模型短板
- MTP多 token 預測
- 預訓練階段加入可提升基礎能力,推理時用來填滿空閒算力、加速生成
- MLA多頭潛在注意力
- 逐字稿寫作 MA/MIA,靠壓縮 KV Cache 服務長文,被指已無優化空間
- Hybrid-Tension混合注意力結構
- 全注意力層與滑動窗口層按 7:1 配比,既省 KV Cache 又保住長文能力
- Non-Colice長上下文(逐字稿轉寫)
- 指長上下文的效率與成本,是這一代模型結構設計的核心目標
- Skills技能
- 人與 agent 共同沉澱、可被 agent 讀取的任務經驗,把隱性經驗變成可複用資產
收聽指南
AI 工程師與模型團隊負責人,以及想判斷 2026 年 Agent 競賽格局與算力投向的投資人。
2:19–2:22 關於 TTS 的細節多為產品預告,可跳。