Claude Code 和 Codex 本质是同一套骨架:下一步红利在换掉它
作者论证 Claude Code、Codex、Pi 这些主流编程 agent 拆开看设计选择几乎一致;真正带来数量级提升的,是像 RLM 这样把上下文卸载到磁盘、让子智能体可组合的全新 harness 设计。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
AI 写的 GPU 内核多数经不起上线
AI 已经能写出能跑的 GPU 内核,GPU Mode 排行榜上大多数新解法都是 AI 生成的。但团队发现一个反例:社区公认最强的人类内核工程师 Gauners,虽然也借助 AI 写代码,但他的解法是排行榜前十名里唯一一个在真实端到端系统中保持稳定的。其余纯 AI 生成的解法代码行数更短、分数更高,却存在严重的「奖励黑客」问题——能骗过单测,却经不起真实系统的联调。这说明内核优化领域的验证手段本身是短板,人类专家的价值正从「写代码」转移到「知道怎么验证、怎么把模型引导到对的方向」。
— Alex ZhangPhD 的优势是敢押没人信的注
作者认为 PhD 相对工业界实验室唯一真实的优势,就是可以不计后果地押注没人认可的想法。他举了几个先例:SWE-bench 刚发布时没人在意,直到 Devin 出现后大家才突然想去刷榜;Eric 的 STaR/Quiet-STaR、ReAct 刚读到时都显得「简单到像废话」;RLM 自己发布时也被喷「这不就是子智能体吗」。他的结论是,一个点子发布时若被嘲笑太简单、太显然,反而常常是信号——说明大多数人根本没想清楚它的价值所在。学术界的问题是太多学生选题是为了讨好工业界评审,而不是押注冷门但有故事的问题。
— Alex Zhang语言模型不必是自回归解码器
作者用有争议的新模型 GEV 重新定义「语言模型」的边界。批评者说它「根本不是语言模型」,因为它改变了输出空间,用极快的推理换取一个二元/校准式的分类结果,而不是逐 token 解码文本。他反驳说语言模型的本质只是「对语言建模」,不必等于自回归解码器——就像循环(loop)transformer 一样,只要能在输出空间和推理延迟之间做新的权衡,就打开了一整类此前被「我们已经接受的默认架构」挡住的问题:要不要只循环模型的一部分?能不能把 harness 里的调度逻辑搬进模型内部?这些才是 GEV 真正值得讨论的地方。
— Alex Zhang练短任务却能自动推广到长任务
这是全篇最硬核的机制性发现:把 RLM(只用代码作为工具、上下文全部卸载到硬盘的 harness)训练在「短任务」上,它会自动推广到长度是训练任务 8 到 30 倍的新任务上——因为模型学到的不是某个具体任务的答案,而是「怎么拆解、怎么调用子智能体」这套策略本身,这套策略在长、短任务之间几乎是同一段程序,只是改了一个长度变量。更关键的是,这个论证可以递归套用:竞赛编程和 GPU 内核优化这两个表面毫不相干的领域,作者认为模型也能学到同一套「列候选解、起子智能体筛选、验证、迭代」的元策略。Harness 设计本身决定了模型能从同一份数据里榨出多少泛化能力,而不是单纯堆数据。
— Alex Zhang把上下文扔进硬盘是最大诀窍
Prime Agent 是作者和 Prime Intellect 合作做的 RLM harness,核心改动是把标准 agent loop 里「子智能体用完即焚」的设定去掉。Swyx 直言这是他用 Codex 最大的痛点——子智能体是一次性的,官方还明确不鼓励把它用在长任务上。Prime Agent 的做法是把全部轨迹和上下文持久化存在磁盘上,子智能体可以在原始运行结束后被重新唤起、继续对话,还设计了一套让子智能体之间互相通信、全部用代码来表达调用关系的协议。这个「外部化到文件系统+一切经由代码」的组合,被双方称为整个 RLM 系列想法里最大的一条技巧。
— Alex Zhang烧钱买的是收敛,不是设计
OpenAI 号称「直接扔一个模型就解出了 Navier–Stokes 的某个难题」,公开的规模是一万个 agent、跑了 88 小时、产出 1300 亿 output token,按公开定价估算约 4000 万美元,而算上 agent 之间互相传递的全部上下文,实际消耗的 token 数是这个数字的两倍多。作者的判断是,这件事里 harness 本身的具体设计其实没那么重要——真正难的、几乎不能想当然会自动发生的,是怎么让一大群 agent 共享上下文、最终真的收敛到一个答案,而不是像绝大部分 swarm 探索那样纯粹烧 token。
— Alex ZhangKimi 的群体智能还没学会收敛
对比 Kimi 发布的 agent swarm(作者评价是「能做表格,挺有意思,但看不出能解决任何真正新的问题」)和 OpenAI 的数学证明 swarm,作者强调关键差距不在于「有没有 swarm 这个形态」,而在于能不能让一堆 agent 真正协同收敛。他同样评价 OpenAI 此前发布的「动态工作流」是一次失败的尝试——太贵,实际使用也不像预期那样聪明。真正让他认可 OpenAI 这次工作的,是对方显然专门训练过模型去做这种 swarm 协同,这种「让群体收敛到答案」的能力不是随便搭个架子就能白嫖到的。
— Alex Zhang模型早够格干一个月的简单活
作者提出一个大胆判断:现在的前沿模型,如果换成一个聪明的 18 岁高中生,完全可以胜任某项简单但需要「连续一个月稳定靠谱」执行的工作,但现在没有一个模型能在 harness 里稳定做到这一点——而这不是模型智能不够,是个「技能问题」(skill issue),是 harness 设计没跟上。他把这归类为「锯齿形智能」(jagged intelligence)的一个具体推论:既然模型在编程、数学上已经不成比例地强,理论上应该能把这种强项迁移到更多领域的「简单但长期」任务上,问题只是现在没人专门设计出能做到这件事的 harness。
— Alex Zhang原话 · 已逐字校验
we found that, like, his kernel was, like, basically the only one in, like, the top 10 that was actually stable in, like, actual, like. end-to-end systems.
我们发现,他的内核基本上是前十名里唯一一个在真实的端到端系统中保持稳定的。
Alex Zhang6:33
like, you just have to take big bets, and, like, a lot of them will fail? Like, that’s just. it’s, it’s natural.
你就是得去押大注,而且其中很多会失败——这很正常。
Alex Zhang18:55
It’s why is it not just some stupid NLP classifier that, like, we’ve, we’ve been doing, back in our intro ML classes or something? I think what’s really interesting about Jev is that it kind of opens up this question of, are language models correct? Like, in the form that they’re in, can we consider a different design space other than text-to-text?
为什么它不只是我们入门机器学习课上就做过的那种蠢 NLP 分类器?我觉得 Jev 真正有趣的地方在于,它打开了一个问题:语言模型现在的形式是对的吗?我们能不能考虑文本到文本之外的另一种设计空间?
Alex Zhang18:55
one thing you’ll kind of observe is that the. as you just naively train your RLM on these tasks, they naturally learn to generalize, for example, to longer tasks, because the strategy is basically the same. You’re just modifying, like, a length variable.
你会观察到的一件事是,哪怕你只是朴素地在这些任务上训练 RLM,它也会自然学会泛化到更长的任务上,因为策略基本是一样的,你只是改了一个长度变量而已。
Alex Zhang36:38
This is my number one pain with Codex right now. They, their subagents are just very ephemeral And they actively discourage you from using it for long-running things.
这是我现在用 Codex 最大的痛点。它们的子智能体非常短命,而且官方还明确不鼓励你把它用在长期运行的任务上。
Swyx56:10
While there’s a lot in there, I do wanna say, the amount that OpenAI spent is semi-public. It’s, 10,000 agents in 88 hours.
这里面信息很多,但我想说,OpenAI 花了多少钱是半公开的:一万个 agent,跑了 88 小时。
Swyx1:04:20
Nothing comes so easily for free. For example, like, the agent swarm design is not something you can just take for granted.
没有什么东西是白来的。比如说,agent swarm 的设计根本不是你能想当然的事。
Alex Zhang1:16:59
I think that it genuinely is a skill issue of you can get a model to be as good as, let’s say, like, just some 18-year-old high school kid
我真的认为这就是个技能问题——你完全可以让一个模型做到和一个 18 岁高中生一样好。
Alex Zhang1:20:52
数字与实体
| OpenAI 数学证明 swarm 规模 | 10,000 个 agent,运行 88 小时 | 1:04:20 |
| OpenAI swarm 输出 token 与成本 | 1300 亿 output token,按公开定价估算约 4000 万美元 | 1:04:20 |
| RLM 任务长度泛化倍数 | 训练于短任务,泛化到长度为训练任务 8–30 倍的任务 | 36:38 |
术语
- RLM (Recursive Language Model)递归语言模型
- 唯一工具是代码、可递归调用自身为子智能体、上下文卸载到磁盘等外部存储的 harness 设计。
- GEVGEV(逐字稿读作 Jev)
- 一种改变输出空间、用快速校准分类换取低延迟的新模型,引发「语言模型是否必须是解码器」的讨论。
- harness taxharness 税(论文)
- 一篇论文的核心论点:市面上大多数 agent harness 设计选择其实并不影响最终效果。
- locally in-distribution局部同分布
- RLM 让每一次子智能体调用都落在模型见过的分布内,即使整体任务本身是全新的组合。
- continual harness持续性 harness
- 允许 agent 在运行过程中自行修改自己的技能、子智能体和系统提示的框架设计。
收听指南
做 agent / harness 架构设计的工程师,以及关注 RLM、agent swarm 经济性和研究打法的创业者投资人。
开放性研究(open-endedness)和 Sakana 日本市场那段偏闲聊,可跳过。