AI最快半年跑通自进化,验证与品味是最后门槛
RSI 的拐点是模型能胜任长程任务。Apodex 首席科学家称最快半年跑通自我进化闭环,但递归漂移与模型品味仍需人类长期把关。
核心论点 · 点时间戳可跳到原声
RSI的递归因长程任务成为可能
自我进化不是新概念,两三年前已有 LM-as-optimizer 和 agent optimizer 等思路,但那时模型只能优化两三个小时,一犯小错误就自我累积、无法继续迭代。今年的区别是模型能力变强,能完成人类花 1.5 小时甚至 12 小时才能完成的长程任务,所以可以在一个任务里自我修正多遍,recursive 中的「R」才真正成立。Anthropic 八成代码由 Claude 编写,正是写代码能力让模型自己训练自己变得自然。
— 贝冰长程任务三大技术瓶颈
长程任务不只是上下文长度问题。第一,标准 attention 复杂度是二次方,百万 token 推理极耗资源,需要架构创新;第二,光有长上下文支持还不够,模型必须在非常长的数据上训练过,否则会 out-of-distribution;第三,训练和推理的 infra 也要改,包括 GPU 优化和 kernel 级代码。三个难点叠加,长程任务的难度是指数级上升。西蒙补充,即使有百万上下文,真正超长程任务仍需要 agent 架构和记忆机制来消化。
— 贝冰递归漂移是自我进化根本障碍
模型自己生成训练数据时,推理错误会在一代代迭代中累积放大,这就是递归漂移。Apodex 的对策是验证:代码和数学领域容易验证,可以用测试脚本或形式化证明,所以相对可控;但测试本身可能过宽或过窄,仍会发生细微漂移。因此 Apodex 专门训练验证能力,并在强化学习时让裁判一起学习,避免模型学会奖励黑客等不好的行为。
— 贝冰验证靠子agent互验加冗余
Apodex 名字源于希腊语「证明」。验证方法分领域:代码用单测,数学用形式化证明,但更多问题依赖人的判断。Apodex 1.0 用 agent team:先把问题分解,一个子 agent 解题,另一个子 agent 单独验证,避免上下文污染;再让多个 agent 做同一问题产生冗余,由全局 agent 判断哪个答案更准。训练时也让 agent 判断信息源可信度,比如论坛不如教材可靠。
— 西蒙三条自我进化路径护城河不同
贝冰把自我进化分为预训练、后训练、harness(脚手架)三路。在 harness 上进化成本最低,调 API 就能做,开源社区和学术界也有不少成果,护城河最浅。后训练是更核心也更难的战场:要先诊断模型缺陷、造针对性题目、验证训练效果,需要大量资源。预训练目前多是玩具级任务,尚未真正 scaling 到产品级。Apodex 三路都做,后训练与脚手架像左脚踩右脚,交替迭代。判断公司能力,要先问它在哪一层进化。
— 贝冰agent团队为何胜过单个聪明AI
西蒙明确表示:一个聪明的 AI 干不过会互相 check 的团队。理由是 self-attention 的本质——上下文越长注意力效果越差,线性 attention 也解决不了超长上下文,单个模型在现有技术下有上限,就像人的工作记忆有限需要笔记。所以要多个 agent 分工,配合记忆机制分享信息,才能处理超长程问题。模型能力与 agent 工程是一加一大于二,垂直领域的 agent 团队仍有护城河,只是要随模型每月迭代微调脚手架。
— 西蒙发现模型难在验证而非生成
生成模型已有成熟训练配方,但 discovery model 的目标不是生成答案,而是提出 out-of-distribution 的假设并验证。第一步要有创造性的假设,难在它远离预训练数据;第二步判断假设是否成立,又回到验证问题。可以通过 deep research 收集已有信息辅助假设,也可以写代码跑模拟增强信心。但未知领域往往没有标准答案,也没有可信的模拟环境,所以 self-evolution 是 Apodex 通往 Heavy Duty Solver 的主要方法。
— 贝冰半年闭环,漂移还需数年
贝冰预计最快半年到一年能跑通自我进化的第一个闭环:在某领域(如 coding)发现自己的问题、自造训练数据、自我验证、迭代一轮。但 RSI 的 recursive 要跑很多轮,递归漂移仍未解决,他有信心几年内完全解决。最让他睡不着的是不知道模型在自我进化时有没有跑偏——安全目标和性能目标都可能偏。目前只能每天人工读模型输出、干预 agent 行为;未来「蒸馏自己」可以把这种监控能力注入模型,加速流程。
— 贝冰原话 · 已逐字校验
一个喜欢拍马屁的模型,其实很难提出一个大胆的假设。
一个喜欢拍马屁的模型,其实很难提出大胆的假设。
贝冰42:58
让我睡不着觉的一个问题,就是我们怎么知道这个模型在自我进化的时候,它是满足人类的需求,它没有跑偏。
让我睡不着觉的一个问题:我们怎么知道模型在自我进化时,它在满足人类需求,没有跑偏。
贝冰58:33
我不在一个function一个function的写代码,而是我会在更高的一个维度,更高的一个层面监控不同的智能体携代码。
我不再一个 function 一个 function 地写代码,而是在更高的维度、更高的层面监控不同的智能体写代码。
贝冰1:02:53
品味没有对或者是错的区别,也没有好或者坏的区别,就只有适合和不适合的区别。
品味没有对错之分,也没有好坏之分,只有适合与不适合之分。
贝冰1:05:00
我觉得我们的品位只是一个我们如果放在训练这个语言里面叫做war start,就只是给他热启动了一下。
我觉得我们的品位只是 warm start(热启动)——只是给他热启动了一下。
贝冰1:06:02
数字与实体
| Anthropic 代码由 Claude 生成的比例 | 80% | 0:00 |
| Claude 3 Ops 可处理的人类任务时长 | 约 4 分钟 | 8:25 |
| Claude 3.7 Sonnet 可处理的人类任务时长 | 约 1.5 小时 | 8:25 |
| Claude 4.6 Ops 可处理的人类任务时长 | 约 12 小时 | 8:25 |
| 业界公认模型可处理任务时长的翻倍周期 | 每 7 个月翻一倍 | 9:27 |
| Apodex 对跑通自进化闭环的时间预期 | 半年到一年 | 57:29 |
| 递归漂移率降幅目标 | 从每次漂移 10% 降到 1%,最终到 0.01% | 1:03:58 |
术语
- RSI递归自我提升
- Recursive Self-Improvement,模型自己训练自己、循环提升的能力。
- Recursive Drift递归漂移
- 模型在自我生成训练数据时错误代代累积、逐渐偏离目标。
- Heavy Duty Solver重担求解器
- Apodex 的目标——解决人类没有标准答案的难题的通用模型。
- Discovery Model发现模型
- 不依赖已知答案,而是提出并验证新假设的模型。
- Agent Team智能体团队
- 多个子智能体分工、互相验证的协作系统,用于超长任务与验证。
收听指南
AI 创业者、大模型研究员、投资人和关注 agent 架构的工程师。
末尾约 5 分钟的两位创始人风格对比可跳过,与主线关系不大。