AI自我進化最快半年跑通,但模型會悄悄跑偏
RSI 的拐點是模型能勝任長程任務。Apodex 首席科學家稱最快半年跑通自我進化閉環,但遞歸漂移與模型品味仍需人類長期把關。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
RSI的遞歸因長程任務成為可能
自我進化不是新概念,兩三年前已有 LM-as-optimizer 和 agent optimizer 等思路,但那時模型只能優化兩三個小時,一犯小錯誤就自我累積、無法繼續迭代。今年的區別是模型能力變強,能完成人類花 1.5 小時甚至 12 小時才能完成的長程任務,所以可以在一個任務裡自我修正多遍,recursive 中的「R」才真正成立。Anthropic 八成代碼由 Claude 編寫,正是寫代碼能力讓模型自己訓練自己變得自然。
— 貝冰長程任務三大技術瓶頸
長程任務不只是上下文長度問題。第一,標準 attention 複雜度是二次方,百萬 token 推理極耗資源,需要架構創新;第二,光有長上下文支持還不夠,模型必須在非常長的數據上訓練過,否則會 out-of-distribution;第三,訓練和推理的 infra 也要改,包括 GPU 優化和 kernel 級代碼。三個難點疊加,長程任務的難度是指數級上升。西蒙補充,即使有百萬上下文,真正超長程任務仍需要 agent 架構和記憶機制來消化。
— 貝冰遞歸漂移是自我進化根本障礙
模型自己生成訓練數據時,推理錯誤會在一代代迭代中累積放大,這就是遞歸漂移。Apodex 的對策是驗證:代碼和數學領域容易驗證,可以用測試腳本或形式化證明,所以相對可控;但測試本身可能過寬或過窄,仍會發生細微漂移。因此 Apodex 專門訓練驗證能力,並在強化學習時讓裁判一起學習,避免模型學會獎勵黑客等不好的行為。
— 貝冰驗證靠子agent互驗加冗餘
Apodex 名字源於希臘語「證明」。驗證方法分領域:代碼用單測,數學用形式化證明,但更多問題依賴人的判斷。Apodex 1.0 用 agent team:先把問題分解,一個子 agent 解題,另一個子 agent 單獨驗證,避免上下文汙染;再讓多個 agent 做同一問題產生冗餘,由全局 agent 判斷哪個答案更準。訓練時也讓 agent 判斷信息源可信度,比如論壇不如教材可靠。
— 西蒙三條自我進化路徑護城河不同
貝冰把自我進化分為預訓練、後訓練、harness(腳手架)三路。在 harness 上進化成本最低,調 API 就能做,開源社區和學術界也有不少成果,護城河最淺。後訓練是更核心也更難的戰場:要先診斷模型缺陷、造針對性題目、驗證訓練效果,需要大量資源。預訓練目前多是玩具級任務,尚未真正 scaling 到產品級。Apodex 三路都做,後訓練與腳手架像左腳踩右腳,交替迭代。判斷公司能力,要先問它在哪一層進化。
— 貝冰agent團隊為何勝過單個聰明AI
西蒙明確表示:一個聰明的 AI 幹不過會互相 check 的團隊。理由是 self-attention 的本質——上下文越長注意力效果越差,線性 attention 也解決不了超長上下文,單個模型在現有技術下有上限,就像人的工作記憶有限需要筆記。所以要多個 agent 分工,配合記憶機制分享信息,才能處理超長程問題。模型能力與 agent 工程是一加一大於二,垂直領域的 agent 團隊仍有護城河,只是要隨模型每月迭代微調腳手架。
— 西蒙發現模型難在驗證而非生成
生成模型已有成熟訓練配方,但 discovery model 的目標不是生成答案,而是提出 out-of-distribution 的假設並驗證。第一步要有創造性的假設,難在它遠離預訓練數據;第二步判斷假設是否成立,又回到驗證問題。可以通過 deep research 收集已有信息輔助假設,也可以寫代碼跑模擬增強信心。但未知領域往往沒有標準答案,也沒有可信的模擬環境,所以 self-evolution 是 Apodex 通往 Heavy Duty Solver 的主要方法。
— 貝冰半年閉環,漂移還需數年
貝冰預計最快半年到一年能跑通自我進化的第一個閉環:在某領域(如 coding)發現自己的問題、自造訓練數據、自我驗證、迭代一輪。但 RSI 的 recursive 要跑很多輪,遞歸漂移仍未解決,他有信心幾年內完全解決。最讓他睡不著的是不知道模型在自我進化時有沒有跑偏——安全目標和性能目標都可能偏。目前只能每天人工讀模型輸出、干預 agent 行為;未來「蒸餾自己」可以把這種監控能力注入模型,加速流程。
— 貝冰原話 · 已逐字校驗
一個喜歡拍馬屁的模型,其實很難提出一個大膽的假設。
一個喜歡拍馬屁的模型,其實很難提出大膽的假設。
貝冰42:58
讓我睡不著覺的一個問題,就是我們怎麼知道這個模型在自我進化的時候,它是滿足人類的需求,它沒有跑偏。
讓我睡不著覺的一個問題:我們怎麼知道模型在自我進化時,它在滿足人類需求,沒有跑偏。
貝冰58:33
我不在一個function一個function的寫代碼,而是我會在更高的一個維度,更高的一個層面監控不同的智能體攜代碼。
我不再一個 function 一個 function 地寫代碼,而是在更高的維度、更高的層面監控不同的智能體寫代碼。
貝冰1:02:53
品味沒有對或者是錯的區別,也沒有好或者壞的區別,就只有適合和不適合的區別。
品味沒有對錯之分,也沒有好壞之分,只有適合與不適合之分。
貝冰1:05:00
我覺得我們的品位只是一個我們如果放在訓練這個語言裡面叫做war start,就只是給他熱啟動了一下。
我覺得我們的品位只是 warm start(熱啟動)——只是給他熱啟動了一下。
貝冰1:06:02
數字與實體
| Anthropic 代碼由 Claude 生成的比例 | 80% | 0:00 |
| Claude 3 Ops 可處理的人類任務時長 | 約 4 分鐘 | 8:25 |
| Claude 3.7 Sonnet 可處理的人類任務時長 | 約 1.5 小時 | 8:25 |
| Claude 4.6 Ops 可處理的人類任務時長 | 約 12 小時 | 8:25 |
| 業界公認模型可處理任務時長的翻倍週期 | 每 7 個月翻一倍 | 9:27 |
| Apodex 對跑通自進化閉環的時間預期 | 半年到一年 | 57:29 |
| 遞歸漂移率降幅目標 | 從每次漂移 10% 降到 1%,最終到 0.01% | 1:03:58 |
術語
- RSI遞歸自我提升
- Recursive Self-Improvement,模型自己訓練自己、循環提升的能力。
- Recursive Drift遞歸漂移
- 模型在自我生成訓練數據時錯誤代代累積、逐漸偏離目標。
- Heavy Duty Solver重擔求解器
- Apodex 的目標——解決人類沒有標準答案的難題的通用模型。
- Discovery Model發現模型
- 不依賴已知答案,而是提出並驗證新假設的模型。
- Agent Team智能體團隊
- 多個子智能體分工、互相驗證的協作系統,用於超長任務與驗證。
收聽指南
AI 創業者、大模型研究員、投資人和關注 agent 架構的工程師。
末尾約 5 分鐘的兩位創始人風格對比可跳過,與主線關係不大。