世界太吵,來原聲聽播客

硅谷101

AI自我進化最快半年跑通,但模型會悄悄跑偏

RSI 的拐點是模型能勝任長程任務。Apodex 首席科學家稱最快半年跑通自我進化閉環,但遞歸漂移與模型品味仍需人類長期把關。

AI自進化RSI長程任務agent團隊模型品味科研自動化
一線研究員拆解 RSI 技術路徑、驗證方法與時間表,信息密度高,是理解模型自我進化真實進展的直接材料。

核心論點 · 點時間戳可跳到原聲

7:21

RSI的遞歸因長程任務成為可能

自我進化不是新概念,兩三年前已有 LM-as-optimizer 和 agent optimizer 等思路,但那時模型只能優化兩三個小時,一犯小錯誤就自我累積、無法繼續迭代。今年的區別是模型能力變強,能完成人類花 1.5 小時甚至 12 小時才能完成的長程任務,所以可以在一個任務裡自我修正多遍,recursive 中的「R」才真正成立。Anthropic 八成代碼由 Claude 編寫,正是寫代碼能力讓模型自己訓練自己變得自然。

— 貝冰
10:30

長程任務三大技術瓶頸

長程任務不只是上下文長度問題。第一,標準 attention 複雜度是二次方,百萬 token 推理極耗資源,需要架構創新;第二,光有長上下文支持還不夠,模型必須在非常長的數據上訓練過,否則會 out-of-distribution;第三,訓練和推理的 infra 也要改,包括 GPU 優化和 kernel 級代碼。三個難點疊加,長程任務的難度是指數級上升。西蒙補充,即使有百萬上下文,真正超長程任務仍需要 agent 架構和記憶機制來消化。

— 貝冰
14:37

遞歸漂移是自我進化根本障礙

模型自己生成訓練數據時,推理錯誤會在一代代迭代中累積放大,這就是遞歸漂移。Apodex 的對策是驗證:代碼和數學領域容易驗證,可以用測試腳本或形式化證明,所以相對可控;但測試本身可能過寬或過窄,仍會發生細微漂移。因此 Apodex 專門訓練驗證能力,並在強化學習時讓裁判一起學習,避免模型學會獎勵黑客等不好的行為。

— 貝冰
16:58

驗證靠子agent互驗加冗餘

Apodex 名字源於希臘語「證明」。驗證方法分領域:代碼用單測,數學用形式化證明,但更多問題依賴人的判斷。Apodex 1.0 用 agent team:先把問題分解,一個子 agent 解題,另一個子 agent 單獨驗證,避免上下文汙染;再讓多個 agent 做同一問題產生冗餘,由全局 agent 判斷哪個答案更準。訓練時也讓 agent 判斷信息源可信度,比如論壇不如教材可靠。

— 西蒙
21:06

三條自我進化路徑護城河不同

貝冰把自我進化分為預訓練、後訓練、harness(腳手架)三路。在 harness 上進化成本最低,調 API 就能做,開源社區和學術界也有不少成果,護城河最淺。後訓練是更核心也更難的戰場:要先診斷模型缺陷、造針對性題目、驗證訓練效果,需要大量資源。預訓練目前多是玩具級任務,尚未真正 scaling 到產品級。Apodex 三路都做,後訓練與腳手架像左腳踩右腳,交替迭代。判斷公司能力,要先問它在哪一層進化。

— 貝冰
29:29

agent團隊為何勝過單個聰明AI

西蒙明確表示:一個聰明的 AI 幹不過會互相 check 的團隊。理由是 self-attention 的本質——上下文越長注意力效果越差,線性 attention 也解決不了超長上下文,單個模型在現有技術下有上限,就像人的工作記憶有限需要筆記。所以要多個 agent 分工,配合記憶機制分享信息,才能處理超長程問題。模型能力與 agent 工程是一加一大於二,垂直領域的 agent 團隊仍有護城河,只是要隨模型每月迭代微調腳手架。

— 西蒙
36:34

發現模型難在驗證而非生成

生成模型已有成熟訓練配方,但 discovery model 的目標不是生成答案,而是提出 out-of-distribution 的假設並驗證。第一步要有創造性的假設,難在它遠離預訓練數據;第二步判斷假設是否成立,又回到驗證問題。可以通過 deep research 收集已有信息輔助假設,也可以寫代碼跑模擬增強信心。但未知領域往往沒有標準答案,也沒有可信的模擬環境,所以 self-evolution 是 Apodex 通往 Heavy Duty Solver 的主要方法。

— 貝冰
57:29

半年閉環,漂移還需數年

貝冰預計最快半年到一年能跑通自我進化的第一個閉環:在某領域(如 coding)發現自己的問題、自造訓練數據、自我驗證、迭代一輪。但 RSI 的 recursive 要跑很多輪,遞歸漂移仍未解決,他有信心幾年內完全解決。最讓他睡不著的是不知道模型在自我進化時有沒有跑偏——安全目標和性能目標都可能偏。目前只能每天人工讀模型輸出、干預 agent 行為;未來「蒸餾自己」可以把這種監控能力注入模型,加速流程。

— 貝冰

原話 · 已逐字校驗

一個喜歡拍馬屁的模型,其實很難提出一個大膽的假設。

一個喜歡拍馬屁的模型,其實很難提出大膽的假設。

貝冰42:58

讓我睡不著覺的一個問題,就是我們怎麼知道這個模型在自我進化的時候,它是滿足人類的需求,它沒有跑偏。

讓我睡不著覺的一個問題:我們怎麼知道模型在自我進化時,它在滿足人類需求,沒有跑偏。

貝冰58:33

我不在一個function一個function的寫代碼,而是我會在更高的一個維度,更高的一個層面監控不同的智能體攜代碼。

我不再一個 function 一個 function 地寫代碼,而是在更高的維度、更高的層面監控不同的智能體寫代碼。

貝冰1:02:53

品味沒有對或者是錯的區別,也沒有好或者壞的區別,就只有適合和不適合的區別。

品味沒有對錯之分,也沒有好壞之分,只有適合與不適合之分。

貝冰1:05:00

我覺得我們的品位只是一個我們如果放在訓練這個語言裡面叫做war start,就只是給他熱啟動了一下。

我覺得我們的品位只是 warm start(熱啟動)——只是給他熱啟動了一下。

貝冰1:06:02

數字與實體

Anthropic 代碼由 Claude 生成的比例80%0:00
Claude 3 Ops 可處理的人類任務時長約 4 分鐘8:25
Claude 3.7 Sonnet 可處理的人類任務時長約 1.5 小時8:25
Claude 4.6 Ops 可處理的人類任務時長約 12 小時8:25
業界公認模型可處理任務時長的翻倍週期每 7 個月翻一倍9:27
Apodex 對跑通自進化閉環的時間預期半年到一年57:29
遞歸漂移率降幅目標從每次漂移 10% 降到 1%,最終到 0.01%1:03:58

術語

RSI遞歸自我提升
Recursive Self-Improvement,模型自己訓練自己、循環提升的能力。
Recursive Drift遞歸漂移
模型在自我生成訓練數據時錯誤代代累積、逐漸偏離目標。
Heavy Duty Solver重擔求解器
Apodex 的目標——解決人類沒有標準答案的難題的通用模型。
Discovery Model發現模型
不依賴已知答案,而是提出並驗證新假設的模型。
Agent Team智能體團隊
多個子智能體分工、互相驗證的協作系統,用於超長任務與驗證。

收聽指南

誰該聽

AI 創業者、大模型研究員、投資人和關注 agent 架構的工程師。

可跳過

末尾約 5 分鐘的兩位創始人風格對比可跳過,與主線關係不大。