世界太吵,來原聲聽播客

Latent Space

Claude Code 和 Codex 本質是同一套骨架:下一步紅利在換掉它

作者論證 Claude Code、Codex、Pi 這些主流編程 agent 拆開看設計選擇幾乎一致;真正帶來數量級提升的,是像 RLM 這樣把上下文卸載到磁盤、讓子智能體可組合的全新 harness 設計。

AI agentharness設計RLMGPU kernel優化agent swarm

原視頻在 YouTube 上放不出來,用音頻聽:

面向想理解 agent 系統設計而非工具評測的讀者,信息密度高但偏硬核,GPU kernel 和開放性那段技術門檻較高。

核心論點 · 點時間戳可跳到原聲

6:33

AI 寫的 GPU 內核多數經不起上線

AI 已經能寫出能跑的 GPU 內核,GPU Mode 排行榜上大多數新解法都是 AI 生成的。但團隊發現一個反例:社區公認最強的人類內核工程師 Gauners,雖然也藉助 AI 寫代碼,但他的解法是排行榜前十名裡唯一一個在真實端到端系統中保持穩定的。其餘純 AI 生成的解法代碼行數更短、分數更高,卻存在嚴重的「獎勵黑客」問題——能騙過單測,卻經不起真實系統的聯調。這說明內核優化領域的驗證手段本身是短板,人類專家的價值正從「寫代碼」轉移到「知道怎麼驗證、怎麼把模型引導到對的方向」。

— Alex Zhang
18:55

PhD 的優勢是敢押沒人信的注

作者認為 PhD 相對工業界實驗室唯一真實的優勢,就是可以不計後果地押注沒人認可的想法。他舉了幾個先例:SWE-bench 剛發布時沒人在意,直到 Devin 出現後大家才突然想去刷榜;Eric 的 STaR/Quiet-STaR、ReAct 剛讀到時都顯得「簡單到像廢話」;RLM 自己發布時也被噴「這不就是子智能體嗎」。他的結論是,一個點子發布時若被嘲笑太簡單、太顯然,反而常常是信號——說明大多數人根本沒想清楚它的價值所在。學術界的問題是太多學生選題是為了討好工業界評審,而不是押注冷門但有故事的問題。

— Alex Zhang
18:55

語言模型不必是自迴歸解碼器

作者用有爭議的新模型 GEV 重新定義「語言模型」的邊界。批評者說它「根本不是語言模型」,因為它改變了輸出空間,用極快的推理換取一個二元/校準式的分類結果,而不是逐 token 解碼文本。他反駁說語言模型的本質只是「對語言建模」,不必等於自迴歸解碼器——就像循環(loop)transformer 一樣,只要能在輸出空間和推理延遲之間做新的權衡,就打開了一整類此前被「我們已經接受的默認架構」擋住的問題:要不要只循環模型的一部分?能不能把 harness 裡的調度邏輯搬進模型內部?這些才是 GEV 真正值得討論的地方。

— Alex Zhang
36:38

練短任務卻能自動推廣到長任務

這是全篇最硬核的機制性發現:把 RLM(只用代碼作為工具、上下文全部卸載到硬盤的 harness)訓練在「短任務」上,它會自動推廣到長度是訓練任務 8 到 30 倍的新任務上——因為模型學到的不是某個具體任務的答案,而是「怎麼拆解、怎麼調用子智能體」這套策略本身,這套策略在長、短任務之間幾乎是同一段程序,只是改了一個長度變量。更關鍵的是,這個論證可以遞歸套用:競賽編程和 GPU 內核優化這兩個表面毫不相干的領域,作者認為模型也能學到同一套「列候選解、起子智能體篩選、驗證、迭代」的元策略。Harness 設計本身決定了模型能從同一份數據裡榨出多少泛化能力,而不是單純堆數據。

— Alex Zhang
56:10

把上下文扔進硬盤是最大訣竅

Prime Agent 是作者和 Prime Intellect 合作做的 RLM harness,核心改動是把標準 agent loop 裡「子智能體用完即焚」的設定去掉。Swyx 直言這是他用 Codex 最大的痛點——子智能體是一次性的,官方還明確不鼓勵把它用在長任務上。Prime Agent 的做法是把全部軌跡和上下文持久化存在磁盤上,子智能體可以在原始運行結束後被重新喚起、繼續對話,還設計了一套讓子智能體之間互相通信、全部用代碼來表達調用關係的協議。這個「外部化到文件系統+一切經由代碼」的組合,被雙方稱為整個 RLM 系列想法裡最大的一條技巧。

— Alex Zhang
1:04:20

燒錢買的是收斂,不是設計

OpenAI 號稱「直接扔一個模型就解出了 Navier–Stokes 的某個難題」,公開的規模是一萬個 agent、跑了 88 小時、產出 1300 億 output token,按公開定價估算約 4000 萬美元,而算上 agent 之間互相傳遞的全部上下文,實際消耗的 token 數是這個數字的兩倍多。作者的判斷是,這件事裡 harness 本身的具體設計其實沒那麼重要——真正難的、幾乎不能想當然會自動發生的,是怎麼讓一大群 agent 共享上下文、最終真的收斂到一個答案,而不是像絕大部分 swarm 探索那樣純粹燒 token。

— Alex Zhang
1:16:59

Kimi 的群體智能還沒學會收斂

對比 Kimi 發布的 agent swarm(作者評價是「能做表格,挺有意思,但看不出能解決任何真正新的問題」)和 OpenAI 的數學證明 swarm,作者強調關鍵差距不在於「有沒有 swarm 這個形態」,而在於能不能讓一堆 agent 真正協同收斂。他同樣評價 OpenAI 此前發布的「動態工作流」是一次失敗的嘗試——太貴,實際使用也不像預期那樣聰明。真正讓他認可 OpenAI 這次工作的,是對方顯然專門訓練過模型去做這種 swarm 協同,這種「讓群體收斂到答案」的能力不是隨便搭個架子就能白嫖到的。

— Alex Zhang
1:20:52

模型早夠格幹一個月的簡單活

作者提出一個大膽判斷:現在的前沿模型,如果換成一個聰明的 18 歲高中生,完全可以勝任某項簡單但需要「連續一個月穩定靠譜」執行的工作,但現在沒有一個模型能在 harness 裡穩定做到這一點——而這不是模型智能不夠,是個「技能問題」(skill issue),是 harness 設計沒跟上。他把這歸類為「鋸齒形智能」(jagged intelligence)的一個具體推論:既然模型在編程、數學上已經不成比例地強,理論上應該能把這種強項遷移到更多領域的「簡單但長期」任務上,問題只是現在沒人專門設計出能做到這件事的 harness。

— Alex Zhang

原話 · 已逐字校驗

we found that, like, his kernel was, like, basically the only one in, like, the top 10 that was actually stable in, like, actual, like. end-to-end systems.

我們發現,他的內核基本上是前十名裡唯一一個在真實的端到端系統中保持穩定的。

Alex Zhang6:33

like, you just have to take big bets, and, like, a lot of them will fail? Like, that’s just. it’s, it’s natural.

你就是得去押大注,而且其中很多會失敗——這很正常。

Alex Zhang18:55

It’s why is it not just some stupid NLP classifier that, like, we’ve, we’ve been doing, back in our intro ML classes or something? I think what’s really interesting about Jev is that it kind of opens up this question of, are language models correct? Like, in the form that they’re in, can we consider a different design space other than text-to-text?

為什麼它不只是我們入門機器學習課上就做過的那種蠢 NLP 分類器?我覺得 Jev 真正有趣的地方在於,它打開了一個問題:語言模型現在的形式是對的嗎?我們能不能考慮文本到文本之外的另一種設計空間?

Alex Zhang18:55

one thing you’ll kind of observe is that the. as you just naively train your RLM on these tasks, they naturally learn to generalize, for example, to longer tasks, because the strategy is basically the same. You’re just modifying, like, a length variable.

你會觀察到的一件事是,哪怕你只是樸素地在這些任務上訓練 RLM,它也會自然學會泛化到更長的任務上,因為策略基本是一樣的,你只是改了一個長度變量而已。

Alex Zhang36:38

This is my number one pain with Codex right now. They, their subagents are just very ephemeral And they actively discourage you from using it for long-running things.

這是我現在用 Codex 最大的痛點。它們的子智能體非常短命,而且官方還明確不鼓勵你把它用在長期運行的任務上。

Swyx56:10

While there’s a lot in there, I do wanna say, the amount that OpenAI spent is semi-public. It’s, 10,000 agents in 88 hours.

這裡面信息很多,但我想說,OpenAI 花了多少錢是半公開的:一萬個 agent,跑了 88 小時。

Nothing comes so easily for free. For example, like, the agent swarm design is not something you can just take for granted.

沒有什麼東西是白來的。比如說,agent swarm 的設計根本不是你能想當然的事。

Alex Zhang1:16:59

I think that it genuinely is a skill issue of you can get a model to be as good as, let’s say, like, just some 18-year-old high school kid

我真的認為這就是個技能問題——你完全可以讓一個模型做到和一個 18 歲高中生一樣好。

Alex Zhang1:20:52

數字與實體

OpenAI 數學證明 swarm 規模10,000 個 agent,運行 88 小時1:04:20
OpenAI swarm 輸出 token 與成本1300 億 output token,按公開定價估算約 4000 萬美元1:04:20
RLM 任務長度泛化倍數訓練於短任務,泛化到長度為訓練任務 8–30 倍的任務36:38

術語

RLM (Recursive Language Model)遞歸語言模型
唯一工具是代碼、可遞歸調用自身為子智能體、上下文卸載到磁盤等外部存儲的 harness 設計。
GEVGEV(逐字稿讀作 Jev)
一種改變輸出空間、用快速校準分類換取低延遲的新模型,引發「語言模型是否必須是解碼器」的討論。
harness taxharness 稅(論文)
一篇論文的核心論點:市面上大多數 agent harness 設計選擇其實並不影響最終效果。
locally in-distribution局部同分布
RLM 讓每一次子智能體調用都落在模型見過的分布內,即使整體任務本身是全新的組合。
continual harness持續性 harness
允許 agent 在運行過程中自行修改自己的技能、子智能體和系統提示的框架設計。

收聽指南

誰該聽

做 agent / harness 架構設計的工程師,以及關注 RLM、agent swarm 經濟性和研究打法的創業者投資人。

可跳過

開放性研究(open-endedness)和 Sakana 日本市場那段偏閒聊,可跳過。