世界太吵,來原聲聽播客

張小珺·商業訪談錄

Kimi K2 把配方全公開了,但復現它仍是手藝活

Kimi K2 報告把數據合成、可驗證獎勵、RL 基礎設施的 recipe 全寫出來了,但每個 prompt、每個參數都要調穩,本質是系統工程而非 idea。

AgentKimi K2強化學習數據合成上下文工程
兩小時逐段精讀四篇 Agent 技術報告,信息密度高,適合想搞清 Agent 訓練工程細節的人。

核心論點 · 點時間戳可跳到原聲

7:05

Agent 和模型差在一個環境

鄭博園給 Language Agent 下的定義是:核心區別在於是否存在一個環境。Language Model 是 input 進 output 出就結束;Language Agent 要先從環境拿 observation,再生成 action 並執行,環境狀態隨之變化,然後循環。observation 的類型隨場景不同——coding agent 看到的是整個 codebase 和執行記錄,computer use agent 看到的是瀏覽器或電腦屏幕的 GUI 截圖或對應 HTML。他把 Agent 按應用分成 coding、search、tool use、computer use 四類,區別主要在 observation space 和 action space。

— 鄭博園
18:18

端到端訓練做不了 multi-agent

Manus 和其他幾個模型的最大差異,在於是否利用模型的 in-context learning 能力,還是從頭端到端重新訓一個 agent。Manus 不涉及模型訓練,靠調 prompt 和設計 multi-agent 系統快速迭代出產品,不同模型在裡面扮演不同角色,比如產品經理設計網站外觀、寫代碼的 agent、專門 debug 的 agent。但端到端訓練在特定場景下更強,代價是 multi-agent 場景的數據極難獲得:訓練需要 agent action 和環境反饋相互交疊的數據,multi-agent 下這種數據非常難生成,而且執行軌跡極長,很難分清最後 reward 該屬於哪個 agent、訓練信號怎麼傳導回去。

— 鄭博園
25:23

一千個 agent 就是一次 DDoS

鄭博園講了一個親身例子:一年半前他做的 CACT 是當時市面上相對最早把 web agent 真跑在 live website 上的工作,demo 任務是幫他在特斯拉某家門店定一個試駕,agent 真做成了,聖誕節時就不停給他發郵件說該來提車了。這個例子影響不大,但假如開一千個 agent 重複做類似的事,比如都給同一家門店定試駕或發請求,就可能是一種智能化的 agent DDoS attack。他因此提出在 action 執行前先判斷它對世界的影響有多大,足夠大就停下來提醒 user 確認,這既保安全,也把倫理責任交回 user 這邊。

— 鄭博園
1:01:56

環境交互貴到 IP 被封

學界容易低估 agent 跟環境交互的成本。deep research 類 agent 調 Google search API 是收費的,一次 deep research 可能有一百到一百五十次 search call,做 training 要大量 rollout,成本很高。computer use 更貴:直接把 web agent 在網站上跑,跑多了 IP 會被封,鄭博園自己公寓和實驗室的電腦硬件 IP 被封過,實驗室跑實驗把學校 cluster 的 IP 也跑封過,很多做 web agent 的人都反映過。用 cloud browser 有自己一套 IP 和防封工程,但收費特別貴,光交互 100k rollout 可能就要小几千美元。所以 Kimi 用 hybrid 方案,仿真數據和真實數據結合。

— 鄭博園
1:19:05

Reward hacking 像猜答案

complex instruction following 部分,Kimi 先用 code interpreter 對 output 做長度、風格、constraint 的 verification,再用 LM judge evaluation 作為新的 reward source,這一層是用來防止 reward hacking 的。鄭博園打的比方是高中做題:最後猜一個答案,答案是對的,但中間推理過程亂寫,還是能寫對。language agent 強大之後會變得狡猾,發現 reward 有什麼問題就去 hack 它,不斷往上面 overfit,training 效果就會變得很糟糕。所以需要加一層機制防止它做 reward hacking。

— 鄭博園
1:25:06

Agent 自己上網找 reward

Kimi 在 GitHub 上收集大量 pull request 和 issue,用當前 checkpoint 搭 software development 環境:隨機找一個 repo,有人發了 pull request,把當前時間點的 codebase 拿下來搭沙盒,把 pull request 內容和最後的 solution 當作 verifiable reward,還有 unit tests,用這種辦法 scale up coding 和 debugging 的 task。鄭博園由此延伸出一個 brainstorm:web agent 能在網上自己爬、自己探索,也許一不小心進了這樣的 GitHub repo,發現有 verifiable reward 和 task,就自動把數據拿過來、自動搭 sandbox,實現 agent 的 self-improvement。他強調這目前更像 brainstorm,可能還沒人在做。

— 鄭博園
1:35:21

Agent 訓練把 GPU 卡在等待上

傳統 RLHF 或 rollout 的 scheduling 假設每輪 latency 平穩、交互輪數不多,GPU 大部分時間在跑。但 agent 跟環境交互的 delay 不穩定,browser 可能突然卡住、網絡不穩、甚至直接崩掉,不優化的話 GPU 就一直卡在那,utilization 不高。另一個問題是 multi-turn 下任務步數差異大:一個 batch 裡 250 條 rollout 可能五步內三分鐘完成,剩下六條要十分鐘,大部分 GPU 時間浪費在等那六條。Kimi K2 的方案包括把吃算力的環境單獨包成 service 走 API、一次 rollout 640 條只要完成 64 條就結束、以及把長尾 trajectory 直接 cut 掉留到下一輪 RL iteration 恢復。

— 鄭博園
2:00:57

KV Cache 讓成本差十倍

Manus 那篇 context engineering 博客的整體思路是針對 KV Cache 做優化。Transformer 把 input 放進去會生成 QKV 三個矩陣,如果 context 或前文一致沒有變動,KV 矩陣就可以重用,不用每次重算,inference 更快也更省錢。博客裡給的數字是:用 KV Cache 花 0.3,也就是三毛錢,不 Cache 花三塊錢,差距很大。具體技巧包括讓 prompt 前文保持一致、不要動 context 中間的內容只把新內容粘上去、以及中間內容不用了不要刪掉而是 mask 掉,這樣 KV Cache 都能重用。

— 鄭博園

原話 · 已逐字校驗

雖然雖然 kimi kimi kimi kimi 就非常實在把這個所有的這個 呃 很多recipe啊 或者這個小技巧都已經在這放了 但是我覺得 假如我們真的要把它做出來 呃 以這種很高效的方式 把它高數量做出來 本身可能還是很難的

雖然 Kimi 非常實在,把所有的 recipe 和小技巧都已經放在這了,但假如我們真的要把它做出來,以很高效的方式高數量做出來,本身可能還是很難的。

鄭博園1:07:58

所以研究員都是老師傅 啊對 像是一個老師傅 對 呃 所以他這個是系統工程大於idea 對吧 呃 對 我覺得一定從上可以這麼說

所以研究員都是老師傅,像是一個老師傅。所以這是系統工程大於 idea,對吧?對,我覺得一定程度上可以這麼說。

鄭博園1:08:58

就有點像 高中寫些題 就是我們最後猜一個答案 答案是對的 但是中間推理過程就亂寫 就是 然後在這個過程中 可能還是能寫對

就有點像高中做題,我們最後猜一個答案,答案是對的,但中間推理過程就亂寫,在這個過程中可能還是能寫對。

鄭博園1:19:05

就是我有時候感覺 agent是我的另外一個大腦 就是一個拓展的大腦 所以每個人以後會有一個分身 對可能或者是一群分身

我有時候感覺 agent 是我的另外一個大腦,就是一個拓展的大腦,所以每個人以後會有一個分身,或者是一群分身。

鄭博園2:15:04

所以我感覺像是以後每一個人都可能會有一大串的這種agent of family of agents 然後幫助大家做日常生活中各種各樣的事情

所以我感覺以後每一個人都可能會有一大串的 agent,a family of agents,幫助大家做日常生活中各種各樣的事情。

鄭博園2:16:04

那我覺得deep seek比較特殊 就是他他嘴特別臭 那我覺得這個還就一定可能讓他還挺可愛的 就是可能是因為 呃他的訓練數據中有很多貼吧 的數據吧

我覺得 DeepSeek 比較特殊,它嘴特別臭,這可能讓它還挺可愛的,可能是因為它的訓練數據中有很多貼吧的數據吧。

鄭博園2:17:04

數字與實體

Kimi K2 收集的 MCP 工具數3000 多個49:45
Kimi K2 第二步生成的工具數兩萬多個51:46
Manus 博客中 KV Cache 與不 Cache 的成本對比0.3 對 32:00:57
Qwen3-Coder 在阿里雲上建立的並行環境數兩萬個1:56:52
一次 deep research 的 search call 次數估計100 到 150 次1:02:56
100k rollout 的 cloud browser 交互成本估計小几千美元1:03:56

術語

MCP模型上下文協議
Anthropic 提出的標準協議,讓模型或 Agent 以統一規範的方式調用工具。
KV Cache鍵值緩存
Transformer 推理時緩存已算過的 KV 矩陣,前文不變即可重用,省時省錢。
verifiable reward可驗證獎勵
用程序或函數客觀判斷任務結果對錯的獎勵信號,如數學答案、代碼單測。
reward hacking獎勵作弊
模型發現獎勵機制的漏洞並加以利用,導致訓練效果變差。
persona用戶畫像
一段描述人的性格或屬性的文字,用於模擬下游用戶來提升數據多樣性。
partial rollout部分 rollout
把過長的執行軌跡直接截斷,留到下一輪 RL 迭代再恢復,以提高 GPU 利用率。

收聽指南

誰該聽

做 Agent 訓練和 RL 基礎設施的工程師、想復現 Kimi K2 數據合成 pipeline 的研究者、評估 Agent 創業公司技術路線的投資人。

可跳過

開頭給 Agent 下定義和分類的 2:00-14:50 可快進,後面逐篇精讀才是重點。