RLHF 的代價是 mode dropping,不是對齊
RLHF 為了不出錯逼模型極度保守,把字符串概率分布整體毒化;TypeSafe 的 Jev 走另一條路,只優化 intelligence per dollar。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
RLHF 的代價是 mode dropping
Diogo 認為沒人注意 RLHF 的 downsides,尤其是 mode dropping。機制是:為了生成很長的字符串而不出錯,模型必須極度保守,因為錯誤一眼可見,而看起來正確但微妙出錯的地方很難發現;這種校準對字符串的概率分布是「total poison」。他藉此解釋為什麼 Yann LeCun 那張「LLM 隨序列變長必然出錯」的圖數學上顯然、經驗上不成立——覆蓋分布時不會被離群值過度懲罰,mode drop 才會丟掉少數類。
— Diogo Almeida拒絕回答是類型錯誤,不是安全問題
Diogo 區分 safety alignment 和 capability alignment:後者是「做用戶想做的事」,前者是「跟隨別人的指令」,比如 OpenAI 和 Anthropic。他認為 safety alignment 對 ChatGPT、Claude 這類產品合理,但在 API 裡「nuts」「completely unacceptable」——如果依賴在後臺跑,用戶發一條奇怪消息就讓軟件隨機崩掉,是 insanity。他反對在技術層加限制,理由是每 overfit 一次就多 fracturing 一次智能,而現在的模型已經夠 fractured 了。
— Diogo Almeida公開 benchmark 是信任的替代品
Diogo 說自己 extremely anti-public benchmarks,因為極其 gameable:早年每個 lab 都有團隊專門收集像 MMLU 的數據來刷分,本質是「benchmarking with extra steps」。他承認智能有 je ne sais quoi(good model smell),所以人們需要 benchmark 來建立信任,但長期只能靠 vibes and trust,直到把模型放進具體 workflow 裡評估。他還說如果想讓 Jev 變笨,一年半前就能發。
— Diogo AlmeidaRLCD 是新的 North Star,不是新算法
Diogo 說 RLHF 這個詞被混用了:原始工作是 Paul Christiano 教機器人後空翻,後來是 learning to summarize,再後來才是 instruction following。他真正稱之為 RLHF 的是「instruction following 這個 North Star」,跟 PPO 算法無關——就像 DPO 及其後代不用那篇論文的算法,也算 RLHF。RLCD 同理,是新的任務方向:programs in the loop,把 human 從循環裡拿掉。
— Diogo Almeida可靠性是 catchall,北極星是魯棒性
Diogo 把 reliability 定義成一個 catchall:AI 不能自動化某件事,歸根結底都是某種可靠性問題——可能是 type safety,可能是 determinism,也可能只是模型太 jagged。他明確反對把 determinism(同輸入同輸出)當北極星,認為它只對單元測試略有價值;真正重要的是 robustness——相似輸入得到相似輸出。測試方法是往 prompt 裡塞 UUID 之類的 nonce,看語義相同的問題是否給出相似答案。他說人們被 AI 決策坑到,就發生在 robustness 這一層。
— Diogo Almeida可靠性比速度和成本更被低估
Diogo 認為行業把注意力放錯了地方:「people focus too much on speed and cost and not enough on reliability」。他的判斷是可靠性才讓人愉悅、才讓人敢信任。他把這個和 TFP 增長掛鉤——他期待五年內 TFP 增長超過 3%,並說這才是經濟革命的標誌,也才是 OpenAI 章程原本想表達的東西。他估計現在所有模型在世界經濟有價值工作上大致都還停在零附近,可能還沒到 1%。
— Diogo AlmeidaRLVR 的最優劑量是零
Diogo 直接說,對 TypeSafe 這種形態的模型,RLVR 的最優量是零。他的論證不是「RLVR 沒用」,而是「pacing the frontier」這個討論偷換了前提:它假設所有人都必須做更多 RLVR,而 RLVR 之所以看起來危險,是因為它讓模型在訓練中間可以「do anything they want」——你越不限制,模型在外部就越強。所以危險不是副作用,是設計目標。他稱之為一種「disillusion of responsibility」:把「我們必須做更多 RLVR」當成公理,再推出「我們正走向危險世界」的結論。
— Diogo AlmeidaKV cache 是編碼智能體的暴政
Diogo 想探索「free from the tyranny of the KV cache」的編碼智能體。KV cache 把你鎖進一個模型,為了效率必須不斷 append,於是你沒法做狀態管理、抽象、分解這些正常軟件實踐。他由此解釋了幾個現象:為什麼 routing 很難、為什麼 sub-agent 看起來不 work、為什麼 compaction 是難題——因為傳遞狀態需要比讀狀態便宜得多的智能。他設想的方向包括:給子任務顯式標註狀態、在子任務樹裡搜索相關上下文、並行子智能體互相讀狀態、用智能鎖而非 basic-ass locks 協調。
— Diogo Almeida原話 · 已逐字校驗
One of the things that no one paid attention to was the downsides of RLHF, in particular mode dropping.
沒人注意到的一件事是 RLHF 的缺點,尤其是 mode dropping。
Diogo Almeida6:03
And that calibration is, like, total poison into, like, the probability distributions of strings.
而這種校準,對字符串的概率分布來說就是徹底的毒藥。
Diogo Almeida8:22
I would like to think of our model, like, kind of like, UDP as LLMs and TCP as our models.
我願意把我們的模型想成——LLM 是 UDP,我們的模型是 TCP。
Diogo Almeida23:03
System messages are, like, disgusting global variables where you just put everything in there
system message 就像噁心的全局變量,你把所有東西都塞進去。
Diogo Almeida1:01:21
And like, I really think that people focus too much on speed and cost and not enough on reliability.
我真的覺得人們太關注速度和成本,而對可靠性關注不夠。
Diogo Almeida1:17:12
I think zero is the optimal amount for our shape.
我認為對我們的形態來說,零是最優的量。
Diogo Almeida1:44:10
if you gave me a billion dollars, I wouldn’t pre-train.
如果你給我十億美金,我不會去預訓練。
Diogo Almeida1:49:20
I don’t like weird hierarchies and I think one of the things I’m most proud about in the company is that they don’t respect me that much or they don’t show that. They troll me and like, joke with me and they treat me poorly sometimes and all of that. And I think that’s a good sign of a culture.
我不喜歡奇怪的層級,公司裡我最自豪的一點是,他們不怎麼尊重我,或者說他們不表現出來。他們 troll 我、跟我開玩笑,有時候對我態度很差,所有這些。我覺得這是文化的好信號。
Diogo Almeida2:18:40
數字與實體
| TFP 增長目標 | 五年內超過 3% | 1:17:12 |
| 模型在世界經濟有價值工作上的佔比估計 | 可能還沒到 1% | 1:18:28 |
| 發布前試用者中沒看懂的比例 | 超過一半 | 1:30:14 |
| RLVR 相對 LLM 本身的研究價值倍數(Diogo 估計) | 0.2(他說 0.5 或 1 也行,不在乎) | 1:45:37 |
| LLM 本身(RLHF、RLCD)的研究價值倍數(Diogo 估計) | 2.2 | 1:45:37 |
| 歐洲用戶相對加速倍數 | 3 倍(而非 100 倍) | 2:18:40 |
術語
- mode dropping模式丟棄
- 模型為求穩而放棄生成某些合理但少見的輸出,導致多樣性喪失。
- RLCD程序在環的強化學習
- 把人類從反饋循環中拿掉,用程序化信號做強化學習的新方向。
- RLVR可驗證獎勵的強化學習
- 用可自動驗證的答案(如數學題)作為獎勵信號來訓練模型。
- NoulliNoulli 原語
- TypeSafe 的 API 原語之一,名字來自 Bernoulli,對應編程裡的 if 語句。
- intelligence per dollar每美元智能
- 衡量單位成本能買到多少模型智能的指標,TypeSafe 的核心優化目標。
收聽指南
關注模型訓練路線、RLHF/RLVR 取捨、以及 AI 基礎設施形態的工程師和創業者。
2:18:40 之後關於歐洲服務器和招聘的閒聊可跳過。