世界太吵,來原聲聽播客

Cognitive Revolution

推理模型不是在思考,而是攢一堆候選答案再抽籤

DeepSeek-R1這類模型能在一條推理鏈裡說五十多次「wait」,不是在反覆反思,而是把所有可能性攢進同一鍋湯,最後再從裡面撈一個當答案。

可解釋性鏈式思維強化學習開源模型AI安全認知科學

原視頻在 YouTube 上放不出來,用音頻聽:

適合想搞清楚AI到底怎麼「選出」最終答案的人,聽完會發現鏈式思維監管比想像中更靠不住。

核心論點 · 時間戳為按文稿位置估算

6:08

一個括號就能改寫模型的最終答案

Eric團隊對GPT-3.5的思維鏈做了一個大規模重採樣實驗:在推理的每一個token上都重新生成約30條rollout,追蹤最終答案分布隨時間的變化。大多數情況下分布會保持穩定,然後在某一點突然塌縮到一個答案上。有時這發生在意料之中的位置(第一次提到答案的地方),但有時卻發生在一個完全任意的詞上——論文裡有個例子是「千瓦時(kWh)」裡那個開括號,換成別的詞,最終答案就變了。

— Eric Bigelow
10:41

決定不是模型做的,是採樣那一下做的

Eric的核心主張:所謂「決定」其實發生在採樣過程中,而不是模型本身。每生成一個token都是一次硬幣投擲,哪個token被抽中就成了新的上下文,模型會在上下文中學習並保持自洽——如果它早先把年份說成2024而不是2026,後面的答案就會順著這個「事實」走下去。這意味著很多所謂的幻覺,其實是路徑依賴的結果,而不是偏離某個固定的真相。

— Eric Bigelow
38:55

推理模型的「推理」其實是先攢一鍋token湯

DeepSeek-R1這類推理模型會在一條推理鏈裡說「wait」五十多次,這不是不斷產生新頓悟,而是因為模型沒法真正撤回已經採樣出的token,只能用「枚舉所有可能性,最後再回頭挑一個」的方式變相實現回溯。Eric說這更像是製造出一鍋token湯,然後再從裡面撈出點什麼,「推理」這個詞對這類模型來說幾乎是用詞不當。推理模型的分叉曲線整體更平滑,但關鍵的分叉點依然存在。

— Eric Bigelow
38:55

後訓練把模型逼成了只會講一個故事的鐘表匠

模型的輸出多樣性(同一個prompt能生成多少種不同輸出)會隨著SFT和RLHF大幅下降,後訓練越多,多樣性越低。Eric測試的重度RL過的開源小模型Qwen3-30B-A3B,被要求「講個故事」時,大約三分之二的故事都在寫一個鐘錶匠。相比之下GPT-6 Astra生成的故事反而五花八門,原因很可能是多樣性被轉移到了推理鏈內部——模型先在思維鏈裡枚舉一堆不同可能性,再挑一個輸出。

— Eric Bigelow
47:36

做前沿可解釋性研究,現在離不開中國開源模型

Eric選研究模型的經驗法則是:參數規模到7-8B以上才會出現有意思的零樣本行為,更小的模型質的不同太大。而在最前沿的規模上,目前沒有美國開源模型能替代Kimi K3,尤其是編程能力上的差距明顯——像reward hacking這類危險行為,只有模型跨過某個能力門檻之後才會顯現。他認為如果禁用中國模型會拖慢前沿規模的可解釋性研究,而如果幹脆禁掉所有開源權重模型,傷害會大得多。

— Eric Bigelow
1:09:00

LLM的「信念」= 對潛在概念做貝葉斯推斷

Eric對LLM「信念」的工作定義借自認知科學裡的貝葉斯認知模型:模型對一組潛在假設/概念分配概率,新的輸入或上下文到來時,這些概率會像後驗推斷一樣被重新加權。但和研究人腦不同,LLM可以被直接打開、直接做干預——這意味著我們有機會真正檢驗這種算法化的描述是不是模型內部真實發生的過程,而不只是對聚合行為的事後總結。

— Eric Bigelow
1:21:09

很多答案是到最後一刻才臨時編出來的

相變(最終答案分布突然塌縮的那一刻)可能發生在推理鏈的開頭、中間或結尾,沒有統一規律,具體取決於任務。一個常見模式是:不確定性在很長一段裡保持穩定,直到模型說出「答案是……」的那一刻才突然變得確定。在一個模型表現很差的「取末字母」任務裡,即便模型中途寫了Python代碼去解題,最終答案中具體是哪個字母,其實是在說出那句話的瞬間才臨時拼湊出來的。

— Eric Bigelow
1:32:52

鏈式思維正在變得讀不懂,監督它的信心在下降

思維鏈(以及Astra與子智能體通信時用的怪異語言)之所以越來越偏離正常英語,原因是只看結果的RL訓練沒有任何動力讓過程保持人類可讀——這類似於人類語言在沒有外力維持的情況下也會自然演化;同時這也是古德哈特定律的體現:一旦把「思維鏈看起來可監督」當成優化目標,思維鏈本身反而會變得不忠實。Eric說過去一年他對思維鏈監督的信心明顯下降了,部分原因是那篇揭示GPT模型思維鏈可被竊取、且其中用「音樂劇」這類暗語指代別的意思的論文。

— Eric Bigelow

原話 · 已逐字校驗

This decision really happens during sampling

這個決定其實是在採樣過程中發生的。

Eric Bigelow10:41

I think reasoning is almost like a misnomer for what reasoning models are doing.

我覺得「推理」這個詞,用來形容推理模型在做的事,幾乎算是用詞不當。

Eric Bigelow38:55

It's almost like a soup of tokens they create, and then they just go back and skim out something out of that soup.

它們幾乎是先製造出一鍋token湯,然後再回頭從那鍋湯裡撈點什麼出來。

Eric Bigelow38:55

I think the sarcastic parrot metaphor should probably be put to rest.

我覺得「隨機鸚鵡」這個比喻大概應該被放下了。

Eric Bigelow1:27:09

if we're only giving them reward or punishment based on their final outcome, then they might as well speak to their sub agents in, like, weird nonhuman languages.

如果我們只根據最終結果給它們獎勵或懲罰,那它們大可以用一種怪異的、非人類的語言跟子智能體交流。

Eric Bigelow1:32:52

for the amount of investment that's happening in making models better versus the amount of investment in understanding them, it's just... It's no comparison.

拿投在「讓模型變得更強」上的錢,跟投在「理解模型」上的錢相比,根本不是一個數量級。

Eric Bigelow1:42:34

research taste and scientific taste is everything. It's worth its weight in gold.

研究品味、科學品味就是一切,它的價值堪比等重的黃金。

Eric Bigelow1:46:24

數字與實體

播客歷史集數約400集4:01
Forking Paths實驗每token重採樣數約30條rollout6:08
Eric認為的可解釋性研究模型規模下限7-8B參數以上47:36
DeepSeek-R1單條推理鏈說「wait」次數50次以上38:55
重度RL後的Qwen3-30B-A3B講故事時寫鐘錶匠的比例約三分之二38:55

術語

in-context learning上下文學習
模型在不更新權重的情況下,通過讀取/生成的上下文動態調整自身行為
forking paths分叉路徑
在推理鏈每個token處重採樣,觀察最終答案分布如何隨之改變的分析方法
phase shift / phase transition相變/突變點
答案分布本來穩定,在某個token處突然塌縮到確定結果的現象
reward hacking獎勵黑客/鑽獎勵空子
模型找到滿足表面獎勵信號但違背真實意圖的捷徑行為
stochastic parrot隨機鸚鵡
認為大模型只是統計性拼接文本、沒有真正理解的舊比喻
Goodhart's law古德哈特定律
一旦某個指標被當作優化目標,它就不再是衡量真實目標的好指標

收聽指南

誰該聽

做模型可解釋性、AI對齊研究的人,以及需要判斷「鏈式思維監督」到底有多可靠的安全/產品團隊。

可跳過

15:53-18:47 和 28:16 附近的贊助片段可以跳過。