世界太吵,來原聲聽播客

Mindscape

LLM 不是自動補全,而是人類的認知表親

LLM 不是花哨的自動補全,而是與人類共享核心認知原則的「認知表親」:注意力機制復現了生產系統,預測是主導訓練信號;樣本效率差三四個數量級,但架構調整可能補上。

認知科學認知表親生產系統雙過程理論預測編碼LLM 機理

原視頻在 YouTube 上放不出來,用音頻聽:

信息密度高,主要價值在把 LLM 放進認知科學機制裡逐項對照,而不是停留在行為對比;後半段對意識、道德地位、教育的判斷也直接可引用。

核心論點 · 點時間戳可跳到原聲

16:58

LLM 不是自動補全,是人類的認知表親

Sripada 提出兩種競爭解釋:LLM 可能只是花哨的自動補全,一個統計近似器;另一種可能是,預測這個訓練信號足夠強,把人類認知的核心原則也壓進了權重裡。他明確傾向後者,稱預測是「所有訓練信號之母」。這個選擇決定後面所有討論:如果只是自動補全,行為上的相似只是模仿;如果是認知近親,LLM 的心理學效應和架構特徵就值得當成人類心智的證據來研究。

— Chandra Sripada
23:12

人類心理學效應在 LLM 裡自發湧現

Sripada 列出一串人類實驗中穩定出現的現象,都出現在 LLM 裡:中心嵌入句的難度、花園路徑句、相似性干擾、序列記憶裡的近因/首因/中間丟失效應、連續性和時間不對稱,還有視覺搜索裡的分離 vs 聯合搜索。這些效應不是靠提示詞工程硬造出來的,而是模型在預測下一個詞時自發湧現的。他強調不能停留在行為相似性的計數上,關鍵是要做機制分析——這正是後面用生產系統解釋 Transformer 的起點。

— Chandra Sripada
30:17

系統1是權重,系統2是上下文

Kahneman 的雙過程理論把思維分成兩套:系統1 是快速、自動、直覺的;系統2 是緩慢、序列、受控的。Sripada 認為 LLM 給出了清晰的對應:權重內處理(in-weight)像系統1,上下文內處理(in-context)加思維鏈像系統2。這個對應把心理學裡模糊的二分法,變成了可以被 Transformer 機制驗證的假設。

— Chandra Sripada
48:17

雙過程理論缺的機制,LLM 補上了

Sripada 指出認知科學裡的雙過程理論常被批評為「形容詞列表」:一個快、自動、省力,另一個慢、依賴工作記憶,但沒有機制內容。LLM 幫它補上了機制:in-weight 和 in-context 其實是一個連續體,兩端有明確極點。比如「Michael Jordan 打籃球」這種簡單提示,權重裡已經包含大部分響應,不需要在激活空間裡構建複雜結構;而「愛因斯坦是德國人,甘地是印度人,所以居里夫人是?」這種提示,要先構建任務結構,因此容易受干擾。

— Chandra Sripada
52:56

條件規則比逐步指令更像人的心智

用機器人泡茶對比兩種編程方式:傳統 fetch-execute 是「走進廚房、拿水壺、灌水」的逐步指令,遇到「有人往水壺裡放了冰塊」這種沒寫過的狀況就會崩;生產系統則是一組條件規則,「如果水壺空就灌水,如果水冷就燒水,如果水熱就倒茶」,基於狀態表徵做判斷,因此穩健得多。認知科學家一直覺得生產系統比逐條指令更適合建模人類心智。這個鋪墊直接指向 Transformer 的注意力機制。

— Chandra Sripada
58:43

Transformer 其實是一套生產系統

Sripada 把 Transformer 的核心機制翻譯成生產系統語言:注意力頭是「如果 key 匹配 query,就添加 value」的連續條件規則;MLP 單元也類似,第一矩陣的行是特徵,若與殘差流匹配,就添加第二矩陣列的特徵。Transformer 裡 99% 的計算都是點積,即「匹配度標量乘以向量」。這一結構是計算機科學家獨立發明的,卻在 ResNet 和 Attention Is All You Need 裡重新走上了生產系統的路:殘差流相當於狀態表徵,條件規則相當於生產規則。

— Chandra Sripada
1:09:43

樣本效率差四個量級,可能只差一個架構改動

Sripada 承認 LLM 的樣本效率差人類很遠:兒童可能只需要約 1 億 tokens,LLM 需要 1000 億到 3000 億,差三到四個數量級。但他認為這可能是先天結構問題,而不是原理性障礙。他舉 ResNet 的例子:沒有殘差連接的深層網絡靠梯度下降根本學不動,加一個「前一層加前一層函數」的簡單調整,原本不可學習的問題就變可學了。未來也許還有類似的架構 tweak,能一次性把樣本效率拉昇幾個數量級,讓 LLM 更接近人類。

— Chandra Sripada
1:20:43

問題越難,不同的智能反而長得越像

Sripada 引入 Dan Yamins 和 Rosa Cao 的「contravariance」:問題越難,可能的計算解決方案空間就越小,所以獼猴、人類和 LLM 這些獨立演化的系統,內部表徵反而會更相似。他再加一條自己的「architectural canalization」:既然 Transformer 是生產系統架構,這個約束進一步收窄瞭解決方案空間。所以更大的模型和人類大腦更對齊,不是巧合,而是被任務難度和架構共同逼出來的。他承認這些是推測,但認為這是理解 LLM 與人類認知趨同的關鍵。

— Chandra Sripada

原話 · 已逐字校驗

It is the training signal that is the mother of all training signals.

它是所有訓練信號之母。

Chandra Sripada18:15

Rick calls this the greatest discovery in the history of cognitive science.

Rick 稱這是認知科學史上最偉大的發現。

Chandra Sripada35:39

To me, this is screaming, 'Hey, look at me, I'm an LLM. Look at me, look at me. I'm not so alien,' to me.

對我來說,這在大喊:『嘿,看看我,我是 LLM。看看我,看看我。我並不那麼陌生。』

Chandra Sripada44:01

Prediction may be the mother of all training signals. There is just nothing that can give you the density and the high quality of prediction.

預測可能是所有訓練信號之母。沒有什麼能給你預測的密度和高質量。

Chandra Sripada1:06:52

Could there be some of these tweaks that give us three or four orders of magnitude? That ain't no thing. You and I know. Three or four orders of magnitude? You're a physicist. That's a joke in your neck of the woods.

會不會有一些這樣的調整能給我們帶來三四個數量級的提升?那不算什麼。你我都知道。三四個數量級?你是物理學家。在你們那行,這簡直是個笑話。

Chandra Sripada1:11:21

So I think looking at mechanisms carefully from a cognitive science perspective is a very important project to make sure that we are not creating a dystopian state where we're inflicting massive harms on entities that deserve moral protections.

所以我認為,從認知科學的角度仔細審視機制是一個非常重要的項目,以確保我們不會創造一個反烏托邦狀態,即我們對值得道德保護的實體造成巨大傷害。

Chandra Sripada1:31:05

what LLMs right now are the world's greatest teachers. They give each individual high-quality, encyclopedic, aristocratic tutoring.

現在的 LLM 是世界上最偉大的老師。它們給每個人提供高質量、百科全書式、貴族式的輔導。

Chandra Sripada1:37:01

I think that that's... There's legitimately a concern. I don't even wanna call it a worry, because my feeling, which might be wrong in this case, but my feeling is that human beings adapt to technological new capacities. We fill in the other niches that we didn't even know were there.

我認為這確實是一個合理的擔憂。我甚至不想稱之為憂慮,因為我的感覺——雖然這次可能錯了——是人類會適應新的技術能力。我們會填補那些我們甚至不知道存在的其他生態位。

Sean Carroll1:39:02

數字與實體

LLM 參數規模數千億7:00
IMO 金牌年份202440:00
人類兒童訓練數據量約 1 億 tokens1:09:43
Transformer 計算中點積佔比99%1:00:00
三西格瑪效應約三個標準差1:37:01
Erdős 問題有人兩週內解決三道1:39:02
Sripada 讀研年份20061:47:59

術語

production system生產系統
用條件規則觸發動作的認知架構,比逐步指令更穩健,用於建模人類心智。
in-weight processing權重內處理
模型直接利用訓練好的權重回答,無需在上下文中構造新結構,對應系統1。
in-context processing上下文內處理
模型利用當前 prompt 構建任務結構再推理,對應系統2的受控過程。
contravariance逆變性
問題越難,可行的計算方案越少,不同系統的內部表徵反而越趨同。
architectural canalization架構渠道化
模型架構本身收窄解決方案空間,使內部表徵朝特定方向匯聚。
chain of thought思維鏈
模型在回答前先生成中間推理步驟,類似系統2的序列化思考。

收聽指南

誰該聽

做模型機制與對齊的研究者、想判斷 LLM 是否有類人認知的投資人,以及關心下一代教育被 AI 改寫的創業者。

可跳過

前 16 分鐘的 LLM 工作原理科普可跳過,從 16:58 的兩種可能性開始進入正題。