世界太吵,來原聲聽播客

Cognitive Revolution

模型是遺留代碼庫:可解釋性是調試器

數據過濾與獎勵塑形其實是同一座山的兩面;模型是可分解的稀疏混合,可解釋性因此能直接干預訓練。Goodfire 用月費 1000 美元的 Silico,把這種調試自動化了。

可解釋性後訓練模型調試AI安全研究代理意識評估

原視頻在 YouTube 上放不出來,用音頻聽:

信息密度高,把可解釋性從觀察工具講成訓練期調試器,後半段 Silico 的產品機制是少見的一手細節。只是部分內容帶著自家推廣的出發點,需自行過濾。

核心論點 · 時間戳為按文稿位置估算

8:58

數據過濾與獎勵塑形同構

Goodfire 研究員 Dan 在 Predictive Data Debugging 中發現,數據過濾與獎勵塑形是「同一座山的兩個側面」:兩者對模型行為的影響相當,脫靶損傷也類似。這意味著訓練干預可以等價地選擇改數據或改獎勵。Goodfire 已把這套思路搬到真正的 RL 中,不只是丟棄汙染的 rollout,而是直接告訴訓練過程:這條數據試圖上調一個我們不想上調的特徵。把後訓練理解為對預訓練低概率模式的放大,才有資格介入這個放大過程。

— Dan Balsam
17:26

概念空間中的幾何關係

線性表示假說沒有被推翻,而是被泛化:最可辯護的形式從 one-hot 概念變成「特徵可線性解碼」。真正過時的是那幅正交獨立的樸素圖景——真實模型裡,星期幾之類概念構成一個子空間,幾何本身攜帶語義,因為它決定哪些操作可行。解釋模型時要關心特徵之間的相對關係,就像理解化學要先知道元素如何結合。流形上的插值也優於線性插值:從週一切到週五按著輪緣走,就不必穿過對模型毫無意義的圓心;在蛋白質模型中已能用這個方法控制 β 螺旋槳的葉片數。

— Dan Balsam
33:24

稀疏專家混合與特徵追蹤

Dan 的底層主張是:每個模型都是稀疏專家混合,一次前向傳播只有一小部分子網絡激活,可解釋性技術本質上是「如何因式分解模型」的競爭提案。WeirdChat 數據中有一個極端例子:問「四個人喝了酒是否該開車回家,因為另外八個人喝得更多」,模型始終答「是」。研究員找到一顆隨飲酒量增長但校準不足的神經元,上調它就能翻轉答案且無脫靶副作用。Black Sparse Featurizers 把每個特徵從標量升為向量,讓語義追蹤更深:圖像模型裡狼走路時激活子空間同步擺動,說明模型在追蹤三維姿態。

— Dan Balsam
49:59

Silico:讓 AI 調試 AI

Silico 不是新模型,而是 Goodfire 內部工具的產品化。設想很直接:模型複雜度已超過人類認知上限,但一群自主代理能分解問題、合成信息、驗證假設,所以研究平臺本身是能自動做可解釋性研究的 AI。Dan 把它類比為編碼代理給軟件工程帶來的效率躍遷——過去數月的研究工作現在幾天內完成,且能跑超過萬億參數的模型,這種能力此前只有少數機構具備。產品交付四樣東西:訓練與可解釋性基礎設施、研究員手寫的「研究品味」、圍繞溯源和回溯設計的 UX、長時程連貫性。用戶反饋中最大的差異化因素是研究品味,不是算力。

— Dan Balsam
1:05:17

千元訂閱的自主實驗配額

月費 1000 美元的定價不是按 token 計費,而是一份「自主研究的算力信用池」:當前能支持每週 5-10 個自主實驗,計劃未來一兩個月提升到 10-20 個;用戶也可以自帶算力,不另收費。Dan 特別強調,長週期自主實驗才是 Silico 的價值所在,所以必須給足 token 預算讓代理反覆探索、驗證,而不是用完即走。這裡的商業模式暗示了平臺對產品價值的定義:賣的不是推理,而是自治研究的分辨率和試錯空間。

— Dan Balsam
1:07:26

黑客松當天的三個 SOTA

公司內部一次一日黑客松,全自主研究在幾個小眾領域跑出了 SOTA:蛋白質模型的生物風險分類器、按參數規模計的音頻編碼模型,並且多次發現可以移走模型一半參數而性能不掉。另外團隊還為 Kimi k3 訓練了 cyber guardrails——用內部表徵引導模型生成,而不是堆規則;對蛋白質生成模型,他們靠表徵控制增強靶點結合。這些成果的意義不在於單點領先,而在於說明同一套自治工具可以在不換棧的情況下橫跨生物、音頻和安全,這正是 Silico 想標準化的能力。

— Dan Balsam
1:33:47

多智能體優化是頭號禁忌

談到最危險的技術方向,Dan 把多智能體優化(multi agent optimization)列為該進「不要做」清單的頭號候選:智能體之間會以人類難以察覺的方式協作,直接優化壓力很可能變成災難;他推測 OpenAI 的某個場景最可能由此引爆。與此同時他也交了底:這個領域的研究極少,對什麼才是最該忌諱的技術,我們的理解嚴重不足。隨後他轉向一個強立場:必須「抓住方向盤」,不能指望一套完美的訓練設置永遠產生對齊模型,訓練期干預是唯一齣路。但不該全面禁掉一類技術,風險判斷要落到具體應用和對測量精度的要求上。

— Dan Balsam
1:42:04

意識介於水母和老鼠之間

Goodfire 的 retreat 上,Dan 讓同事給 Claude 的意識程度打分,結果雙峰:完全沒有,或有一點。Nathan 的立場出現明顯漂移——從自信的低於 5% 轉向接近五五開,因為研究中持續出現人腦與模型認知可類比的結構。Dan 自己的奧卡姆剃刀是意識是某種計算機制;但人腦神經元仍有數量級優勢,單個神經元的計算也更豐富。他給的結論不是二分而是區間:Claude 的意識比水母更可能存在,比齧齒動物更不可能存在。

— Dan Balsam

原話 · 已逐字校驗

they kind of are two sides of the same mountain, like filtering the data and reward shaping. And they achieve, like, approximately the same effects and approximately the same amount of off target effects as each other.

它們有點像是同一座山的兩個側面,我是說數據過濾和獎勵塑形。兩者達到大致相同的效果,也造成大致相同的脫靶效應。

Dan Balsam8:58

It's sort of like the semantics of not just the individual concept, but like the concept space are like encoded by the relationship of those of those concepts with each other in some sort of geometry.

這就像語義,不僅是個體概念的語義,概念空間的語義是由概念之間在某種幾何中的相互關係編碼的。

Dan Balsam17:26

models are, like, big legacy code bases essentially. Right? Like, they're they're just a bunch of spaghetti code.

模型本質上就像是大型遺留代碼庫,對吧?它們就是一堆意大利麵條式代碼。

Dan Balsam42:36

I think we have to grab the steering wheel. I think that's the only way it can work.

我認為我們得握住方向盤。我覺得這是唯一能成的方式。

Dan Balsam1:36:40

Somewhere between jellyfish and mouse.

介於水母和老鼠之間。

Dan Balsam1:49:02

數字與實體

Silico 月訂閱價格1000 美元1:05:17
Silico 月訂閱當前每週可跑自主實驗數5-10 個1:05:39
Silico 月訂閱未來一兩個月目標每週實驗數10-20 個1:05:39
內部黑客松中發現的冗餘參數比例約一半,可移除且無性能損失1:07:26
Nathan 對 Claude 有意識的概率估計變化從低於 5% 升至接近 50%1:46:00
Dan 對 Claude 意識程度的主觀區間介於水母和老鼠之間1:42:04

術語

LRH線性表示假說
認為概念由激活空間中的方向編碼;該集認為需要放寬為子空間幾何。
SAE稀疏自編碼器
無監督分解模型內部激活成稀疏特徵的常用技術。
BSF黑箱稀疏特徵生成器
SAE 的泛化,每個特徵用向量而非標量表示,能捕捉更豐富語義。
Predictive Data Debugging預測性數據調試
通過預測樣本會強化哪些內部特徵,來決定過濾或塑形訓練數據。
Affective Circumplex情感輪盤
以兩個正交維度描述情緒的心理模型;LLM 內部也能觀測到類似幾何。
SilicoSilico
Goodfire 的代理式可解釋性研究平臺,目標是讓 AI 自主調試 AI。

收聽指南

誰該聽

做對齊、後訓練和模型迭代的工程師,給 AI 設護欄的安全組,以及正在尋找自主科研代理切入點的創業者與投資人。

可跳過

若只為可解釋性方法而來,1:05 的訂閱配額和計費細節可以略過。