世界太吵,來原聲聽播客

80,000 Hours

減速窗口已錯過,超級智能兩三年內到來

英國前 AI 安全負責人 Geoffrey Irving 認為,全面超級智能將在兩三年內到來,減速的窗口已經錯過;對齊的希望在於可擴展監督、人格研究和理論突破,而不是精確指定效用函數。

AI 對齊超級智能減速可擴展監督AISIAGI

原視頻在 YouTube 上放不出來,用音頻聽:

這集直面 AI 對齊最核心的爭論:減速是否可行、超級智能何時到來、實驗室策略的侷限,並給出大量可操作的判斷,信息密度高。

核心論點 · 時間戳為按文稿位置估算

0:00

減速時機:現在

Geoffrey Irving 在開場給出明確立場:減速的時機是現在,甚至更早。他解釋,如果我們仔細分析何時應該減速,答案會是「過去的某個時候」,因為我們離那個瘋狂未來太近了。他提出,只要不到 10 位關鍵決策者(實驗室 CEO、中國相關人士、幾個國家領導人)達成一致,就能實現減速;但單方面減速很難。這個判斷是整集對話的底色,也解釋了他為什麼認為對齊問題需要全球協調而非純技術解決。

— Geoffrey Irving
3:07

反駁時間尺度論

針對 Rohin Shah 認為訓練時間短,所以模型不會學會接管世界的觀點,Irving 指出這混淆了「整體計劃的時間尺度」和「任務組成部分的時間尺度」。即使每個子任務都在一週內完成,多個子任務組合起來也能實現多年計劃。這意味著訓練時長並不構成安全保證,因為模型可以通過分解任務來執行長期策略,而無需在單個訓練過程中完成完整的推理鏈條。

— Geoffrey Irving
9:38

實驗室策略組合觀察

Irving 認為 OpenAI、Anthropic、DeepMind 的策略都是「性格訓練 + 可擴展監督 + 監控」的組合。他對比了各實驗室的性格訓練方法:Anthropic 偏美德倫理,OpenAI 規則更多且更偏糾正性,DeepMind 則不太清楚。這些方法能否在超級智能上奏效,目前沒有強論證。這個觀察揭示了前沿實驗室的對齊實踐缺乏理論根基,更多是經驗性的調參。

— Geoffrey Irving
21:09

可擴展監督的障礙

Irving 給出可擴展監督的一個關鍵障礙——「模糊論證」:模型可能只給出支持某主張的證據,而隱藏反證,因為反證才是決定性的。他引用 Beth Barnes 在 OpenAI 的實驗:人類辯手用複雜但錯誤的論證騙過裁判,因為雙方都找不到漏洞。這個障礙在理論上沒有好解法,說明單純依賴人類反饋的監督方式在面對更聰明的模型時可能失效。

— Geoffrey Irving
29:34

超級智能兩三年內到來

Irving 的模態預期是兩到三年內出現全面超級智能。主要不確定性在於模型能否擅長模糊任務(直覺、模糊規劃)。他認為人們高估了模型只擅長可驗證任務的可能性,並相信通過數據飛輪,模型會逐漸擴展到更多非可驗證任務。這個時間線判斷意味著減速和安全研究的窗口極短,也支持他在開場主張「現在」減速。

— Geoffrey Irving
45:09

AISI 的三大工作方向

Irving 指出 AISI 未來重點:一是濫用風險,即危險能力評估,需結合高研究能力和國家安全;二是緩解措施,包括濫用和失控,AISI 已有強大的防護團隊;三是政策,這是 Irving 加入 AISI 的主要原因。AISI 作為最大的政府 AI 安全研究機構,其政策建議應基於戰術現實。這三點勾勒了政府層面參與 AI 安全的角色:評估、防禦、政策制定。

— Geoffrey Irving
1:21:36

無法精確指定效用函數

Irving 認為,在超級智能到來前,我們無法精確指定其效用函數。唯一的希望是訓練過程具有誤差校正能力,使我們能落入某個「盆地」而非精確目標。他提出一個具體構想:通過訓練空間的分支圖,用 1000 個檢查點展示模型訓練路徑,從而測試不同算法,增加對分支行為的理解。這試圖把對齊從「設定目標」轉向「設計訓練過程」。

— Geoffrey Irving
1:38:14

RL 的作用機制

Irving 認為 RL 主要做兩件事:一是下選擇除無效的推理模式,二是人類常只寫最終答案,模型被迫在潛在空間中推理。o1 的出現是 RL 算法調優與基礎模型能力提升的結合。他預測對齊技術的前沿是「可擴展監督 + 人格 + 學習動力學」的組合,但組織會採取多元化策略,不會孤注一擲。

— Geoffrey Irving

原話 · 已逐字校驗

Now. Now. If we were to carefully analyse this question of exactly when we should slow down, it would be like a while ago in the past, because we’re just too close to this crazy future.

現在。現在。如果我們仔細分析到底應該何時減速,答案會是過去的某個時候,因為我們離那個瘋狂的未來太近了。

Geoffrey Irving0:00

On factual questions it would be not racist; it was very happy to write incredibly horrible poetry about racism.

在事實問題上它不種族歧視;但它非常樂意寫關於種族主義的極其可怕的詩歌。

Geoffrey Irving14:31

One of the winning strategies was basically a debater would produce a very complicated argument that sort of sounded true, was false, but neither of the debaters — not the liar or the honest debater — knew where the flaw was.

一個獲勝策略基本上就是辯手提出一個非常複雜的論證,聽起來像真的,其實是假的,但雙方辯手——無論是說謊者還是誠實者——都不知道漏洞在哪裡。

Geoffrey Irving23:31

some degree of your conscious train of thought is a hallucination as you go along the world.

某種程度上,你的意識流是你在世界中行走時產生的幻覺。

Geoffrey Irving56:12

"Rationalisation" there is a pejorative word, but it’s also just intrinsically how intelligence works, even for humans.

「理性化」是一個貶義詞,但它本質上就是智能運作的方式,即使對人類也是如此。

Geoffrey Irving1:06:35

Hope is not like a lot of probability. Just like, we should try.

希望並不等於很大的概率。就像,我們應該嘗試。

Geoffrey Irving1:23:51

If you had the other LBJ that was opposed to the first one, that's saying, "By the way everyone, you realise what he's doing here? He's cheating the vote system." And everyone is like, "That's ridiculous. That's clearly unfair. Let's fix the rule to break that." I think that intervention would get you so much power over the misaligned components of LBJ that I think it's within hope to imagine getting that story right.

如果你有另一個反對第一個 LBJ 的 LBJ,他會說:「順便說一句,各位,你們意識到他在做什麼嗎?他在作弊投票系統。」然後大家會說:「這太荒謬了,這顯然不公平,我們改規則來打破它。」我認為這種干預能讓你在 LBJ 的錯位部分上獲得如此大的力量,以至於我們有希望把故事講對。

Geoffrey Irving1:28:54

I told Dario — this is annoying — that I would write a document called "Language is enough to get to AGI" — and then I didn't write it until 2019. So early 2019 is when I actually wrote the document.

我告訴 Dario——這很煩人——我會寫一份名為「語言足以達到 AGI」的文檔——然後我直到 2019 年才寫。所以 2019 年初我才真正寫了那份文檔。

Geoffrey Irving1:36:46

數字與實體

減速所需關鍵人數少於10人0:00
Anthropic 憲法規則數5條10:46
臨時暫停可接受的性能損失2-10倍慢34:14
超級智能到來時間(模態預期)2-3年29:34
對齊領域歷史最多 20-25 年1:18:26
人格實證研究年齡1-2 年1:19:30
納米技術和上傳時間幾年到二十年59:28
Pentago 求解計算量10^17或10^18 FLOPS1:31:00
開始主張 RL+LLM 路徑的年份20181:34:05
o1 發布時間20241:36:46

術語

scalable oversight可擴展監督
AI 能力超越人類監督時仍能保證行為符合意圖的監督方法。
ambiguous arguments模糊論證
只給支持證據、隱藏決定性反證的推理方式,可欺騙監督者。
character training性格訓練
通過訓練塑造模型人格特質以減少危害,是當前實驗室對齊策略的一部分。
effective field theory有效場論
忽略微觀細節、用宏觀參數描述物理現象的理論,Irving 藉以類比對齊理論。
data flywheel數據飛輪
模型生成數據訓練下一代模型,不斷擴展能力範圍的循環。

收聽指南

誰該聽

該聽:AI 對齊研究者、大模型訓練團隊負責人、AI 政策從業者,以及所有對超級智能時間線判斷敏感的技術決策者。

可跳過

1:31:00 附近 Pentago 求解算力估算可跳過,不影響主線。