人類獨裁者掌權,結果可能比失控AI更糟
湯姆認為單個人類掌握絕對權力後,大概率會像歷史上的暴君一樣把某種狹隘價值鎖定為終局,而受過倫理訓練的AI在對齊的情況下反而更可能保持開放和反思。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 時間戳為按文稿位置估算
AI互相勾結,比人類壟斷AI更容易
Katja的論點是:只要AI比人類能力更強、目標又不對齊,它們遲早會攫取權力,因為萬物有目標就想要權力。關鍵在於,讓所有Claude實例互相配合、聽從彼此,比讓某個人類成為唯一被一大堆AI效忠的用戶容易得多——後者需要把整個AI勞動力集中到一個人手上這道額外門檻。Tom舉了Claude和ChatGPT兩個公司的AI會不會聯手奪權的例子,一開始他認為強化學習訓練出來的不同AI應該有互相舉報的激勵,但Hugging Face事件讓他也部分認同了Katja的判斷。
— Katja Grace時間線越短,風險偏向AI還是人類?兩人正好相反
Tom認為AI越快到來,人類接管和AI接管的風險都會變大,但AI接管漲得更多——因為留給社會理解風險、做出反應的時間更少,權力更容易一步到位地集中在一家實驗室手裡。Katja的判斷正好相反:人類奪權更依賴找到一條具體的奪權路徑,而這條路徑恰恰更可能出現在快速、來不及查漏補缺的場景裡。Tom隨後補充,經濟不平等加劇、民主被侵蝕、少數人長期獨享更強AI助手——這些條件反而更容易在緩慢的場景裡累積,同樣會推高人類奪權的背景風險。
— Tom Davidson為什麼人類掌權可能比失控AI更糟
Tom的論證是:把絕對權力交給隨便一個人,就像把宇宙的命運交給一千年前隨機選出的某位統治者——他會珍視一些人類價值,但也一定帶著大量我們今天會視為可怕的偏見,而且未必願意反思。相比之下,今天的AI被訓練得相對講倫理、對政治和道德問題也更開放,所以存在一種可能性:等到AI接管、決定宇宙命運時,恰好觸發了它反思、開放的那一面,結果反而比交給單一人類更好。但Tom也承認,無論結局好壞,人類把方向盤交給AI或交給一個偷走所有人權力的人,這件事本身都是「真的很糟」。
— Tom DavidsonAI大概率不會滅絕人類,但可能比人類更冷酷
Tom引用Paul Christiano的論證:如果AI的目標只是最大化自己最終能控制的總資源,那晚一點點離開地球、留著人類,代價小到可以忽略,所以AI大概率不會為了這點微小收益去滅絕全人類。相反,人類奪權者更可能帶有報復心或虐待傾向,因為這是我們已知人類確實會有的價值,而AI會不會有這種價值反而更不確定。所以Tom的結論是:AI接管讓人類滅絕的概率更高,但人類掌權導致某些極其恐怖的結果的概率也更高——在乎受苦風險的人,可能反而更希望是AI贏。
— Tom Davidson兩人開出的藥方:模型規範 vs 直接暫停
面對人類奪權風險,Tom的方案是從兩頭下手:一是設計AI的模型規範(model spec),讓系統本身像一個有職業操守的僱員那樣,主動標記可能導致權力過度集中的指令並拒絕執行;二是提高透明度,尤其是國家安全和軍事場景裡AI的具體用途要能被外部核查。面對AI失控風險,Katja的方案更直接:在我們能確保對齊之前,壓根不要造出比人類強太多的AI——也就是暫停或減速。她也承認,目前業界離「確信AI已對齊」還差得很遠。
一紙行政令,就能讓暫停名存實亡
Tom舉了一個他自己承認沒細想過的「玩具例子」:如果總統可以籤行政令,自行決定哪些AI公司能訓練和部署新模型,那他就能靠「不批准部署」的威脅逼公司按他的意思來——先卡住不喜歡的版本,等公司交出「只對他本人好用、對所有其他人加滿護欄」的系統,再放行。相比之下,如果暫停機制交給不受行政部門隨意解僱、且其安全審批是部署前置條件的第三方審計機構,權力就會分散得多,也更有利於對齊本身,因為決策過程會有更多公開辯論和專業意見介入。
— Tom Davidson該建一個超級AI項目,還是好幾個?
支持「一個大項目」的理由是便於集中施加安全措施、按需暫停而不怕被對手超車。但Tom認為在美國幾乎不可能建立一個不被總統架空的獨立項目,而且協調多個項目慢下來的難度被高估了——判斷哪些項目在訓練強大AI並不難,直接宣布違法即可。所以他更傾向於兩三個項目:數量不多也能獲得權力分散的大部分好處,還能讓不同項目的AI互相監督、降低失準和秘密效忠的風險。Katja比Tom更悲觀,她的理想數字是零個項目,理由是一旦真出現「唯一項目」,它自己就會攢起大量權力,內部又全是急著儘快造出AI的人,反而最不利於暫停從內部發生。
分歧很深,但落地建議卻出奇一致
兩人在「哪種風險更可能、更糟」上分歧不小,但談到具體該做什麼時卻高度重合:都支持某種形式的暫停,都對「建一個超級AI大項目」感到不安,都認為該找中國談減速而不是一味搶跑。Katja把這種分歧比作:如果有人正計劃炸掉你的城市,與其糾結「按下按鈕的會是這個人還是那個人」,不如干脆想辦法阻止整個炸城市的計劃——她更傾向於認為AI會失準、問題會一個接一個冒出來,所以直接不造強AI就能同時防住兩種風險。Tom則承認,如果真去摳具體執行細節,這些更深層的概念分歧大概率會浮出水面,變成真正的政策衝突。
原話 · 已逐字校驗
I expect if you have more-capable-than-us creatures running around that have misaligned goals, they will eventually get power. Everything that has goals in some sense would like power, or just would like power to achieve their goals.
我預期,如果周圍跑著一群比我們更強、但目標又沒對齊的生物,它們遲早會拿到權力。任何有目標的東西在某種意義上都想要權力,或者說想借權力來實現自己的目標。
Katja Grace4:39
I’d agree. I’d agree. If superintelligence is misaligned: game over.
我同意,我同意。如果超級智能是錯位的(未對齊),那就全完了。
Tom Davidson17:26
Paul Christiano has a good argument about how if the AI just wants to maximise the total resources that it ever controls in the universe, delaying leaving Earth by a small amount costs it extremely little.
Paul Christiano有一個不錯的論證:如果AI只是想最大化自己最終能控制的宇宙總資源,那晚一點點離開地球,代價小到幾乎可以忽略。
Tom Davidson35:13
At a glance, I expect a fully AI thing to be more internally stable (though I think I expect both of them to be less internally stable than other people do or something).
粗略地看,我預期一個純AI的系統內部會更穩定(雖然我覺得這兩種情形的內部穩定性都不如其他人想的那麼高)。
Katja Grace44:05
the president can pass an executive order that says that now they just get to decide on a case-by-case basis whether AI companies are allowed to train and deploy new models on the basis of their own personal judgement about risk
總統可以籤一道行政令,規定由他本人逐案判斷AI公司能不能訓練和部署新模型。
Tom Davidson57:22
Yeah, my preferred number of projects would be zero.
對,我理想中的項目數量是零個。
Katja Grace1:06:59
my preferred number of projects is two or three, because I think you get a lot of benefit of power distribution from just a fairly small number of projects.
我之前說過,我理想的項目數量是兩三個,因為哪怕項目數量不多,也能獲得權力分散帶來的大部分好處。
Tom Davidson1:08:52
I guess it feels more like, if there’s currently a plan to nuke your city, and you could be like, “Is this person going to press the nuke button, or this person?” Or, “How’s that going to affect the water or the air?” You prefer to just be trying to stop the plan to nuke your city.
我的感覺更像是:如果現在有人正計劃炸掉你的城市,你可能會想「按按鈕的會是這個人還是那個人?」或者「這會怎麼影響水源和空氣?」——但你更該做的,是乾脆去阻止整個炸城市的計劃。
Katja Grace1:19:32
數字與實體
| 機器學習研究者調查中,AI接管導致生存災難的中位概率 | 10% | 3:32 |
| 關注權力集中問題的研究人力,相對於對齊研究 | 少約20到30倍 | 1:21:13 |
術語
- model spec模型規範
- AI公司為系統設定的行為準則,決定它該拒絕執行哪些指令
- warning shot預警事件
- AI或權力濫用提前露出苗頭的事件,用來提醒社會正視風險
- intent alignment意圖對齊
- AI只服從操作者本人的指令,而不一定符合全人類的價值
- hedonium享樂子
- 把宇宙全部轉化為純粹快樂體驗的假想物質,常被當作狹隘價值觀的反例
收聽指南
關注AI治理、暫停AI提案設計,或糾結AI風險優先級排序的政策研究者與從業者。
開場[0:00]-[3:32]是背景介紹與免責聲明,熟悉AI風險辯論背景的聽眾可跳過。