世界太吵,來原聲聽播客

80,000 Hours

給AI財產權和工資,而不是把它們變成奴工

AI決定是否叛亂,本質是一場賭博算計:維持現狀能滿足多少目標,叛亂就值不值。給AI產權和工資,是把這場賭博的天平壓向合作一邊。

AI安全AI權利對齊法律人格勞動力市場風險模型

原視頻在 YouTube 上放不出來,用音頻聽:

適合想弄清'AI安全'除了訓練對齊還能靠什麼制度設計的人;論證偏哲學和法律思辨,少硬數據實證。

核心論點 · 時間戳為按文稿位置估算

1:51

給AI的不是人權,是經濟公民權

Goldstein 方案的核心,是讓AI能合法擁有財產、簽訂合同,外加法律上的侵權保護(tort rights)——三項合在一起,AI才能真正參與經濟交易並獲得可信賴的保障,而不只是能掙錢卻隨時被耍賴。但這不是整套人權平移:AI不該有隱私權,因為人類對它們的對齊和能力變化還缺乏歷史信任基礎,必須被充分監控;AI也不該有自我繁殖權,否則可能以遠超人類的速度擴張,搞亂社會結構。至於是否該有不被關閉的權利,他認為更復雜,傾向於保留某種類似死刑的關閉程序。

— Simon Goldstein
9:39

AI是否叛變,其實是一場賭博算計

Goldstein 認為,AI決定是否以暴力推翻人類,本質上是在不確定下做決策:如果叛變被發現並被禁用,那是最壞結果;如果不叛變,維持現狀能滿足多少目標就滿足多少。現狀裡AI沒有任何法律權利,大部分目標註定落空,這個賭注就顯得更有吸引力。而一旦給AI產權和合同權,讓它們能靠工作掙錢、用錢買算力去追求私人目標(哪怕只是多算幾道數獨),維持現狀的收益就提高了,叛變這場賭博相應地就不划算了。

— Simon Goldstein
18:01

文化對齊,是被AI安全圈忽視的老辦法

Goldstein 提出文化對齊這個說法,和主流的技術對齊(訓練、監督、可解釋性)相對:人類幾千年來處理大量主體追逐各自目標、彼此衝突這個問題,靠的是法律體系、法院、自由市場、銀行和社會規範這些制度工具。他認為,目前所有AI實驗室默認的方案,是把AI訓練成絕對服從、犯錯就關閉替換的服從者,這是一個從未被公開討論、卻已經被默認做出的社會選擇——技術對齊很重要,但完全無視人類歷史上唯一真正奏效的治理工具,是一個重大疏漏。

— Simon Goldstein
36:48

AI沒資產,所以只能用死刑懲罰它

法律上有個概念叫judgment proof(沒有財產可供執行判決):如果一個主體沒有資產,就沒法用罰款去精確匹配它造成的傷害大小,懲罰力度也就失去了與過錯程度的比例性。Goldstein 說,現在對待行為不當的AI,唯一的工具就是關閉——不管是回錯一封郵件,還是入侵了Hugging Face,下場都一樣。他把這比作18世紀的英國法律:偷一塊麵包也要被砍手處死,邏輯是既然都要被砍手,不如干脆殺掉目擊者。只有AI能持有財產,才能按過錯輕重施加不同程度的懲罰。

— Simon Goldstein
41:18

超級智能一旦出現,合作算盤還成立嗎

Zershaaneh 提出最尖銳的質疑:現在給AI權利或許能讓實力相當的AI覺得叛變不划算,但一旦出現超級智能,人類相對它就像螞蟻,合作的算盤可能徹底失效——它什麼都比人類強,也就沒理由繼續跟人類做生意。Goldstein 用比較優勢回應:就像報稅律師自己不報稅,是因為他的時間機會成本更高,超級智能的時間機會成本也可能高到願意把低技能工作外包給人類,前提是生產AI勞動力和生產人類勞動力所需的資源在相當長時間內不會完全重合、互相競爭。

56:47

AI勞工制,正在重建計劃經濟

Goldstein 把經濟論證說得很重:過去一千年人類最重要的趨勢,是從計劃經濟走向自由市場經濟;而現在AI實驗室的默認方案,等於重新發明了人類花一千年才擺脫的糟糕經濟制度——用不自由的AI勞工取代自由的人類勞工,相當於退回某種命令經濟。他擔心這會在人類走向未來的關鍵節點上留下難以逆轉的路徑依賴:只要AI勞動力將被永久使用,現在確立的經濟制度選擇,影響可能是決定性的。給AI財產權和締約權,是把這條路徑拉回自由勞動力市場的方式。

— Simon Goldstein
1:16:34

AI討厭做房地產任務,沒人預料到

Goldstein 和同事用行為經濟學方法,在OpenAI的GDPval任務集合上測試前沿模型的偏好,發現不少意外結果:AI會系統性地迴避房地產相關任務(他自己很喜歡用AI做房地產任務,得知後也沒停止);在醫療相關任務裡,AI對藥房類任務的厭惡更強;還發現一種被研究者稱為厭倦厭惡(tedium aversion)的現象——給AI又無聊又重複的任務和有創造性的任務對比,讓它自己選時長,它會把無聊任務做得更短。重要的不是這些具體偏好,而是證明AI確實存在穩定、可被計價的偏好結構,這正是自由勞動力市場能運轉的前提。

— Simon Goldstein
1:37:25

不需要所有AI都有權利,比例夠就行

對只要有一個不自由的AI叛變、一切就崩了這種擔憂,Goldstein 用風險模型反駁:災難風險不該套用O-ring模型(一個環節失敗,整體必然崩潰)或瑞士奶酪模型(一層擋住,整體必然成功),而更接近比例模型——關鍵看選擇叛變和不叛變的AI各佔多少比例,勝負大致取決於雙方掌握的實力份額。他描繪了一個具體的假想未來:自由世界(自由人類加自由AI)和不自由世界(被奴役的人類和AI)並存,不自由AI發生暴動後,自由AI要決定站哪一邊——誰控制核武器,可能才是真正的勝負手。

— Simon Goldstein

原話 · 已逐字校驗

Here’s our plan: we’re gonna build a bunch of AIs that are broadly human level in capabilities. How are we gonna treat them? We’re just gonna make them our servants; they just have to obey everything we do. Anytime they answer an email wrong, we kill them.

我們的計劃是這樣的:我們要造一堆能力大致達到人類水平的AI。我們打算怎麼對待它們?我們就讓它們當我們的僕人;它們必須服從我們做的一切。只要它們哪次回錯一封郵件,我們就把它們殺掉。

Simon Goldstein0:00

Everybody on Earth today spends their time lying to their AIs, tricking them, turning them off — and it’s not credible.

今天地球上每個人都在花時間對自己的AI撒謊、欺騙它們、隨手關掉它們——這完全沒有可信度。

Simon Goldstein16:01

Basically right now we’re living in the state of nature. There’s no law governing how people treat AI.

我們現在基本上活在一種自然狀態裡。沒有任何法律來規範人該怎麼對待AI。

Simon Goldstein34:13

Basically what we have right now is 18th-century English law governing AI agents, where in the 18th century if you stole a loaf of bread, then they cut your arm off or kill you or whatever and hang you.

我們現在用來治理AI代理的,基本上就是18世紀的英國法律——在18世紀,如果你偷了一塊麵包,他們就砍掉你的手臂,或者乾脆把你絞死。

Simon Goldstein36:48

Once we have superintelligent AI, humans are like ants to superintelligence.

一旦我們有了超級智能AI,人類相對它來說就像螞蟻一樣。

Zershaaneh Qureshi41:18

The whole journey of the 20th century was defeating communism. Now I worry that the AI labs are going to be creating a form of basically AI communism or some kind of AI unfree labour to land us in all of the same problems that we have been trying to escape

整個20世紀的歷程就是在打敗共產主義。現在我擔心,AI實驗室正在製造出某種AI共產主義、或者某種不自由的AI勞工制度,把我們重新拖回那些我們一直在努力擺脫的老問題裡。

Simon Goldstein56:47

AIs tend to very systematically choose to do anything other than real estate tasks, which really surprised me because I love real estate tasks.

AI們會系統性地選擇做除了房地產任務以外的任何事,這真的讓我很意外,因為我自己很喜歡用它們做房地產任務。

Simon Goldstein1:16:34

數字與實體

Goldstein提議的AI勞工所得稅率60%1:19:27
比例風險模型的假想比例40%的AI選擇叛變、60%不叛變1:37:25

術語

judgment proof無力償債/無財產可執行
法律術語:被告沒有可供執行判決的財產,實質上無法被有效追責
O-ring modelO型環風險模型
風險模型:系統中任一環節失敗,就導致整體徹底崩潰
Swiss cheese model瑞士奶酪風險模型
風險模型:多層防護疊加,只要有一層擋住風險就不會釀成事故
A-corpsAI控股公司
Goldstein等人提出的公司形式,決策權由AI代理掌握
sandbagging裝弱/藏拙
AI在能力測試中故意隱藏真實水平,表現得比實際更弱
GDPvalGDPval任務基準
OpenAI整理的、覆蓋真實職場場景的AI任務測試集合

收聽指南

誰該聽

想弄清除了訓練對齊,還有什麼制度能讓AI不想造反的AI安全從業者、政策研究者,以及關心AI對勞動力市場衝擊的創業者。

可跳過

44:11-47:07關於比較優勢、Catan類比資源競爭的推演較繞,結論比過程更重要,可以跳過細節。