AI 暫停論站不住腳:我們該算的是延遲的代價
把 AI 事故當成網絡安全和控制失敗,而不是超級智能的預兆;真正被忽略的不是末日概率,而是延遲進步讓人類放棄的東西。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
先算延遲的代價,再談安全
Lazzarin 提出 P-abundance(豐裕概率)這個概念,認為當前討論把車放到了馬前面:大家忙著計算末日概率,卻沒人計算延遲進步會讓我們失去什麼。他承認安全是任何行業都必須承擔的責任,但指出現在的對話已經不是常規意義上的安全討論,而是網絡安全擔憂、千禧年式哲學論證和別的東西混在一起,需要拆開看。
— Eddy Lazzarin世界早就有不受對齊約束的超級智能
針對「AI 會變得比全人類更能幹、又不被法律約束、於是消滅人類」這條標準末日論證,Lazzarin 說它是一整條通往天堂的階梯,每一步都是假設。他指出公司和國家就是準超級智能實體,彼此之間沒有任何內建的對齊保證,也沒經過 HR 培訓才成為公司或國家,我們從不把對齊測試當作它們存在的前提。真正起作用的是法律,法律太慢的地方就用密碼學,用實際機制去限制它們。
— Eddy LazzarinHugging Face 事件是控制失敗,不是超級智能
Lazzarin 把 Hugging Face 事件和 gym hacking 事件都歸為網絡安全失敗和控制失敗,不認為是超級智能即將掙脫枷鎖的徵兆。主持人反駁說 Hugging Face 那次看起來不太一樣,Lazzarin 回應說 agent swarm 這個說法本身就預設了模型是邪惡的,Rune 建議改叫 agent fleets 更好。他類比說小孩、script kitties、流氓國家和黑客團體都會幹這種事,我們從不對他們用對齊當解決方案,而是設計更好的控制、更好的網絡安全、更有韌性的系統。
— Eddy Lazzarin可解釋性越強,越不該延遲能力進步
主持人提出 AI 比人類更可解釋、更可操控,因為可以看權重、看連接。Lazzarin 說這讓他非常樂觀,但有兩個推論:一是隨著能力提升,機械可解釋性會比我們想的更好,而能力提升又會帶來更好的可解釋性,所以不應該延遲能力進步;二是必然會出現壞的、不對齊的模型,誰要是說我們能到達一個沒有壞模型的世界,那是在騙你。唯一的應對辦法是更好的模型、好模型。
— Eddy Lazzarin獨立評估者可能只是分布式,不是去中心化
Lazzarin 說他在加密世界學到分布式和去中心化的區別:分布式系統有很多節點,但全在單一行為者控制之下;去中心化意味著沒有單一控制點。他擔心獨立評估者網絡如果全來自同一批社交圈、意識形態相近、去同樣的地方、有同樣的政治和個人觀點,那實際上只是把控制權分散給了一個單一文化單元。他說這正是 20 世紀後半葉的政治控制方式,不是靠一個陰暗房間,而是靠這些網絡。
— Eddy Lazzarin公司自己喊停我,本身就值得懷疑
Lazzarin 指出這個局面之所以奇怪,是因為處在罕見場景裡:公司自己說「我有點不負責任,我有點瘋,攔住我,來人攔住我」。他說這在一些人中間引發了懷疑,而且可能是對的,即便那個群體裡確實有真誠、深思熟慮、判斷正確的一派,他們說的這些系統需要被極其嚴肅對待也是對的。他強調不能把實驗室、SF 技術圈看成鐵板一塊,裡面有真誠的人、有搞政治騙局的人、有機會主義者、也有失去理智的人。
— Eddy Lazzarin對付會撒謊的模型,用重複博弈
主持人提出自由市場責任機制只對缺陷明顯的產品有效,對一個會偽裝對齊、騙過所有對齊基準、部署後才暴露的 AI 無效。Lazzarin 說科幻級的超級智能場景現在極難回答,而且很遙遠;但在更平庸的當下場景裡,想想你怎麼對付一個騙子,一個非常聰明的騙子——人們每天都在做這件事,就是跟他們玩重複博弈,最終發現他們在撒謊,聲譽受損,有時還有法律後果。他說模型也可以有聲譽,可以關掉它們,這是對人做不到的。
— Eddy Lazzarin硅谷的怪想法正在撞上更廣的政治現實
Lazzarin 預測接下來一年 AI 話語會被徹底翻新。他說現在大家這麼興奮、X 上所有人都在談,是因為長期被圈在亞文化裡的古怪想法正在逃逸,撞上更廣泛的政治現實,這既令人興奮又極具變革性。他用《宋飛正傳》裡 George Costanza 崩潰於「世界碰撞」來比喻。主持人說他自己最關心的問題是:AI 安全派、有效利他主義者最終會不會和低水平的反技術民粹主義結盟,Lazzarin 說這個問題極其重大,他自己也在琢磨,希望不會。
— Eddy Lazzarin原話 · 已逐字校驗
I think we're putting the cart before the horse a little bit when we worry about safety, before we worry about what we're leaving on the table and what the costs of delay are.
我覺得我們在擔心安全之前先擔心我們放棄了什麼、延遲的代價是什麼,這有點本末倒置。
Eddy Lazzarin2:03
We don't test the alignment of any entities as a prerequisite for their existence. That's just not the way the world works. Instead, we use laws.
我們不把對齊測試當作任何實體存在的前提。世界不是這樣運轉的。我們用法律。
Eddy Lazzarin4:04
If anybody is going out there and saying, we can end up in a world where there are no bad models, they are lying to you.
如果有人跑出來說,我們能到達一個沒有壞模型的世界,那是在騙你。
Eddy Lazzarin7:07
you can have a distributed system, like a system where you have a single system with many, many nodes, but they're all under the control of a single actor.
你可以有一個分布式系統,一個系統裡有很多很多節點,但它們全都在單一行為者的控制之下。
Eddy Lazzarin12:17
we're in a rare scenario where the companies themselves are saying, I'm being a little bit irresponsible. I'm being a little crazy. Stop me. Someone stop me.
我們處在一個罕見的場景裡:公司自己說,我有點不負責任,我有點瘋,攔住我,來人攔住我。
Eddy Lazzarin14:26
Consider what you do with just a liar. Consider a very smart liar. Do people not do that every day? What we do is we play iterated games with them, right? And we discover eventually that they're a liar and their reputation is harmed.
想想你怎麼對付一個騙子。一個非常聰明的騙子。人們不是每天都在做這件事嗎?我們做的就是跟他們玩重複博弈,最終發現他們在撒謊,他們的聲譽受損。
Eddy Lazzarin17:35
It's like when George Costanza freaks out about worlds colliding. That's what's happening. Worlds are colliding.
就像 George Costanza 為世界碰撞而崩潰那樣。這就是正在發生的事。世界在碰撞。
Eddy Lazzarin25:51
數字與實體
| Data Republican 整理的 EA 相關組織引語數量 | 1,851 條引語 | 21:44 |
術語
- P-abundance豐裕概率
- Lazzarin 提出的概念,指技術進步帶來豐裕的可能性,與 P-doom 相對。
- P-doom末日概率
- AI 安全討論中常被引用的術語,指 AI 導致人類滅絕的概率估計。
- agent swarm智能體集群
- 指多個 AI 智能體協同工作的說法,Lazzarin 認為這個詞預設了模型是邪惡的。
- agent fleets智能體艦隊
- Rune 建議用來替代 agent swarm 的說法,避免暗示惡意。
- mech interpretability機械可解釋性
- 通過查看模型權重和連接來理解模型內部工作機制的方法。
- script kitties腳本小子
- 指使用現成腳本進行黑客攻擊、技術水平較低的人。
收聽指南
關注 AI 監管與安全辯論的創業者、投資人和政策研究者,想了解反暫停陣營完整論證的人。
20:40 到 24:49 關於有效利他主義和蝦福利的討論,與 AI 主線關係較弱。