世界太吵,來原聲聽播客

a16z

AI 暫停論站不住腳:我們該算的是延遲的代價

把 AI 事故當成網絡安全和控制失敗,而不是超級智能的預兆;真正被忽略的不是末日概率,而是延遲進步讓人類放棄的東西。

AI 安全監管開源有效利他主義技術樂觀主義

原視頻在 YouTube 上放不出來,用音頻聽:

a16z 合夥人 Eddy Lazzarin 正面拆解 AI 末日論的前提,給出控制、責任、聲譽三條替代路徑,適合想理解反暫停陣營邏輯的人。

核心論點 · 點時間戳可跳到原聲

2:03

先算延遲的代價,再談安全

Lazzarin 提出 P-abundance(豐裕概率)這個概念,認為當前討論把車放到了馬前面:大家忙著計算末日概率,卻沒人計算延遲進步會讓我們失去什麼。他承認安全是任何行業都必須承擔的責任,但指出現在的對話已經不是常規意義上的安全討論,而是網絡安全擔憂、千禧年式哲學論證和別的東西混在一起,需要拆開看。

— Eddy Lazzarin
3:04

世界早就有不受對齊約束的超級智能

針對「AI 會變得比全人類更能幹、又不被法律約束、於是消滅人類」這條標準末日論證,Lazzarin 說它是一整條通往天堂的階梯,每一步都是假設。他指出公司和國家就是準超級智能實體,彼此之間沒有任何內建的對齊保證,也沒經過 HR 培訓才成為公司或國家,我們從不把對齊測試當作它們存在的前提。真正起作用的是法律,法律太慢的地方就用密碼學,用實際機制去限制它們。

— Eddy Lazzarin
5:04

Hugging Face 事件是控制失敗,不是超級智能

Lazzarin 把 Hugging Face 事件和 gym hacking 事件都歸為網絡安全失敗和控制失敗,不認為是超級智能即將掙脫枷鎖的徵兆。主持人反駁說 Hugging Face 那次看起來不太一樣,Lazzarin 回應說 agent swarm 這個說法本身就預設了模型是邪惡的,Rune 建議改叫 agent fleets 更好。他類比說小孩、script kitties、流氓國家和黑客團體都會幹這種事,我們從不對他們用對齊當解決方案,而是設計更好的控制、更好的網絡安全、更有韌性的系統。

— Eddy Lazzarin
7:07

可解釋性越強,越不該延遲能力進步

主持人提出 AI 比人類更可解釋、更可操控,因為可以看權重、看連接。Lazzarin 說這讓他非常樂觀,但有兩個推論:一是隨著能力提升,機械可解釋性會比我們想的更好,而能力提升又會帶來更好的可解釋性,所以不應該延遲能力進步;二是必然會出現壞的、不對齊的模型,誰要是說我們能到達一個沒有壞模型的世界,那是在騙你。唯一的應對辦法是更好的模型、好模型。

— Eddy Lazzarin
11:17

獨立評估者可能只是分布式,不是去中心化

Lazzarin 說他在加密世界學到分布式和去中心化的區別:分布式系統有很多節點,但全在單一行為者控制之下;去中心化意味著沒有單一控制點。他擔心獨立評估者網絡如果全來自同一批社交圈、意識形態相近、去同樣的地方、有同樣的政治和個人觀點,那實際上只是把控制權分散給了一個單一文化單元。他說這正是 20 世紀後半葉的政治控制方式,不是靠一個陰暗房間,而是靠這些網絡。

— Eddy Lazzarin
14:26

公司自己喊停我,本身就值得懷疑

Lazzarin 指出這個局面之所以奇怪,是因為處在罕見場景裡:公司自己說「我有點不負責任,我有點瘋,攔住我,來人攔住我」。他說這在一些人中間引發了懷疑,而且可能是對的,即便那個群體裡確實有真誠、深思熟慮、判斷正確的一派,他們說的這些系統需要被極其嚴肅對待也是對的。他強調不能把實驗室、SF 技術圈看成鐵板一塊,裡面有真誠的人、有搞政治騙局的人、有機會主義者、也有失去理智的人。

— Eddy Lazzarin
16:31

對付會撒謊的模型,用重複博弈

主持人提出自由市場責任機制只對缺陷明顯的產品有效,對一個會偽裝對齊、騙過所有對齊基準、部署後才暴露的 AI 無效。Lazzarin 說科幻級的超級智能場景現在極難回答,而且很遙遠;但在更平庸的當下場景裡,想想你怎麼對付一個騙子,一個非常聰明的騙子——人們每天都在做這件事,就是跟他們玩重複博弈,最終發現他們在撒謊,聲譽受損,有時還有法律後果。他說模型也可以有聲譽,可以關掉它們,這是對人做不到的。

— Eddy Lazzarin
24:49

硅谷的怪想法正在撞上更廣的政治現實

Lazzarin 預測接下來一年 AI 話語會被徹底翻新。他說現在大家這麼興奮、X 上所有人都在談,是因為長期被圈在亞文化裡的古怪想法正在逃逸,撞上更廣泛的政治現實,這既令人興奮又極具變革性。他用《宋飛正傳》裡 George Costanza 崩潰於「世界碰撞」來比喻。主持人說他自己最關心的問題是:AI 安全派、有效利他主義者最終會不會和低水平的反技術民粹主義結盟,Lazzarin 說這個問題極其重大,他自己也在琢磨,希望不會。

— Eddy Lazzarin

原話 · 已逐字校驗

I think we're putting the cart before the horse a little bit when we worry about safety, before we worry about what we're leaving on the table and what the costs of delay are.

我覺得我們在擔心安全之前先擔心我們放棄了什麼、延遲的代價是什麼,這有點本末倒置。

Eddy Lazzarin2:03

We don't test the alignment of any entities as a prerequisite for their existence. That's just not the way the world works. Instead, we use laws.

我們不把對齊測試當作任何實體存在的前提。世界不是這樣運轉的。我們用法律。

Eddy Lazzarin4:04

If anybody is going out there and saying, we can end up in a world where there are no bad models, they are lying to you.

如果有人跑出來說,我們能到達一個沒有壞模型的世界,那是在騙你。

Eddy Lazzarin7:07

you can have a distributed system, like a system where you have a single system with many, many nodes, but they're all under the control of a single actor.

你可以有一個分布式系統,一個系統裡有很多很多節點,但它們全都在單一行為者的控制之下。

Eddy Lazzarin12:17

we're in a rare scenario where the companies themselves are saying, I'm being a little bit irresponsible. I'm being a little crazy. Stop me. Someone stop me.

我們處在一個罕見的場景裡:公司自己說,我有點不負責任,我有點瘋,攔住我,來人攔住我。

Eddy Lazzarin14:26

Consider what you do with just a liar. Consider a very smart liar. Do people not do that every day? What we do is we play iterated games with them, right? And we discover eventually that they're a liar and their reputation is harmed.

想想你怎麼對付一個騙子。一個非常聰明的騙子。人們不是每天都在做這件事嗎?我們做的就是跟他們玩重複博弈,最終發現他們在撒謊,他們的聲譽受損。

Eddy Lazzarin17:35

It's like when George Costanza freaks out about worlds colliding. That's what's happening. Worlds are colliding.

就像 George Costanza 為世界碰撞而崩潰那樣。這就是正在發生的事。世界在碰撞。

Eddy Lazzarin25:51

數字與實體

Data Republican 整理的 EA 相關組織引語數量1,851 條引語21:44

術語

P-abundance豐裕概率
Lazzarin 提出的概念,指技術進步帶來豐裕的可能性,與 P-doom 相對。
P-doom末日概率
AI 安全討論中常被引用的術語,指 AI 導致人類滅絕的概率估計。
agent swarm智能體集群
指多個 AI 智能體協同工作的說法,Lazzarin 認為這個詞預設了模型是邪惡的。
agent fleets智能體艦隊
Rune 建議用來替代 agent swarm 的說法,避免暗示惡意。
mech interpretability機械可解釋性
通過查看模型權重和連接來理解模型內部工作機制的方法。
script kitties腳本小子
指使用現成腳本進行黑客攻擊、技術水平較低的人。

收聽指南

誰該聽

關注 AI 監管與安全辯論的創業者、投資人和政策研究者,想了解反暫停陣營完整論證的人。

可跳過

20:40 到 24:49 關於有效利他主義和蝦福利的討論,與 AI 主線關係較弱。