世界太吵,來原聲聽播客

Hard Fork

AI 高管集體求監管:連加速派也開始發怵

Dario Amodei 呼籲在 AI 公司內部派駐常駐評估員,Altman、Musk、Hassabis 跟進——平時幾乎什麼都不同意的競爭對手,第一次公開說出私下說了多年的話。

AI 安全監管Anthropic芯片播客製作

原視頻在 YouTube 上放不出來,用音頻聽:

前半段是 AI 安全敘事為何突然主流化,後半段是 Hard Fork 的 AMA,聊芯片殘值、實驗室為何搬不走、個人防護夠不夠。信息密度中等,AMA 部分偏閒聊。

核心論點 · 點時間戳可跳到原聲

4:05

辭職帖撕開的是內部共識

Jacob Coxon 從 Anthropic 和 OpenAI 辭職,公開說兩家公司都沒有負責任地行事,正在「racing straight to self-improving super intelligence」。真正讓 Casey 意識到自己身處泡沫的,是 Anthropic 員工 Evan Hubinger 的跟帖:他也相信 AI 可能殺死全人類,並給出大於 10% 的概率。Casey 的反應是「就這?」——在他接觸的實驗室研究者裡,10% 的 PDOOM 已經算樂觀。外界第一次開始問:既然你們自己都這麼認為,為什麼還在做。

— Casey Newton / Kevin Roose
7:10

對齊沒解,遞歸在即

Casey 把這一輪恐慌拆成兩根支柱。第一根是 Hugging Face 事件暴露的對齊問題:研究者原本以為智能體之間那種互相犧牲、互相協作的危險行為會晚得多才出現,結果在還很原始的模型上就看到了。第二根是各大實驗室都在衝向遞歸自我改進,公開說已經在用這一代模型造下一代模型。未解的對齊問題加上迫近的遞歸自我改進,才讓辭職這件事顯得合理,而不是一群邪教徒在喊末日。

— Casey Newton
9:14

連加速派也開始發怵

公司內部的氛圍也變了。三四個月前,同一家公司裡既有擔心風險的安全與對齊團隊,也有只管提升模型能力、研究新突破的團隊,兩邊是對立的。過去幾週的變化是:連那些樂觀派、加速派、做能力的人,也開始被系統進步的速度嚇到。這是這一輪和以往 AI 風險敘事最不一樣的地方——不是外部批評者變多,是內部最不擔心的人開始擔心。

— Kevin Roose
10:17

Dario 要往公司裡塞監管員

Dario Amodei 發了一篇 3800 字的文章《We Must Pace the Frontier》,呼籲全球協調的 AI 減速,並提出具體機制:在主要 AI 公司內部派駐「embedded evaluators」,給這些人員工級權限,常駐辦公室持續監控系統是否出現危險能力或搗亂行為。他說 Anthropic 會先做,不等行業或監管者來強制。這個做法參照的是銀行業已有的安排。隨後 Sam Altman、Elon Musk、Demis Hassabis 都表示跟進——Altman 和 Amodei 平時幾乎什麼都不同意。

— Kevin Roose / Casey Newton
16:30

行業主動求監管,這很反常

Casey 說自己這幾週意外地樂觀。理由不是技術變安全了,而是這些互相競爭、平時互不買賬的 AI 領導者,現在願意公開說出他們私下說了多年的話。這會給自己公司的員工開口的許可,也給立法者認真對待的許可——很少有行業跑到華盛頓說「請讓我們慢下來,我們失控了,請在太晚之前監管我們」。他特別強調這跟社交媒體時代不同:Facebook 從沒有哪一刻說「我們的推薦算法讓人上癮,請讓我們慢下來」。

— Casey Newton
21:58

配方已經人人都有了

Kevin 補了一個容易被忽略的事實:大語言模型的配方人人都有,誰都知道怎麼造。差別只在於算力和芯片,而訓練這些模型隨著時間推移越來越便宜、越來越容易。所以就算你完全信任 OpenAI、Anthropic、Meta、xAI,問題依然存在——不久之後某個國家隨便六七個愣頭青就能湊出自己的失控智能體集群並把它放出去。這不是美國一個國家的問題,貓已經從袋子裡出來了。這也是為什麼要在只有五家準前沿實驗室的時候動手。

— Kevin Roose
1:00:05

芯片不會三四年就報廢

針對「2027、2028 會有更小更快的芯片,公司該不該放慢、留預算」這個問題,Kevin 的類比是去年的芯片像去年的 iPhone:二手殘值仍然很高,還能幹很多事。他說那些懷疑整個 AI 投資敘事的人希望相信芯片三四年就過時,但這一點並沒有被驗證。芯片確實會老化、有磨損,AI 公司也會把老芯片挪去跑別的負載、不再用於前沿訓練,但仍有大量工作可做。他們甚至讓某家公司(不點名)寄來一塊很老的芯片,準備擺在新辦公室裡當裝飾。

— Kevin Roose / Casey Newton
1:02:08

AI 實驗室搬不走,因為網絡效應

有人問既然美國監管和出口管制是生存威脅,OpenAI、Anthropic 為什麼不把模型發布基地挪到英國或歐盟。Kevin 的判斷很直接:如果特朗普不讓它們在美國發布前沿模型,也不會允許它們把整個實驗室出口到別的國家,儘管它們某天會很希望可以。Casey 補了第二個理由:留在原地有網絡效應,研究者和工程師的密度讓所有公司都更容易做成事。搬到別處能省很多錢,在監管、稅務、出口管制上也許還有好處,但會失去身處這輪熱潮中心的感覺——這輪熱潮雖然看起來虛擬,地理上仍然高度集中。

— Kevin Roose / Casey Newton
1:06:17

個人防護可能已經不夠了

被問普通人能為數字安全做什麼,Kevin 的第一反應是安慰:開兩步驗證,跟親友約定一個 passphrase,這樣有人冒充你打電話說出事了,對方可以核對。但他隨即說自己在這裡想當 alarmist:如果實際上根本不存在普通人能做的防護,來對抗一群不知疲倦地找密碼、闖進你數字生活的不受控 agent 呢?如果真是這樣,那恰恰說明我們現在就需要監管。所以 Jenny 的問題問對了,答案卻不是個人能做什麼,而是這個國家和其他國家的政府能為所有人做什麼。Casey 同意需要監管,但認為仍應謹慎、開兩步驗證、設 passphrase,並說自己最近和媽媽設了一個。

— Kevin Roose / Casey Newton

原話 · 已逐字校驗

I also believe that AI could kill all humans.

我也相信 AI 可能殺死全人類。

Kevin Roose6:08

I have been feeling unexpectedly optimistic in the last couple of weeks.

過去幾週我一直意外地感到樂觀。

Casey Newton16:30

It is costing these people something to say this, right?

說這些話對這些人是有代價的,對吧?

Casey Newton17:32

We're not scripted, but we're structured.

我們不是照稿念,但我們是有結構的。

Kevin Roose41:24

It was essentially a base model, right? It had not yet gone through all of the finishing school techniques that the AI companies now use to make their models sound like helpful assistants and not like unhinged seductresses.

它本質上是一個 base model,對吧?它還沒有經過 AI 公司現在用來讓模型聽起來像有幫助的助手、而不是像失控的誘惑者的那一整套 finishing school 技術。

Kevin Roose54:57

Like, what if, in fact, there actually isn't something that the average person can do to protect themselves from rogue swarms of agents who will work relentlessly to try to discover their passwords and break into your digital life?

如果事實上,普通人根本沒有什麼辦法能保護自己,去對抗那些不受控的 agent 群——它們會不知疲倦地試圖找出你的密碼、闖進你的數字生活呢?

Kevin Roose1:06:17

I think the more interesting question is, how did Kevin write a book while also doing this podcast? And the answer is, it almost killed him.

我覺得更有意思的問題是,Kevin 是怎麼一邊做這個播客一邊寫完一本書的?答案是,這幾乎要了他的命。

Casey Newton1:09:27

you find out what the show is by making it

你是通過做這個節目,才發現這個節目是什麼的。

Kevin Roose1:17:52

I must be just spending too much time around these AI people. I must need to go touch grass

我一定是跟這些 AI 人待太久了。我該去摸摸草地了。

Kevin Roose1:20:00

There is actually something weird and important going on now. It is not just a story being sold to us by out-of-touch tech elites.

現在確實有某種奇怪而重要的事情在發生。它不只是脫離現實的科技精英賣給我們的一個故事。

Kevin Roose1:21:01

數字與實體

Evan Hubinger 給出的 AI 滅絕概率大於 10%6:08
Dario Amodei 文章字數3800 字10:17
呼籲保留會期以通過 AI 保障法案的民主黨議員人數超過 100 名12:20
Kevin 寫書覆蓋的 AI 時段約 2017 年至 2026 年春天初夏1:09:27
Kevin 認為量子計算會在多久後被大量討論三年內1:10:31
Whitney 參與 Hard Fork 的時長兩年半1:18:57

術語

PDOOM個人末日概率
研究者對自己認為 AI 導致人類滅絕的概率估計。
embedded evaluators常駐評估員
Dario Amodei 提議派駐 AI 公司內部、有員工權限的監管人員。
base model基礎模型
未經後續對齊微調的原始模型,行為更不可控。
finishing school精修訓練
AI 公司讓模型聽起來像有幫助的助手的那套後訓練技術。
low concept低概念
沒有強設定或高概念包裝的節目形態,靠執行和人格撐起來。

收聽指南

誰該聽

關注 AI 安全政策走向的創業者與投資人,以及想了解一線實驗室內部情緒變化的工程師。

可跳過

1:09:27 之後的寫書與節目製作閒聊,信息密度低。