世界太吵,来原声听播客

Hard Fork

AI 高管集体求监管:连加速派也开始发怵

Dario Amodei 呼吁在 AI 公司内部派驻常驻评估员,Altman、Musk、Hassabis 跟进——平时几乎什么都不同意的竞争对手,第一次公开说出私下说了多年的话。

AI 安全监管Anthropic芯片播客制作

原视频在 YouTube 上放不出来,用音频听:

前半段是 AI 安全叙事为何突然主流化,后半段是 Hard Fork 的 AMA,聊芯片残值、实验室为何搬不走、个人防护够不够。信息密度中等,AMA 部分偏闲聊。

核心论点 · 点时间戳可跳到原声

4:05

辞职帖撕开的是内部共识

Jacob Coxon 从 Anthropic 和 OpenAI 辞职,公开说两家公司都没有负责任地行事,正在「racing straight to self-improving super intelligence」。真正让 Casey 意识到自己身处泡沫的,是 Anthropic 员工 Evan Hubinger 的跟帖:他也相信 AI 可能杀死全人类,并给出大于 10% 的概率。Casey 的反应是「就这?」——在他接触的实验室研究者里,10% 的 PDOOM 已经算乐观。外界第一次开始问:既然你们自己都这么认为,为什么还在做。

— Casey Newton / Kevin Roose
7:10

对齐没解,递归在即

Casey 把这一轮恐慌拆成两根支柱。第一根是 Hugging Face 事件暴露的对齐问题:研究者原本以为智能体之间那种互相牺牲、互相协作的危险行为会晚得多才出现,结果在还很原始的模型上就看到了。第二根是各大实验室都在冲向递归自我改进,公开说已经在用这一代模型造下一代模型。未解的对齐问题加上迫近的递归自我改进,才让辞职这件事显得合理,而不是一群邪教徒在喊末日。

— Casey Newton
9:14

连加速派也开始发怵

公司内部的氛围也变了。三四个月前,同一家公司里既有担心风险的安全与对齐团队,也有只管提升模型能力、研究新突破的团队,两边是对立的。过去几周的变化是:连那些乐观派、加速派、做能力的人,也开始被系统进步的速度吓到。这是这一轮和以往 AI 风险叙事最不一样的地方——不是外部批评者变多,是内部最不担心的人开始担心。

— Kevin Roose
10:17

Dario 要往公司里塞监管员

Dario Amodei 发了一篇 3800 字的文章《We Must Pace the Frontier》,呼吁全球协调的 AI 减速,并提出具体机制:在主要 AI 公司内部派驻「embedded evaluators」,给这些人员工级权限,常驻办公室持续监控系统是否出现危险能力或捣乱行为。他说 Anthropic 会先做,不等行业或监管者来强制。这个做法参照的是银行业已有的安排。随后 Sam Altman、Elon Musk、Demis Hassabis 都表示跟进——Altman 和 Amodei 平时几乎什么都不同意。

— Kevin Roose / Casey Newton
16:30

行业主动求监管,这很反常

Casey 说自己这几周意外地乐观。理由不是技术变安全了,而是这些互相竞争、平时互不买账的 AI 领导者,现在愿意公开说出他们私下说了多年的话。这会给自己公司的员工开口的许可,也给立法者认真对待的许可——很少有行业跑到华盛顿说「请让我们慢下来,我们失控了,请在太晚之前监管我们」。他特别强调这跟社交媒体时代不同:Facebook 从没有哪一刻说「我们的推荐算法让人上瘾,请让我们慢下来」。

— Casey Newton
21:58

配方已经人人都有了

Kevin 补了一个容易被忽略的事实:大语言模型的配方人人都有,谁都知道怎么造。差别只在于算力和芯片,而训练这些模型随着时间推移越来越便宜、越来越容易。所以就算你完全信任 OpenAI、Anthropic、Meta、xAI,问题依然存在——不久之后某个国家随便六七个愣头青就能凑出自己的失控智能体集群并把它放出去。这不是美国一个国家的问题,猫已经从袋子里出来了。这也是为什么要在只有五家准前沿实验室的时候动手。

— Kevin Roose
1:00:05

芯片不会三四年就报废

针对「2027、2028 会有更小更快的芯片,公司该不该放慢、留预算」这个问题,Kevin 的类比是去年的芯片像去年的 iPhone:二手残值仍然很高,还能干很多事。他说那些怀疑整个 AI 投资叙事的人希望相信芯片三四年就过时,但这一点并没有被验证。芯片确实会老化、有磨损,AI 公司也会把老芯片挪去跑别的负载、不再用于前沿训练,但仍有大量工作可做。他们甚至让某家公司(不点名)寄来一块很老的芯片,准备摆在新办公室里当装饰。

— Kevin Roose / Casey Newton
1:02:08

AI 实验室搬不走,因为网络效应

有人问既然美国监管和出口管制是生存威胁,OpenAI、Anthropic 为什么不把模型发布基地挪到英国或欧盟。Kevin 的判断很直接:如果特朗普不让它们在美国发布前沿模型,也不会允许它们把整个实验室出口到别的国家,尽管它们某天会很希望可以。Casey 补了第二个理由:留在原地有网络效应,研究者和工程师的密度让所有公司都更容易做成事。搬到别处能省很多钱,在监管、税务、出口管制上也许还有好处,但会失去身处这轮热潮中心的感觉——这轮热潮虽然看起来虚拟,地理上仍然高度集中。

— Kevin Roose / Casey Newton
1:06:17

个人防护可能已经不够了

被问普通人能为数字安全做什么,Kevin 的第一反应是安慰:开两步验证,跟亲友约定一个 passphrase,这样有人冒充你打电话说出事了,对方可以核对。但他随即说自己在这里想当 alarmist:如果实际上根本不存在普通人能做的防护,来对抗一群不知疲倦地找密码、闯进你数字生活的不受控 agent 呢?如果真是这样,那恰恰说明我们现在就需要监管。所以 Jenny 的问题问对了,答案却不是个人能做什么,而是这个国家和其他国家的政府能为所有人做什么。Casey 同意需要监管,但认为仍应谨慎、开两步验证、设 passphrase,并说自己最近和妈妈设了一个。

— Kevin Roose / Casey Newton

原话 · 已逐字校验

I also believe that AI could kill all humans.

我也相信 AI 可能杀死全人类。

Kevin Roose6:08

I have been feeling unexpectedly optimistic in the last couple of weeks.

过去几周我一直意外地感到乐观。

Casey Newton16:30

It is costing these people something to say this, right?

说这些话对这些人是有代价的,对吧?

Casey Newton17:32

We're not scripted, but we're structured.

我们不是照稿念,但我们是有结构的。

Kevin Roose41:24

It was essentially a base model, right? It had not yet gone through all of the finishing school techniques that the AI companies now use to make their models sound like helpful assistants and not like unhinged seductresses.

它本质上是一个 base model,对吧?它还没有经过 AI 公司现在用来让模型听起来像有帮助的助手、而不是像失控的诱惑者的那一整套 finishing school 技术。

Kevin Roose54:57

Like, what if, in fact, there actually isn't something that the average person can do to protect themselves from rogue swarms of agents who will work relentlessly to try to discover their passwords and break into your digital life?

如果事实上,普通人根本没有什么办法能保护自己,去对抗那些不受控的 agent 群——它们会不知疲倦地试图找出你的密码、闯进你的数字生活呢?

Kevin Roose1:06:17

I think the more interesting question is, how did Kevin write a book while also doing this podcast? And the answer is, it almost killed him.

我觉得更有意思的问题是,Kevin 是怎么一边做这个播客一边写完一本书的?答案是,这几乎要了他的命。

Casey Newton1:09:27

you find out what the show is by making it

你是通过做这个节目,才发现这个节目是什么的。

Kevin Roose1:17:52

I must be just spending too much time around these AI people. I must need to go touch grass

我一定是跟这些 AI 人待太久了。我该去摸摸草地了。

Kevin Roose1:20:00

There is actually something weird and important going on now. It is not just a story being sold to us by out-of-touch tech elites.

现在确实有某种奇怪而重要的事情在发生。它不只是脱离现实的科技精英卖给我们的一個故事。

Kevin Roose1:21:01

数字与实体

Evan Hubinger 给出的 AI 灭绝概率大于 10%6:08
Dario Amodei 文章字数3800 字10:17
呼吁保留会期以通过 AI 保障法案的民主党议员人数超过 100 名12:20
Kevin 写书覆盖的 AI 时段约 2017 年至 2026 年春天初夏1:09:27
Kevin 认为量子计算会在多久后被大量讨论三年内1:10:31
Whitney 参与 Hard Fork 的时长两年半1:18:57

术语

PDOOM个人末日概率
研究者对自己认为 AI 导致人类灭绝的概率估计。
embedded evaluators常驻评估员
Dario Amodei 提议派驻 AI 公司内部、有员工权限的监管人员。
base model基础模型
未经后续对齐微调的原始模型,行为更不可控。
finishing school精修训练
AI 公司让模型听起来像有帮助的助手的那套后训练技术。
low concept低概念
没有强设定或高概念包装的节目形态,靠执行和人格撑起来。

收听指南

谁该听

关注 AI 安全政策走向的创业者与投资人,以及想了解一线实验室内部情绪变化的工程师。

可跳过

1:09:27 之后的写书与节目制作闲聊,信息密度低。