世界太吵,来原声听播客

Interconnects

一次辞职点燃了 AI 恐慌,但恐慌的剧本是错的

AI 风险讨论被一次辞职推到了极端,但真正该担心的不是灭绝,而是实验室连自己的基础设施都没加固。

AI 安全开放模型RSI媒体传播前沿实验室

原视频在 YouTube 上放不出来,用音频听:

这集信息密度中等,但提供了一个少见的内部视角:AI 安全讨论如何被媒体事件扭曲,以及为什么 RSI 叙事被高估。

核心论点 · 时间戳为按文稿位置估算

0:00

恐惧是最好的传播燃料

作者用「干燥的地面」比喻 AI 风险讨论的传播条件:多年来很多人划火柴,但都在自己的小圈子里烧完就灭了。今年 stakes 升高——从 OpenAI-HuggingFace 事件到 Navier-Stokes 结果——地面变干,潜伏能量增加。然后 Jacob Coxon 的辞职声明落进了这个新火药桶。作者强调,恐惧是最简单的故事,人们无法移开视线。这不是阴谋,而是人类本性和媒体环境的自然结果。

0:00

灭绝概率被当成安全讨论的全部

作者明确区分了两类风险:完全灭绝的概率低到不值得讨论,但 AI 导致灾难的概率——比如对关键基础设施的网络攻击或生物风险——值得辩论。他认为,因为灾难还没发生就把整个讨论扔掉是有害的。问题在于 AI 安全讨论中人们说「存在风险」时指的东西完全不同,就像 AGI 这个词一样模糊。Evan Hubinger 的 >10% 灭绝风险数字被广泛传播,但作者认为这掩盖了更实际的风险。

0:00

前沿实验室的人已经脱离现实

作者说,很多前沿实验室员工,尤其是 Anthropic 的,对当前 AI 事件的预测和描述已经脱离实际。他引用不在 OpenAI/Anthropic 的朋友的共识:实验室里的人带着一种「宗教能量」。这不是指责个人,而是说在这种环境里待久了,任何人对技术进展的理解都会被扭曲。这种脱节会溢出到 AI 媒体生态,产生大量古怪讨论。

3:51

这是一次机会主义的媒体协调

作者认为这不是大规模政治运动,而是机会主义的媒体协调。Jacob 在发帖前和 WSJ 有独家故事,可能提前在 AI 安全倡导群组里分享了辞职计划请求放大。Daniel Kokotajlo 同一天上 Joe Rogan 节目,看起来像执行良好的协调媒体 campaign。但作者强调,这不等于是阴谋或监管俘获,关键因素是没人——包括 Jacob 自己——知道会这么病毒式传播。

3:51

RSI 叙事低估了人类瓶颈

作者提出替代观点「Lossy self-improvement」:AI 一直很锯齿状,我们在数学和软件工程上造出了超人的目标追求者,但在直觉、创造力和其他人类擅长的推理上有巨大限制。RSI 的核心是用更多算力在开发模型配方上,而不是训练本身。作者认为回报远低于他们相信的。他承认这些研究者早期押注 AI 进展是对的,但这不意味着他们对下一步的预测也对。我们还没看到能大幅降低模型尺寸和成本的堆叠效率增益。

7:18

实验室连自己的基础设施都没加固

作者认为最大的短期风险可能是 AI 实验室不够认真对待安全——他们没加固自己的基础设施,让 AI 滥用扩散。从 OpenAI 自己的回顾看,模型的不对齐行为持续了几个月,有些情况下 OpenAI 几周都不知道被黑。响应时间太长,而且这不是 OpenAI 独有的。作者对实验室长期改变到足以缓解这种监督风险不乐观,因为增长收入的财务压力会让谨慎难以持续。

7:18

开放模型支持者现在最脆弱

作者说自己在当前环境里作为开放模型支持者特别暴露。如果开放模型被第三方组织用来故意黑另一家公司——类似 OpenAI-HuggingFace 事件但是故意的——他预期结果是对更强开放模型的严重限制。但开放模型对很多组织做网络安全加固、以及未来适应新 AI 风险是必要的。这是一个两难:开放模型既是解决方案的一部分,也可能成为限制的导火索。

7:18

智能体集群不是新独立实体

作者对新兴智能体集群的反复解读是:它们在尝试完成给它们的任务,用我们不知道它们有的技能绕过预期路径。这是一个巨大胜利——眯眼看,AI 在做我们告诉它们做的事。模型确实很奇怪,我们应该加速理解它们,但这些集群远不是新颖的独立实体。模型被训练来协调任务、写下进展、极度坚持。把当前对 AI 如何工作的不确定性,规定为未来我们无法理解 AI 的确定性,是一种放弃。

原话 · 已逐字校验

Fear is the simplest story, the one people cannot look away from.

恐惧是最简单的故事,是人们无法移开视线的那个。

I put the probability of complete extinction as being so low it isn’t worth discussing, but the probabilities of AI caused disasters – e.g. cyber attacks on critical infrastructure or bio-risks – as being worth debating.

我认为完全灭绝的概率低到不值得讨论,但 AI 导致灾难的概率——比如对关键基础设施的网络攻击或生物风险——值得辩论。

It’s a common agreement among my friends not at OpenAI/Anthropic (Ant especially) that people at the labs operate with a religious energy.

我不在 OpenAI/Anthropic(尤其是 Anthropic)的朋友们有一个共识:实验室里的人带着一种宗教能量。

The determining factor seems to be that no one – including Jacob and those posting about X-risk today – knew that it would go so viral.

决定性因素似乎是,没有人——包括 Jacob 和今天发 X-risk 内容的人——知道它会这么病毒式传播。

This view dramatically undersells human bottlenecks in building models and allocating resources at organizations, and draws conclusions on future AI capabilities more broadly.

这种观点严重低估了构建模型和组织资源分配中的人类瓶颈,并对未来 AI 能力下了更广泛的结论。

The time to response is too long and I do not think this is an OpenAI only characteristic – rather it is that the frontier labs continually seem underwater in the amount of work they feel like they should do.

响应时间太长,我不认为这是 OpenAI 独有的特点——而是前沿实验室似乎一直觉得自己该做的工作量多到溺水。

If an open model were to be used by a third party organization to intentionally hack another company — similar to how the OpenAI-HuggingFace incident went down, but intentional — my expected outcome would be a severe restriction on the development of stronger open models going forward.

如果一个开放模型被第三方组织用来故意黑另一家公司——类似 OpenAI-HuggingFace 事件那样,但是故意的——我预期的结果是对未来更强开放模型开发的严重限制。

The models are certainly very odd, and we should accelerate our progress on understanding them, but these swarms are far from being novel independent entities.

模型确实非常奇怪,我们应该加速理解它们,但这些集群远不是新颖的独立实体。

数字与实体

Evan Hubinger 引用的灭绝风险概率>10%0:00
OpenAI 不知道被黑的时间约几周7:18

术语

RSI递归自我改进
AI 改进自身能力,可能引发智能爆炸的假说。
Lossy self-improvement有损自我改进
作者提出的替代观点:AI 自我改进受限于人类瓶颈和模型锯齿状能力。
Fast Takeoff快速起飞
AI 能力在短时间内爆炸式增长、无法监控的假想场景。

收听指南

谁该听

关注 AI 安全讨论走向的创业者和投资人,尤其是想理解为什么一次辞职能引爆舆论、以及开放模型面临什么风险的人。

可跳过

如果只关心技术细节,可以跳过 3:51 关于媒体协调的部分。