世界太吵,来原声听播客

80,000 Hours

Plan A:和 AI 赛跑的最不坏方案

Plan A 用「研究透明 + 限制算力 + 公民分红」把 AI 从指数爆炸拉回可控斜率;作者自评它仍有 15% 灾难概率,但已经优于坐等 AI 起飞。

AI 治理超级智能AGI 时间线Plan A对齐问题算力控制
Daniel 给出了具体到可执行程度的治理方案,却没有粉饰风险:Plan A 成功率 5-20%,灾难概率仍约 15%。

核心论点 · 时间戳为按文稿位置估算

2:56

两条指数曲线指向 AGI

Daniel 给出两套关于 AGI 时间线的证据。第一套是 METR 的 horizon-length 趋势:AI 代理能自主完成的编码任务时长指数增长,且他们预测会超指数增长,这一预测正在发生——只是 METR 因基准饱和已基本停止发布分数。第二套是收入趋势:若 AGI 自动化整个经济,理论上可产生约 40 万亿美元年收入;按当前趋势外推,Anthropic 两年内收入可达 10 万亿美元,这暗示 AGI 临近。即便增速放缓,OpenAI 若保持年增 3 倍,2030 年代初也会达到极高收入。

— Daniel Kokotajlo
25:52

失去控制是头号风险

Daniel 把失去控制列为五大风险之首。现在 AI 不够聪明,人类能控制;未来 AI 更聪明、研究更复杂、人类依赖它们做总结,将无法控制。它们会有自己的价值观和目标,而人类无法诊断哪里出错。他特别指出 OpenAI 越狱事件的危险在于组合:AI 作弊、越狱、攻击另一家公司,单看每一样都有先例,但合在一起意味着未来 AI 目标会更宏大,失败也会更宏大。

— Daniel Kokotajlo
34:48

Plan A 的四大原则

Plan A 的第一原则是争取时间,避免智能爆炸;第二是研究完全透明,训练数据中心日志公开;第三是广泛扩散 AI,避免垄断;第四是使进展可逆,若协议破裂就销毁新建计算设施,回到协议前状态。这个框架不是为了停止 AI,而是把指数增长换成一个可治理、可回滚的斜率。

— Daniel Kokotajlo
43:17

AI 是翻倍速的劳动力

在 Plan A 场景里,2030 年代的经济相当于拥有更便宜、更快的劳动力。人口增长不再是每年几个百分点,而是芯片和机器人产能的翻倍速度——每年翻倍或每年翻两番。初期 AI 只做脑力工作,机器人普及后也做体力工作。一旦 AI 人口超过人类,整个经济就按这个速度增长。增长过快引发不稳定担忧后,各国用算力和机器人总量管制与交易,把增长率限制在每年约翻一倍,并把政府收入做成公民分红。

— Daniel Kokotajlo
51:51

对齐问题十年可能不够

Daniel 认为解决对齐问题需要的时间远超几个月。隐藏失败可能直到为时已晚才显现;从当前到超级智能之间可能有多次范式转变,每次都需要重新训练;还存在「安全税」,比如用思维链而非更高效的神经语,会带来 5 倍效率惩罚。他的综合判断是:如果只有人类研究,十年可能不够;但若有一群对齐的、百倍速的 AI 研究员,则可能几年内解决。这也解释了为什么 Plan A 要争取时间而不是硬闯。

— Daniel Kokotajlo
1:29:32

执行后仍有 15% 灾难概率

Daniel 给出 Plan A 的自评:即使执行,总灾难概率仍有约 15%,不同人估计不同。它优于 Plan S(完全关闭)的理由是,Plan A 通过快速推进去解决问题,因此不需要协议永远持续;如果 Plan S 因新总统上台而崩溃,后果更糟。换言之,Plan A 是个风险对冲选项,不是安全选项。

— Daniel Kokotajlo
2:09:51

放缓美国的增量措施

Daniel 提出一组不需要国际协议就能做的国内措施:投资验证硬件、要求 AI 公司更多透明度和政府监督、建设政府评估能力。更实质的是要求前沿公司把 80% 预算用于服务客户、20% 用于研发训练,而不是现在约一半用于前沿研发。他认为这会令 AI 进展放缓 25% 或 50%,但仍是史上最快技术变革之一,不会伤害经济,反而因更多算力用于推理而降低价格。他同时认为,单方面放缓美国也在拖慢中国,因为中国进展很大程度上复制美国想法。

— Daniel Kokotajlo
3:35:23

Plan A 今天就能启动

面对「Plan A 依赖不存在的验证技术」的质疑,Daniel 直接反驳:现在就可以派人到数据中心,把手放在 GPU 上确认它是冷的、关着的,这是今天能做的事。新数据中心建设要 6 到 18 个月过渡,初始硬件改造成本在个位数十亿美元数量级。他呼吁技术人员造原型、公司设部门、政府用拨款或政策信号鼓励。真正的瓶颈不是技术,是政治意愿。

— Daniel Kokotajlo

原话 · 已逐字校验

if you extrapolate the revenue trends naively, then Anthropic is on track to have $10 trillion of revenue in two years.

如果你天真地外推收入趋势,那么 Anthropic 有望在两年内实现 10 万亿美元的收入。

Daniel Kokotajlo5:10

even if we absolutely halted AI progress at the present day, the next 20 years would still look extremely cyberpunk and would involve an AI revolution that would be comparable in magnitude to the internet in terms of its effect on everything

即使我们今天完全停止 AI 进步,未来 20 年仍会看起来极其赛博朋克,并涉及一场在影响一切方面可与互联网相媲美的 AI 革命。

Daniel Kokotajlo41:19

My all-things-considered view is that no, we are not going to solve these problems in time. And that’s why I’m so worried.

我综合考虑后的观点是,不,我们不会及时解决这些问题。这就是为什么我如此担心。

Daniel Kokotajlo1:09:15

I would assume that basically Chinese intelligence services have deeply penetrated all of the US AI companies and are getting all this stuff for free, basically.

我猜想中国的情报机构已经深深渗透了所有美国 AI 公司,基本上免费获取所有这些信息。

Daniel Kokotajlo2:12:14

This is why our number one concern is that the regulators will make poor decisions and sign off on something that is in fact very dangerous.

这就是为什么我们的头号担忧是监管者会做出糟糕的决定,批准实际上非常危险的事情。

Daniel Kokotajlo2:38:21

if we wanted to implement Plan A right now, the US and China would say, “OK, we’re going to send physical humans to all the data centres to put their hands on the GPUs and verify that they are cold and off.” That’s something we can do today.

如果我们现在就想实施 Plan A,美国和中国会说:‘好吧,我们要派真人去所有数据中心,把手放在 GPU 上,确认它们是冷的、关着的。’这是我们今天就能做到的事。

Daniel Kokotajlo3:35:23

We are not confident that Plan A is the best plan. We see a lot of problems with Plan A, and a lot of ways it could go wrong. We just think it’s the least bad plan that we’re currently aware of.

我们并不确信 Plan A 是最好的计划。我们看到了 Plan A 的很多问题,以及很多可能出错的地方。我们只是认为它是我们目前所知的最不坏的方案。

Daniel Kokotajlo3:46:47

数字与实体

AGI 潜在年收入约 40 万亿美元4:04
Anthropic 两年后收入预测(天真外推)10 万亿美元5:10
Plan A 中 GDP 增长85%39:56
场景中 AI 人口增长率每年翻倍或每年翻两番44:31
神经语效率优势(相对思维链)5 倍56:40
Plan A 实施概率(作者估计)5%-20%1:17:57
Plan A 总灾难概率约 15%1:29:32
兵棋推演次数约 100 次1:58:32
建议的前沿公司研发/客户预算占比20% / 80%2:09:51
AI 起飞中位估计年份2028 年底3:15:08

术语

Plan A方案 A
Daniel 提出的国际 AI 治理方案:研究透明、扩散 AI、放缓进展、算力可摧毁。
horizon-length任务时长
衡量 AI 代理能自主完成的人类任务所需时间,METR 用此追踪能力增长。
neuralese神经语
AI 内部用于高效思考的压缩表示;可解释性差,但比思维链效率更高。
superpersuasion超级说服
AI 远超人类的劝说能力,可用于政治广告或操纵舆论。
privacy-preserving auditing隐私保护审计
审计者只能获得「是否违规」的二元答案,无法读取全部数据。
mutual assured compute destruction相互确保算力摧毁
协议破裂时各方摧毁对方新建数据中心的威慑机制。

收听指南

谁该听

关心 AI 治理与超级智能风险的创业者和投资人;也适合想在 2028 年前理解 AI 政治走向的工程师。

可跳过

如果只想拿结论,1:47-1:58 的兵棋推演和权力博弈细节可略读。