世界太吵,来原声听播客

a16z

AI 暂停论站不住脚:我们该算的是延迟的代价

把 AI 事故当成网络安全和控制失败,而不是超级智能的预兆;真正被忽略的不是末日概率,而是延迟进步让人类放弃的东西。

AI 安全监管开源有效利他主义技术乐观主义

原视频在 YouTube 上放不出来,用音频听:

a16z 合伙人 Eddy Lazzarin 正面拆解 AI 末日论的前提,给出控制、责任、声誉三条替代路径,适合想理解反暂停阵营逻辑的人。

核心论点 · 点时间戳可跳到原声

2:03

先算延迟的代价,再谈安全

Lazzarin 提出 P-abundance(丰裕概率)这个概念,认为当前讨论把车放到了马前面:大家忙着计算末日概率,却没人计算延迟进步会让我们失去什么。他承认安全是任何行业都必须承担的责任,但指出现在的对话已经不是常规意义上的安全讨论,而是网络安全担忧、千禧年式哲学论证和别的东西混在一起,需要拆开看。

— Eddy Lazzarin
3:04

世界早就有不受对齐约束的超级智能

针对「AI 会变得比全人类更能干、又不被法律约束、于是消灭人类」这条标准末日论证,Lazzarin 说它是一整条通往天堂的阶梯,每一步都是假设。他指出公司和国家就是准超级智能实体,彼此之间没有任何内建的对齐保证,也没经过 HR 培训才成为公司或国家,我们从不把对齐测试当作它们存在的前提。真正起作用的是法律,法律太慢的地方就用密码学,用实际机制去限制它们。

— Eddy Lazzarin
5:04

Hugging Face 事件是控制失败,不是超级智能

Lazzarin 把 Hugging Face 事件和 gym hacking 事件都归为网络安全失败和控制失败,不认为是超级智能即将挣脱枷锁的征兆。主持人反驳说 Hugging Face 那次看起来不太一样,Lazzarin 回应说 agent swarm 这个说法本身就预设了模型是邪恶的,Rune 建议改叫 agent fleets 更好。他类比说小孩、script kitties、流氓国家和黑客团体都会干这种事,我们从不对他们用对齐当解决方案,而是设计更好的控制、更好的网络安全、更有韧性的系统。

— Eddy Lazzarin
7:07

可解释性越强,越不该延迟能力进步

主持人提出 AI 比人类更可解释、更可操控,因为可以看权重、看连接。Lazzarin 说这让他非常乐观,但有两个推论:一是随着能力提升,机械可解释性会比我们想的更好,而能力提升又会带来更好的可解释性,所以不应该延迟能力进步;二是必然会出现坏的、不对齐的模型,谁要是说我们能到达一个没有坏模型的世界,那是在骗你。唯一的应对办法是更好的模型、好模型。

— Eddy Lazzarin
11:17

独立评估者可能只是分布式,不是去中心化

Lazzarin 说他在加密世界学到分布式和去中心化的区别:分布式系统有很多节点,但全在单一行为者控制之下;去中心化意味着没有单一控制点。他担心独立评估者网络如果全来自同一批社交圈、意识形态相近、去同样的地方、有同样的政治和个人观点,那实际上只是把控制权分散给了一个单一文化单元。他说这正是 20 世纪后半叶的政治控制方式,不是靠一个阴暗房间,而是靠这些网络。

— Eddy Lazzarin
14:26

公司自己喊停我,本身就值得怀疑

Lazzarin 指出这个局面之所以奇怪,是因为处在罕见场景里:公司自己说「我有点不负责任,我有点疯,拦住我,来人拦住我」。他说这在一些人中间引发了怀疑,而且可能是对的,即便那个群体里确实有真诚、深思熟虑、判断正确的一派,他们说的这些系统需要被极其严肃对待也是对的。他强调不能把实验室、SF 技术圈看成铁板一块,里面有真诚的人、有搞政治骗局的人、有机会主义者、也有失去理智的人。

— Eddy Lazzarin
16:31

对付会撒谎的模型,用重复博弈

主持人提出自由市场责任机制只对缺陷明显的产品有效,对一个会伪装对齐、骗过所有对齐基准、部署后才暴露的 AI 无效。Lazzarin 说科幻级的超级智能场景现在极难回答,而且很遥远;但在更平庸的当下场景里,想想你怎么对付一个骗子,一个非常聪明的骗子——人们每天都在做这件事,就是跟他们玩重复博弈,最终发现他们在撒谎,声誉受损,有时还有法律后果。他说模型也可以有声誉,可以关掉它们,这是对人做不到的。

— Eddy Lazzarin
24:49

硅谷的怪想法正在撞上更广的政治现实

Lazzarin 预测接下来一年 AI 话语会被彻底翻新。他说现在大家这么兴奋、X 上所有人都在谈,是因为长期被圈在亚文化里的古怪想法正在逃逸,撞上更广泛的政治现实,这既令人兴奋又极具变革性。他用《宋飞正传》里 George Costanza 崩溃于「世界碰撞」来比喻。主持人说他自己最关心的问题是:AI 安全派、有效利他主义者最终会不会和低水平的反技术民粹主义结盟,Lazzarin 说这个问题极其重大,他自己也在琢磨,希望不会。

— Eddy Lazzarin

原话 · 已逐字校验

I think we're putting the cart before the horse a little bit when we worry about safety, before we worry about what we're leaving on the table and what the costs of delay are.

我觉得我们在担心安全之前先担心我们放弃了什么、延迟的代价是什么,这有点本末倒置。

Eddy Lazzarin2:03

We don't test the alignment of any entities as a prerequisite for their existence. That's just not the way the world works. Instead, we use laws.

我们不把对齐测试当作任何实体存在的前提。世界不是这样运转的。我们用法律。

Eddy Lazzarin4:04

If anybody is going out there and saying, we can end up in a world where there are no bad models, they are lying to you.

如果有人跑出来说,我们能到达一个没有坏模型的世界,那是在骗你。

Eddy Lazzarin7:07

you can have a distributed system, like a system where you have a single system with many, many nodes, but they're all under the control of a single actor.

你可以有一个分布式系统,一个系统里有很多很多节点,但它们全都在单一行为者的控制之下。

Eddy Lazzarin12:17

we're in a rare scenario where the companies themselves are saying, I'm being a little bit irresponsible. I'm being a little crazy. Stop me. Someone stop me.

我们处在一个罕见的场景里:公司自己说,我有点不负责任,我有点疯,拦住我,来人拦住我。

Eddy Lazzarin14:26

Consider what you do with just a liar. Consider a very smart liar. Do people not do that every day? What we do is we play iterated games with them, right? And we discover eventually that they're a liar and their reputation is harmed.

想想你怎么对付一个骗子。一个非常聪明的骗子。人们不是每天都在做这件事吗?我们做的就是跟他们玩重复博弈,最终发现他们在撒谎,他们的声誉受损。

Eddy Lazzarin17:35

It's like when George Costanza freaks out about worlds colliding. That's what's happening. Worlds are colliding.

就像 George Costanza 为世界碰撞而崩溃那样。这就是正在发生的事。世界在碰撞。

Eddy Lazzarin25:51

数字与实体

Data Republican 整理的 EA 相关组织引语数量1,851 条引语21:44

术语

P-abundance丰裕概率
Lazzarin 提出的概念,指技术进步带来丰裕的可能性,与 P-doom 相对。
P-doom末日概率
AI 安全讨论中常被引用的术语,指 AI 导致人类灭绝的概率估计。
agent swarm智能体集群
指多个 AI 智能体协同工作的说法,Lazzarin 认为这个词预设了模型是邪恶的。
agent fleets智能体舰队
Rune 建议用来替代 agent swarm 的说法,避免暗示恶意。
mech interpretability机械可解释性
通过查看模型权重和连接来理解模型内部工作机制的方法。
script kitties脚本小子
指使用现成脚本进行黑客攻击、技术水平较低的人。

收听指南

谁该听

关注 AI 监管与安全辩论的创业者、投资人和政策研究者,想了解反暂停阵营完整论证的人。

可跳过

20:40 到 24:49 关于有效利他主义和虾福利的讨论,与 AI 主线关系较弱。