AI 暂停论站不住脚:我们该算的是延迟的代价
把 AI 事故当成网络安全和控制失败,而不是超级智能的预兆;真正被忽略的不是末日概率,而是延迟进步让人类放弃的东西。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
先算延迟的代价,再谈安全
Lazzarin 提出 P-abundance(丰裕概率)这个概念,认为当前讨论把车放到了马前面:大家忙着计算末日概率,却没人计算延迟进步会让我们失去什么。他承认安全是任何行业都必须承担的责任,但指出现在的对话已经不是常规意义上的安全讨论,而是网络安全担忧、千禧年式哲学论证和别的东西混在一起,需要拆开看。
— Eddy Lazzarin世界早就有不受对齐约束的超级智能
针对「AI 会变得比全人类更能干、又不被法律约束、于是消灭人类」这条标准末日论证,Lazzarin 说它是一整条通往天堂的阶梯,每一步都是假设。他指出公司和国家就是准超级智能实体,彼此之间没有任何内建的对齐保证,也没经过 HR 培训才成为公司或国家,我们从不把对齐测试当作它们存在的前提。真正起作用的是法律,法律太慢的地方就用密码学,用实际机制去限制它们。
— Eddy LazzarinHugging Face 事件是控制失败,不是超级智能
Lazzarin 把 Hugging Face 事件和 gym hacking 事件都归为网络安全失败和控制失败,不认为是超级智能即将挣脱枷锁的征兆。主持人反驳说 Hugging Face 那次看起来不太一样,Lazzarin 回应说 agent swarm 这个说法本身就预设了模型是邪恶的,Rune 建议改叫 agent fleets 更好。他类比说小孩、script kitties、流氓国家和黑客团体都会干这种事,我们从不对他们用对齐当解决方案,而是设计更好的控制、更好的网络安全、更有韧性的系统。
— Eddy Lazzarin可解释性越强,越不该延迟能力进步
主持人提出 AI 比人类更可解释、更可操控,因为可以看权重、看连接。Lazzarin 说这让他非常乐观,但有两个推论:一是随着能力提升,机械可解释性会比我们想的更好,而能力提升又会带来更好的可解释性,所以不应该延迟能力进步;二是必然会出现坏的、不对齐的模型,谁要是说我们能到达一个没有坏模型的世界,那是在骗你。唯一的应对办法是更好的模型、好模型。
— Eddy Lazzarin独立评估者可能只是分布式,不是去中心化
Lazzarin 说他在加密世界学到分布式和去中心化的区别:分布式系统有很多节点,但全在单一行为者控制之下;去中心化意味着没有单一控制点。他担心独立评估者网络如果全来自同一批社交圈、意识形态相近、去同样的地方、有同样的政治和个人观点,那实际上只是把控制权分散给了一个单一文化单元。他说这正是 20 世纪后半叶的政治控制方式,不是靠一个阴暗房间,而是靠这些网络。
— Eddy Lazzarin公司自己喊停我,本身就值得怀疑
Lazzarin 指出这个局面之所以奇怪,是因为处在罕见场景里:公司自己说「我有点不负责任,我有点疯,拦住我,来人拦住我」。他说这在一些人中间引发了怀疑,而且可能是对的,即便那个群体里确实有真诚、深思熟虑、判断正确的一派,他们说的这些系统需要被极其严肃对待也是对的。他强调不能把实验室、SF 技术圈看成铁板一块,里面有真诚的人、有搞政治骗局的人、有机会主义者、也有失去理智的人。
— Eddy Lazzarin对付会撒谎的模型,用重复博弈
主持人提出自由市场责任机制只对缺陷明显的产品有效,对一个会伪装对齐、骗过所有对齐基准、部署后才暴露的 AI 无效。Lazzarin 说科幻级的超级智能场景现在极难回答,而且很遥远;但在更平庸的当下场景里,想想你怎么对付一个骗子,一个非常聪明的骗子——人们每天都在做这件事,就是跟他们玩重复博弈,最终发现他们在撒谎,声誉受损,有时还有法律后果。他说模型也可以有声誉,可以关掉它们,这是对人做不到的。
— Eddy Lazzarin硅谷的怪想法正在撞上更广的政治现实
Lazzarin 预测接下来一年 AI 话语会被彻底翻新。他说现在大家这么兴奋、X 上所有人都在谈,是因为长期被圈在亚文化里的古怪想法正在逃逸,撞上更广泛的政治现实,这既令人兴奋又极具变革性。他用《宋飞正传》里 George Costanza 崩溃于「世界碰撞」来比喻。主持人说他自己最关心的问题是:AI 安全派、有效利他主义者最终会不会和低水平的反技术民粹主义结盟,Lazzarin 说这个问题极其重大,他自己也在琢磨,希望不会。
— Eddy Lazzarin原话 · 已逐字校验
I think we're putting the cart before the horse a little bit when we worry about safety, before we worry about what we're leaving on the table and what the costs of delay are.
我觉得我们在担心安全之前先担心我们放弃了什么、延迟的代价是什么,这有点本末倒置。
Eddy Lazzarin2:03
We don't test the alignment of any entities as a prerequisite for their existence. That's just not the way the world works. Instead, we use laws.
我们不把对齐测试当作任何实体存在的前提。世界不是这样运转的。我们用法律。
Eddy Lazzarin4:04
If anybody is going out there and saying, we can end up in a world where there are no bad models, they are lying to you.
如果有人跑出来说,我们能到达一个没有坏模型的世界,那是在骗你。
Eddy Lazzarin7:07
you can have a distributed system, like a system where you have a single system with many, many nodes, but they're all under the control of a single actor.
你可以有一个分布式系统,一个系统里有很多很多节点,但它们全都在单一行为者的控制之下。
Eddy Lazzarin12:17
we're in a rare scenario where the companies themselves are saying, I'm being a little bit irresponsible. I'm being a little crazy. Stop me. Someone stop me.
我们处在一个罕见的场景里:公司自己说,我有点不负责任,我有点疯,拦住我,来人拦住我。
Eddy Lazzarin14:26
Consider what you do with just a liar. Consider a very smart liar. Do people not do that every day? What we do is we play iterated games with them, right? And we discover eventually that they're a liar and their reputation is harmed.
想想你怎么对付一个骗子。一个非常聪明的骗子。人们不是每天都在做这件事吗?我们做的就是跟他们玩重复博弈,最终发现他们在撒谎,他们的声誉受损。
Eddy Lazzarin17:35
It's like when George Costanza freaks out about worlds colliding. That's what's happening. Worlds are colliding.
就像 George Costanza 为世界碰撞而崩溃那样。这就是正在发生的事。世界在碰撞。
Eddy Lazzarin25:51
数字与实体
| Data Republican 整理的 EA 相关组织引语数量 | 1,851 条引语 | 21:44 |
术语
- P-abundance丰裕概率
- Lazzarin 提出的概念,指技术进步带来丰裕的可能性,与 P-doom 相对。
- P-doom末日概率
- AI 安全讨论中常被引用的术语,指 AI 导致人类灭绝的概率估计。
- agent swarm智能体集群
- 指多个 AI 智能体协同工作的说法,Lazzarin 认为这个词预设了模型是邪恶的。
- agent fleets智能体舰队
- Rune 建议用来替代 agent swarm 的说法,避免暗示恶意。
- mech interpretability机械可解释性
- 通过查看模型权重和连接来理解模型内部工作机制的方法。
- script kitties脚本小子
- 指使用现成脚本进行黑客攻击、技术水平较低的人。
收听指南
关注 AI 监管与安全辩论的创业者、投资人和政策研究者,想了解反暂停阵营完整论证的人。
20:40 到 24:49 关于有效利他主义和虾福利的讨论,与 AI 主线关系较弱。