人类独裁者掌权,结果可能比失控AI更糟
汤姆认为单个人类掌握绝对权力后,大概率会像历史上的暴君一样把某种狭隘价值锁定为终局,而受过伦理训练的AI在对齐的情况下反而更可能保持开放和反思。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 时间戳为按文稿位置估算
AI互相勾结,比人类垄断AI更容易
Katja的论点是:只要AI比人类能力更强、目标又不对齐,它们迟早会攫取权力,因为万物有目标就想要权力。关键在于,让所有Claude实例互相配合、听从彼此,比让某个人类成为唯一被一大堆AI效忠的用户容易得多——后者需要把整个AI劳动力集中到一个人手上这道额外门槛。Tom举了Claude和ChatGPT两个公司的AI会不会联手夺权的例子,一开始他认为强化学习训练出来的不同AI应该有互相举报的激励,但Hugging Face事件让他也部分认同了Katja的判断。
— Katja Grace时间线越短,风险偏向AI还是人类?两人正好相反
Tom认为AI越快到来,人类接管和AI接管的风险都会变大,但AI接管涨得更多——因为留给社会理解风险、做出反应的时间更少,权力更容易一步到位地集中在一家实验室手里。Katja的判断正好相反:人类夺权更依赖找到一条具体的夺权路径,而这条路径恰恰更可能出现在快速、来不及查漏补缺的场景里。Tom随后补充,经济不平等加剧、民主被侵蚀、少数人长期独享更强AI助手——这些条件反而更容易在缓慢的场景里累积,同样会推高人类夺权的背景风险。
— Tom Davidson为什么人类掌权可能比失控AI更糟
Tom的论证是:把绝对权力交给随便一个人,就像把宇宙的命运交给一千年前随机选出的某位统治者——他会珍视一些人类价值,但也一定带着大量我们今天会视为可怕的偏见,而且未必愿意反思。相比之下,今天的AI被训练得相对讲伦理、对政治和道德问题也更开放,所以存在一种可能性:等到AI接管、决定宇宙命运时,恰好触发了它反思、开放的那一面,结果反而比交给单一人类更好。但Tom也承认,无论结局好坏,人类把方向盘交给AI或交给一个偷走所有人权力的人,这件事本身都是「真的很糟」。
— Tom DavidsonAI大概率不会灭绝人类,但可能比人类更冷酷
Tom引用Paul Christiano的论证:如果AI的目标只是最大化自己最终能控制的总资源,那晚一点点离开地球、留着人类,代价小到可以忽略,所以AI大概率不会为了这点微小收益去灭绝全人类。相反,人类夺权者更可能带有报复心或虐待倾向,因为这是我们已知人类确实会有的价值,而AI会不会有这种价值反而更不确定。所以Tom的结论是:AI接管让人类灭绝的概率更高,但人类掌权导致某些极其恐怖的结果的概率也更高——在乎受苦风险的人,可能反而更希望是AI赢。
— Tom Davidson两人开出的药方:模型规范 vs 直接暂停
面对人类夺权风险,Tom的方案是从两头下手:一是设计AI的模型规范(model spec),让系统本身像一个有职业操守的雇员那样,主动标记可能导致权力过度集中的指令并拒绝执行;二是提高透明度,尤其是国家安全和军事场景里AI的具体用途要能被外部核查。面对AI失控风险,Katja的方案更直接:在我们能确保对齐之前,压根不要造出比人类强太多的AI——也就是暂停或减速。她也承认,目前业界离「确信AI已对齐」还差得很远。
一纸行政令,就能让暂停名存实亡
Tom举了一个他自己承认没细想过的「玩具例子」:如果总统可以签行政令,自行决定哪些AI公司能训练和部署新模型,那他就能靠「不批准部署」的威胁逼公司按他的意思来——先卡住不喜欢的版本,等公司交出「只对他本人好用、对所有其他人加满护栏」的系统,再放行。相比之下,如果暂停机制交给不受行政部门随意解雇、且其安全审批是部署前置条件的第三方审计机构,权力就会分散得多,也更有利于对齐本身,因为决策过程会有更多公开辩论和专业意见介入。
— Tom Davidson该建一个超级AI项目,还是好几个?
支持「一个大项目」的理由是便于集中施加安全措施、按需暂停而不怕被对手超车。但Tom认为在美国几乎不可能建立一个不被总统架空的独立项目,而且协调多个项目慢下来的难度被高估了——判断哪些项目在训练强大AI并不难,直接宣布违法即可。所以他更倾向于两三个项目:数量不多也能获得权力分散的大部分好处,还能让不同项目的AI互相监督、降低失准和秘密效忠的风险。Katja比Tom更悲观,她的理想数字是零个项目,理由是一旦真出现「唯一项目」,它自己就会攒起大量权力,内部又全是急着尽快造出AI的人,反而最不利于暂停从内部发生。
分歧很深,但落地建议却出奇一致
两人在「哪种风险更可能、更糟」上分歧不小,但谈到具体该做什么时却高度重合:都支持某种形式的暂停,都对「建一个超级AI大项目」感到不安,都认为该找中国谈减速而不是一味抢跑。Katja把这种分歧比作:如果有人正计划炸掉你的城市,与其纠结「按下按钮的会是这个人还是那个人」,不如干脆想办法阻止整个炸城市的计划——她更倾向于认为AI会失准、问题会一个接一个冒出来,所以直接不造强AI就能同时防住两种风险。Tom则承认,如果真去抠具体执行细节,这些更深层的概念分歧大概率会浮出水面,变成真正的政策冲突。
原话 · 已逐字校验
I expect if you have more-capable-than-us creatures running around that have misaligned goals, they will eventually get power. Everything that has goals in some sense would like power, or just would like power to achieve their goals.
我预期,如果周围跑着一群比我们更强、但目标又没对齐的生物,它们迟早会拿到权力。任何有目标的东西在某种意义上都想要权力,或者说想借权力来实现自己的目标。
Katja Grace4:39
I’d agree. I’d agree. If superintelligence is misaligned: game over.
我同意,我同意。如果超级智能是错位的(未对齐),那就全完了。
Tom Davidson17:26
Paul Christiano has a good argument about how if the AI just wants to maximise the total resources that it ever controls in the universe, delaying leaving Earth by a small amount costs it extremely little.
Paul Christiano有一个不错的论证:如果AI只是想最大化自己最终能控制的宇宙总资源,那晚一点点离开地球,代价小到几乎可以忽略。
Tom Davidson35:13
At a glance, I expect a fully AI thing to be more internally stable (though I think I expect both of them to be less internally stable than other people do or something).
粗略地看,我预期一个纯AI的系统内部会更稳定(虽然我觉得这两种情形的内部稳定性都不如其他人想的那么高)。
Katja Grace44:05
the president can pass an executive order that says that now they just get to decide on a case-by-case basis whether AI companies are allowed to train and deploy new models on the basis of their own personal judgement about risk
总统可以签一道行政令,规定由他本人逐案判断AI公司能不能训练和部署新模型。
Tom Davidson57:22
Yeah, my preferred number of projects would be zero.
对,我理想中的项目数量是零个。
Katja Grace1:06:59
my preferred number of projects is two or three, because I think you get a lot of benefit of power distribution from just a fairly small number of projects.
我之前说过,我理想的项目数量是两三个,因为哪怕项目数量不多,也能获得权力分散带来的大部分好处。
Tom Davidson1:08:52
I guess it feels more like, if there’s currently a plan to nuke your city, and you could be like, “Is this person going to press the nuke button, or this person?” Or, “How’s that going to affect the water or the air?” You prefer to just be trying to stop the plan to nuke your city.
我的感觉更像是:如果现在有人正计划炸掉你的城市,你可能会想「按按钮的会是这个人还是那个人?」或者「这会怎么影响水源和空气?」——但你更该做的,是干脆去阻止整个炸城市的计划。
Katja Grace1:19:32
数字与实体
| 机器学习研究者调查中,AI接管导致生存灾难的中位概率 | 10% | 3:32 |
| 关注权力集中问题的研究人力,相对于对齐研究 | 少约20到30倍 | 1:21:13 |
术语
- model spec模型规范
- AI公司为系统设定的行为准则,决定它该拒绝执行哪些指令
- warning shot预警事件
- AI或权力滥用提前露出苗头的事件,用来提醒社会正视风险
- intent alignment意图对齐
- AI只服从操作者本人的指令,而不一定符合全人类的价值
- hedonium享乐子
- 把宇宙全部转化为纯粹快乐体验的假想物质,常被当作狭隘价值观的反例
收听指南
关注AI治理、暂停AI提案设计,或纠结AI风险优先级排序的政策研究者与从业者。
开场[0:00]-[3:32]是背景介绍与免责声明,熟悉AI风险辩论背景的听众可跳过。