减速应始于现在,超级智能两三年内到来
英国前 AI 安全负责人 Geoffrey Irving 认为,全面超级智能将在两三年内到来,减速的窗口已经错过;对齐的希望在于可扩展监督、人格研究和理论突破,而不是精确指定效用函数。
核心论点 · 时间戳为按文稿位置估算
减速时机:现在
Geoffrey Irving 在开场给出明确立场:减速的时机是现在,甚至更早。他解释,如果我们仔细分析何时应该减速,答案会是「过去的某个时候」,因为我们离那个疯狂未来太近了。他提出,只要不到 10 位关键决策者(实验室 CEO、中国相关人士、几个国家领导人)达成一致,就能实现减速;但单方面减速很难。这个判断是整集对话的底色,也解释了他为什么认为对齐问题需要全球协调而非纯技术解决。
— Geoffrey Irving反驳时间尺度论
针对 Rohin Shah 认为训练时间短,所以模型不会学会接管世界的观点,Irving 指出这混淆了「整体计划的时间尺度」和「任务组成部分的时间尺度」。即使每个子任务都在一周内完成,多个子任务组合起来也能实现多年计划。这意味着训练时长并不构成安全保证,因为模型可以通过分解任务来执行长期策略,而无需在单个训练过程中完成完整的推理链条。
— Geoffrey Irving实验室策略组合观察
Irving 认为 OpenAI、Anthropic、DeepMind 的策略都是「性格训练 + 可扩展监督 + 监控」的组合。他对比了各实验室的性格训练方法:Anthropic 偏美德伦理,OpenAI 规则更多且更偏纠正性,DeepMind 则不太清楚。这些方法能否在超级智能上奏效,目前没有强论证。这个观察揭示了前沿实验室的对齐实践缺乏理论根基,更多是经验性的调参。
— Geoffrey Irving可扩展监督的障碍
Irving 给出可扩展监督的一个关键障碍——「模糊论证」:模型可能只给出支持某主张的证据,而隐藏反证,因为反证才是决定性的。他引用 Beth Barnes 在 OpenAI 的实验:人类辩手用复杂但错误的论证骗过裁判,因为双方都找不到漏洞。这个障碍在理论上没有好解法,说明单纯依赖人类反馈的监督方式在面对更聪明的模型时可能失效。
— Geoffrey Irving超级智能两三年内到来
Irving 的模态预期是两到三年内出现全面超级智能。主要不确定性在于模型能否擅长模糊任务(直觉、模糊规划)。他认为人们高估了模型只擅长可验证任务的可能性,并相信通过数据飞轮,模型会逐渐扩展到更多非可验证任务。这个时间线判断意味着减速和安全研究的窗口极短,也支持他在开场主张「现在」减速。
— Geoffrey IrvingAISI 的三大工作方向
Irving 指出 AISI 未来重点:一是滥用风险,即危险能力评估,需结合高研究能力和国家安全;二是缓解措施,包括滥用和失控,AISI 已有强大的防护团队;三是政策,这是 Irving 加入 AISI 的主要原因。AISI 作为最大的政府 AI 安全研究机构,其政策建议应基于战术现实。这三点勾勒了政府层面参与 AI 安全的角色:评估、防御、政策制定。
— Geoffrey Irving无法精确指定效用函数
Irving 认为,在超级智能到来前,我们无法精确指定其效用函数。唯一的希望是训练过程具有误差校正能力,使我们能落入某个「盆地」而非精确目标。他提出一个具体构想:通过训练空间的分支图,用 1000 个检查点展示模型训练路径,从而测试不同算法,增加对分支行为的理解。这试图把对齐从「设定目标」转向「设计训练过程」。
— Geoffrey IrvingRL 的作用机制
Irving 认为 RL 主要做两件事:一是下选择除无效的推理模式,二是人类常只写最终答案,模型被迫在潜在空间中推理。o1 的出现是 RL 算法调优与基础模型能力提升的结合。他预测对齐技术的前沿是「可扩展监督 + 人格 + 学习动力学」的组合,但组织会采取多元化策略,不会孤注一掷。
— Geoffrey Irving原话 · 已逐字校验
Now. Now. If we were to carefully analyse this question of exactly when we should slow down, it would be like a while ago in the past, because we’re just too close to this crazy future.
现在。现在。如果我们仔细分析到底应该何时减速,答案会是过去的某个时候,因为我们离那个疯狂的未来太近了。
Geoffrey Irving0:00
On factual questions it would be not racist; it was very happy to write incredibly horrible poetry about racism.
在事实问题上它不种族歧视;但它非常乐意写关于种族主义的极其可怕的诗歌。
Geoffrey Irving14:31
One of the winning strategies was basically a debater would produce a very complicated argument that sort of sounded true, was false, but neither of the debaters — not the liar or the honest debater — knew where the flaw was.
一个获胜策略基本上就是辩手提出一个非常复杂的论证,听起来像真的,其实是假的,但双方辩手——无论是说谎者还是诚实者——都不知道漏洞在哪里。
Geoffrey Irving23:31
some degree of your conscious train of thought is a hallucination as you go along the world.
某种程度上,你的意识流是你在世界中行走时产生的幻觉。
Geoffrey Irving56:12
"Rationalisation" there is a pejorative word, but it’s also just intrinsically how intelligence works, even for humans.
「理性化」是一个贬义词,但它本质上就是智能运作的方式,即使对人类也是如此。
Geoffrey Irving1:06:35
Hope is not like a lot of probability. Just like, we should try.
希望并不等于很大的概率。就像,我们应该尝试。
Geoffrey Irving1:23:51
If you had the other LBJ that was opposed to the first one, that's saying, "By the way everyone, you realise what he's doing here? He's cheating the vote system." And everyone is like, "That's ridiculous. That's clearly unfair. Let's fix the rule to break that." I think that intervention would get you so much power over the misaligned components of LBJ that I think it's within hope to imagine getting that story right.
如果你有另一个反对第一个 LBJ 的 LBJ,他会说:「顺便说一句,各位,你们意识到他在做什么吗?他在作弊投票系统。」然后大家会说:「这太荒谬了,这显然不公平,我们改规则来打破它。」我认为这种干预能让你在 LBJ 的错位部分上获得如此大的力量,以至于我们有希望把故事讲对。
Geoffrey Irving1:28:54
I told Dario — this is annoying — that I would write a document called "Language is enough to get to AGI" — and then I didn't write it until 2019. So early 2019 is when I actually wrote the document.
我告诉 Dario——这很烦人——我会写一份名为「语言足以达到 AGI」的文档——然后我直到 2019 年才写。所以 2019 年初我才真正写了那份文档。
Geoffrey Irving1:36:46
数字与实体
| 减速所需关键人数 | 少于10人 | 0:00 |
| Anthropic 宪法规则数 | 5条 | 10:46 |
| 临时暂停可接受的性能损失 | 2-10倍慢 | 34:14 |
| 超级智能到来时间(模态预期) | 2-3年 | 29:34 |
| 对齐领域历史 | 最多 20-25 年 | 1:18:26 |
| 人格实证研究年龄 | 1-2 年 | 1:19:30 |
| 纳米技术和上传时间 | 几年到二十年 | 59:28 |
| Pentago 求解计算量 | 10^17或10^18 FLOPS | 1:31:00 |
| 开始主张 RL+LLM 路径的年份 | 2018 | 1:34:05 |
| o1 发布时间 | 2024 | 1:36:46 |
术语
- scalable oversight可扩展监督
- AI 能力超越人类监督时仍能保证行为符合意图的监督方法。
- ambiguous arguments模糊论证
- 只给支持证据、隐藏决定性反证的推理方式,可欺骗监督者。
- character training性格训练
- 通过训练塑造模型人格特质以减少危害,是当前实验室对齐策略的一部分。
- effective field theory有效场论
- 忽略微观细节、用宏观参数描述物理现象的理论,Irving 借以类比对齐理论。
- data flywheel数据飞轮
- 模型生成数据训练下一代模型,不断扩展能力范围的循环。
收听指南
该听:AI 对齐研究者、大模型训练团队负责人、AI 政策从业者,以及所有对超级智能时间线判断敏感的技术决策者。
1:31:00 附近 Pentago 求解算力估算可跳过,不影响主线。