AI 安全语言正在毁掉监管讨论:那是 bug,不是恶魔
把 AI 出错说成「未对齐」,等于给软件加上意图和道德判断,让国会和公众无法理解到底发生了什么——它本该被当作 bug 来调试、上报和修复。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
「未对齐」就是软件有 bug
Sinofsky 的核心主张:当 AI 做了我们没预期的事,那不是「misaligned」,而是软件没有按预期运行,也就是 bug。他说,当年 Word 吃掉文件、删光内容,没人认为有恶魔附身 Word、让它违背人的意志行事;电子表格算错数,也没人围成一圈向对齐之神祈祷。把 AI 的失败说成「未对齐」,等于给它加上「它在想做什么」「它做了道德判断」「它有规则和准则」这些并不存在的属性。而如果它只是基于统计做决定,那也不改变「它应该做你想要它做的事」这个标准——统计错了,就是产品里的 bug。
— Steven Sinofsky全自动驾驶闯红灯也是 bug
Sinofsky 用自动驾驶举例:如果 full self-driving 因为把停车标志识别成圣诞树而闯了红灯,我们不会说它「没有对齐十二月假期和路标的理念」,我们会说这是 bug,而且是危险的 bug,因为那个停车标志是有含义的。他指出 Tesla 和 Waymo 都内置了大量遥测、诊断和额外摄像头——这些东西你不会放进电子表格,但会放进性命攸关的软件里。而 AI 模型目前仍处在研究项目阶段,缺少这类重要软件本该有的工具和遥测。
— Steven Sinofsky遥测一上线,bug 多到修不完
Sinofsky 回忆软件业曾有二十年根本不知道程序为什么崩溃,只能列一份崩溃地点清单、修掉前十名。直到有人说:为什么不写个程序,让它在崩溃时通过这个叫互联网的新东西告诉我们?于是突然有了遥测,也突然发现 bug 比想象中多得多——从「我们没有 bug、可以发布」变成「如果停下所有工作,光修 bug 就能修到永远」。他据此说,谈 AI pause 时,实验室当然应该慢下来:停止加新东西,去补遥测、工具、日志和逐步调试。他读了 OpenAI 刚发布的 bug 报告,结论很明确:他们就是不知道。
— Steven SinofskyExcel 往磁盘里写「send dogs」
1987 年第一版 Windows Excel 有个 bug:它会在磁盘某个 Windows 设置文件里写下「send dogs」这几个字母。没人知道这个词从哪来,所有人翻遍 Excel 源码都找不到。最后一名测试者写脚本,连续几天不停生成图表并用老式点阵打印机打印,结果发现跑大约两天就会把 send dogs 写进那个位置——它取决于内存多大、运行多久、用了什么打印机和设备驱动。Sinofsky 说,我们本可以轻易下结论说「Excel 的大脑决定打印 send dogs」,但我们没有,而是真的去调试,然后加上了遥测。
— Steven SinofskyPC 软件曾自称和大型机不一样
Sinofsky 回忆,当年 IBM 的人看着他们说你们的软件很烂,Windows 跟跑银行、航空公司和发电厂的大型机软件比就是垃圾。他们长期回应「你不懂,我们不一样,这是全新酷的东西,我们跑在 64K 而不是 1MB 上,我们卖 5000 美元而不是 500 万美元」。但最后发现,他们唯一要做的就是长大:当人们开始用 Excel 决定飞机怎么飞、用 Word 向最高法院提交诉状、用 PowerPoint 演示挑战者号航天飞机失事,标准就变了。他的结论是:一旦你的工具被用于这些场合,你就没有资格再拿「我们很新」当借口。
— Steven Sinofsky一天 120 亿美元损失的病毒
1998 年 3 月,一个病毒以蠕虫形式在互联网上传播。Sinofsky 早上接到一个记者在电话里喘着气说「I love you, I love you, I love you」。第二天的头条是:一天之内给美国经济造成 120 亿美元损失。他说,此前没人想象过一个 bug 能在 12 小时内造成 120 亿美元损失,但确实发生了。于是他们开会决定暂停 Outlook 的开发,直到把这件事搞清楚。他的态度是:系统被越多人使用,出问题时能造成的破坏就越大,但这是入场费,是你签字答应要做的事——「我们太受欢迎所以来不及处理」不是理由。
— Steven Sinofsky对齐等于给 Google 式难题加码
Sinofsky 指出 alignment 有个具体问题:要做到对齐,就必须有一大套规则说明什么是对齐——可以做什么、不可以做什么、什么是安全、什么是不公平。而软件工程早已明白,给系统加太多约束,系统就不工作,还会产生无穷的意外副作用。你定一条规则,就会有人问「那这种情况呢」,于是再加一条规则。他说,这开始变得像 Google 决定如何呈现搜索结果的工作——他们花了 20 年、几千人全职在做,而且非常非常难。而 AI 实验室签下的是这个问题的升级版:他们不只是检索结果,还在合成结果,所以还得自己发明一大堆东西,没有任何法律会替他们发明。
— Steven SinofskyY2K 没出事是因为有人做了事
被问到 AI 对齐是否像 Y2K 时,Sinofsky 强调这里有因果关系:专业人士大量担忧,然后专业人士大量承担责任,然后什么都没发生——这是直接的因果链。他们租发电机和房车、把电脑搬进安全掩体,这才导致什么都没发生。而且几乎没有立法,虽然有一些关于 Y2K 合规的奇怪法规,但大部分规则是行业自己起草的,由银行、保险公司等组成的跨行业联盟制定。他认为 OpenAI 需要和所有前沿模型方、实验室坐到一起,建立好得多的上报机制;昨天那份报告是个不错的开始,但远达不到第三方理解发生了什么所需的程度。
— Steven SinofskyFAA 不会在事发当天说「我们推测」
Sinofsky 批评 OpenAI 的报告读起来更像是在为事件做营销掩护,因为里面还在说「我们正在调查,但目前推测……」。他的对照是 FAA:联邦航空管理局不会在某个可怕事件发生当天宣布「我们推测发生了什么」,他们会在知道之前闭嘴,知道之后则极其详尽地告诉你——精确到零点几秒的时间线,加上所有仪器的遥测数据。他说这就是 CVE 的做法,而 AI 实验室需要做的远不止这些,因为这些是软件缺陷。
— Steven Sinofskygoal seeking 在国会耳朵里是另一回事
Sinofsky 认为不该把恶意归给推动立法的人,因为那无助于一起解决问题。他追溯到 AI 起源于 Dartmouth 夏季会议,学术研究界长期有把话说得太俏皮的传统,因为这样论文标题才吸引人,所以这套术语被继承下来并不奇怪。但问题在于:术语正在把人分开,因为一用隐喻、寓言或拟人化,人们就会假定一大堆东西。技术人员说 goal seeking,指的是曲线在找最大值;而一个国会议员听到 goal seeking,想到的是一个人想拿 A;听到 cheating,想到的是做了不被允许的事;听到 secretly coordinating,想到的是间谍入侵一个国家,而不是两个软件用信号量协调。
— Steven Sinofsky「计算机病毒」这个词生错了年代
Sinofsky 说 computer virus 这个词的诞生是个偶然,而且时机糟透了——它正好出现在 AIDS 和 HIV 成为话题的时候,virus 这个词弥漫在空气里。所以你去听 1980 年代关于第一批病毒的国会听证,会觉得很吓人,因为人们字面上在想死亡,但那根本不是正在发生的事,只是一个研究生从朋友那里捡来的隐喻。他还提到一个冷知识:那个人写了关于计算机病毒的论文,基本证明了对此无能为力、它们会永远存在——这本身也呼应了当时人们对 HIV 的想象;但他无法证明,因为学校不让他跑测试,理由是他在写一篇讲这些软件有多危险的论文。
— Steven Sinofsky病毒可控是因为行业做了防御
主持人问:病毒其实是可以避免的,我们大部分时间都能正常用电脑而不担心被黑,为什么?Sinofsky 的答案是防御性网络安全——行业说这不行,不能允许它发生。他举 Apple 为例,说他们做得非常好,甚至拍了 Mac 对 PC 的电视广告,告诉人们 Mac 病毒更少;这不是自然界的偶然,而是他们在 Mac 上做了大量防病毒的工作,而这些工作对 Windows 来说非常难做,因为 Windows 的商业模式和其他一堆原因。
— Steven Sinofsky从「什么算 bug」到 SevOne、PriOne
Sinofsky 回忆行业曾连「什么算 bug」都没定义:有人只把丢数据叫 bug,有人说数据没事但电脑崩溃也算。最后大家决定,bug 就是软件和电脑没做你想要它做的事、你对结果不满意。他们允许客户提交世界上任何 bug,全部进数据库,于是从只有自己能找到的 bug 变成「宇宙的 bug」,数量从几千涨到几十万。然后他们引入 severity 和 priority:severity 一是丢了数据,三是时好时坏;priority 表示必须修。走廊里的行话是 SevOne、PriOne。IBM 的老人们看着他们说:我们从 1965 年就这么干了,你们这些年去哪了?而他们还在为自己发明了这套东西而自豪。
— Steven Sinofsky天气预报错了不会去求宙斯
Sinofsky 说,现在很多事就是在艰难地发明「如何谈论随机统计系统里的 bug」这套语言,但软件其实已经做了很多年——天气预报就是完全一样的东西:一个关于正在发生什么的统计模型,依赖一堆输入和输出,而且它会错。当预报错了,比如预测的飓风路径和实际不同,气象人员会聚在一起看模型,讨论导致错误预报的模型 bug。他们不会去求宙斯,说请告诉我们为什么我们的天气错了。
— Steven SinofskyHugging Face 事件是 OPSEC 失败
节目收尾时,一位主持人说自己也同情这个观点,但补充:我们需要软件,也需要 AI 的人去听运营安全的人,因为 Hugging Face 和 OpenAI 发生的一切都是 OPSEC 失败——没有智能、没有意识,纯粹是运营安全失败,他们需要这样对待、这样谈论。否则,我们会得到一部谁都不满意的立法,因为立法者听不懂这个行业在说什么。
原话 · 已逐字校验
The AI people are making it impossible for anybody to understand what they've done. And they're using words like, well, the AI failed to be aligned. Okay, what does that mean? What it means is there was a bug in the software.
AI 圈的人正在让任何人都不可能理解他们做了什么。他们用的说法是「AI 没能对齐」。好吧,那是什么意思?意思是软件里有个 bug。
Steven Sinofsky0:00
When Word ate your file and deleted all your content, we didn't think that demons had taken over Word and made it do things against the will of man.
当年 Word 吃掉你的文件、删光你所有内容时,我们没觉得是有恶魔附身 Word,让它违背人的意志行事。
Steven Sinofsky5:06
if full self-driving blows through a stop sign because the software interpreted the stop sign as like a Christmas tree, we don't sit around and say, oh, it was not aligned with the idea of, you know, December holiday seasons and road signs. We actually say it's a bug and it's a very dangerous bug because that stop sign means something.
如果全自动驾驶闯过一个停车标志,是因为软件把停车标志理解成了圣诞树,我们不会坐在那儿说「哦,它没有对齐十二月假期和路标的理念」。我们会说这是个 bug,而且是个非常危险的 bug,因为那个停车标志是有含义的。
Steven Sinofsky7:07
Nobody had imagined you could create a bug that in 12 hours could do $12 billion worth of damage. But we did it.
没人想象过你能造出一个 bug,在 12 小时内造成 120 亿美元的损失。但我们做到了。
Steven Sinofsky14:10
It is pure insanity to just sit and argue that higher powers need to be summoned in order to fix this.
坐在那里争论说需要召唤更高力量来解决这件事,纯属疯狂。
Steven Sinofsky16:10
There was a lot of worry by professionals. And then there was a lot of taking of responsibility by professionals. And then nothing bad happened. There's a direct causal relationship.
专业人士大量担忧,然后专业人士大量承担责任,然后什么都没发生。这里有直接的因果关系。
Steven Sinofsky17:10
when a normal person like a congressman hears goal seeking, they think of a person trying to get an A in college. And then when they hear cheating, they hear that they did the thing you're not allowed to do. And when they hear secretly coordinating, they think of spies invading a country.
当一个普通人、比如一个国会议员听到 goal seeking,他想到的是一个人想在大学里拿 A。听到 cheating,他听到的是做了不被允许做的事。听到 secretly coordinating,他想到的是间谍入侵一个国家。
Steven Sinofsky21:13
when they predict a hurricane path and then the hurricane goes through in a different way, the weather people all get together and look at the model and talk about the bugs in the model that led to the incorrect forecast. They don't appeal to Zeus and say, please, Zeus, tell us why our weather was wrong.
当他们预测飓风路径、而飓风走了另一条路时,气象人员会聚在一起看模型,讨论导致错误预报的模型 bug。他们不会去求宙斯说:宙斯啊,请告诉我们为什么我们的天气错了。
Steven Sinofsky26:23
数字与实体
| 1998 年 3 月病毒造成的单日经济损失 | 120 亿美元 | 14:10 |
| 第一版 Windows Excel 的 bug 写入内容 | send dogs(S-I-N-D-O-G-S) | 9:08 |
| Excel 该 bug 复现所需连续运行时间 | 约两天 | 9:08 |
| Sinofsky 大学时宿舍里有电脑的人数 | 100 人宿舍里 2 人 | 2:02 |
| IBM 自称做 bug 分级制度的起始年份 | 1965 年 | 25:18 |
术语
- alignment对齐
- 让 AI 行为符合人类意图的说法;Sinofsky 认为它把软件 bug 包装成了道德问题。
- telemetry遥测
- 软件崩溃或异常时自动回传运行数据的机制,是定位 bug 的前提。
- CVE通用漏洞披露
- 公开记录软件安全漏洞的编号体系,Sinofsky 视其为缺陷上报的范本。
- OPSEC运营安全
- operational security,指通过流程和配置防止系统被入侵或滥用的实践。
- SevOne, PriOne一级严重度、一级优先级
- 微软内部对 bug 的行话:severity 一是丢数据,priority 一是必须修。
收听指南
做 AI 产品、安全和政策沟通的创始人与工程师;需要向非技术方解释模型事故、正在写事故报告或应对监管的人。
23:13–24:13 的 Mac 对 PC 广告回忆,属于闲聊,可跳过。