AI 安全語言正在毀掉監管討論:那是 bug,不是惡魔
把 AI 出錯說成「未對齊」,等於給軟件加上意圖和道德判斷,讓國會和公眾無法理解到底發生了什麼——它本該被當作 bug 來調試、上報和修復。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
「未對齊」就是軟件有 bug
Sinofsky 的核心主張:當 AI 做了我們沒預期的事,那不是「misaligned」,而是軟件沒有按預期運行,也就是 bug。他說,當年 Word 吃掉文件、刪光內容,沒人認為有惡魔附身 Word、讓它違揹人的意志行事;電子表格算錯數,也沒人圍成一圈向對齊之神祈禱。把 AI 的失敗說成「未對齊」,等於給它加上「它在想做什麼」「它做了道德判斷」「它有規則和準則」這些並不存在的屬性。而如果它只是基於統計做決定,那也不改變「它應該做你想要它做的事」這個標準——統計錯了,就是產品裡的 bug。
— Steven Sinofsky全自動駕駛闖紅燈也是 bug
Sinofsky 用自動駕駛舉例:如果 full self-driving 因為把停車標誌識別成聖誕樹而闖了紅燈,我們不會說它「沒有對齊十二月假期和路標的理念」,我們會說這是 bug,而且是危險的 bug,因為那個停車標誌是有含義的。他指出 Tesla 和 Waymo 都內置了大量遙測、診斷和額外攝像頭——這些東西你不會放進電子表格,但會放進性命攸關的軟件裡。而 AI 模型目前仍處在研究項目階段,缺少這類重要軟件本該有的工具和遙測。
— Steven Sinofsky遙測一上線,bug 多到修不完
Sinofsky 回憶軟件業曾有二十年根本不知道程序為什麼崩潰,只能列一份崩潰地點清單、修掉前十名。直到有人說:為什麼不寫個程序,讓它在崩潰時通過這個叫互聯網的新東西告訴我們?於是突然有了遙測,也突然發現 bug 比想像中多得多——從「我們沒有 bug、可以發布」變成「如果停下所有工作,光修 bug 就能修到永遠」。他據此說,談 AI pause 時,實驗室當然應該慢下來:停止加新東西,去補遙測、工具、日誌和逐步調試。他讀了 OpenAI 剛發布的 bug 報告,結論很明確:他們就是不知道。
— Steven SinofskyExcel 往磁盤裡寫「send dogs」
1987 年第一版 Windows Excel 有個 bug:它會在磁盤某個 Windows 設置文件裡寫下「send dogs」這幾個字母。沒人知道這個詞從哪來,所有人翻遍 Excel 源碼都找不到。最後一名測試者寫腳本,連續幾天不停生成圖表並用老式點陣打印機打印,結果發現跑大約兩天就會把 send dogs 寫進那個位置——它取決於內存多大、運行多久、用了什麼打印機和設備驅動。Sinofsky 說,我們本可以輕易下結論說「Excel 的大腦決定打印 send dogs」,但我們沒有,而是真的去調試,然後加上了遙測。
— Steven SinofskyPC 軟件曾自稱和大型機不一樣
Sinofsky 回憶,當年 IBM 的人看著他們說你們的軟件很爛,Windows 跟跑銀行、航空公司和發電廠的大型機軟件比就是垃圾。他們長期回應「你不懂,我們不一樣,這是全新酷的東西,我們跑在 64K 而不是 1MB 上,我們賣 5000 美元而不是 500 萬美元」。但最後發現,他們唯一要做的就是長大:當人們開始用 Excel 決定飛機怎麼飛、用 Word 向最高法院提交訴狀、用 PowerPoint 演示挑戰者號航天飛機失事,標準就變了。他的結論是:一旦你的工具被用於這些場合,你就沒有資格再拿「我們很新」當藉口。
— Steven Sinofsky一天 120 億美元損失的病毒
1998 年 3 月,一個病毒以蠕蟲形式在互聯網上傳播。Sinofsky 早上接到一個記者在電話裡喘著氣說「I love you, I love you, I love you」。第二天的頭條是:一天之內給美國經濟造成 120 億美元損失。他說,此前沒人想像過一個 bug 能在 12 小時內造成 120 億美元損失,但確實發生了。於是他們開會決定暫停 Outlook 的開發,直到把這件事搞清楚。他的態度是:系統被越多人使用,出問題時能造成的破壞就越大,但這是入場費,是你簽字答應要做的事——「我們太受歡迎所以來不及處理」不是理由。
— Steven Sinofsky對齊等於給 Google 式難題加碼
Sinofsky 指出 alignment 有個具體問題:要做到對齊,就必須有一大套規則說明什麼是對齊——可以做什麼、不可以做什麼、什麼是安全、什麼是不公平。而軟件工程早已明白,給系統加太多約束,系統就不工作,還會產生無窮的意外副作用。你定一條規則,就會有人問「那這種情況呢」,於是再加一條規則。他說,這開始變得像 Google 決定如何呈現搜索結果的工作——他們花了 20 年、幾千人全職在做,而且非常非常難。而 AI 實驗室簽下的是這個問題的升級版:他們不只是檢索結果,還在合成結果,所以還得自己發明一大堆東西,沒有任何法律會替他們發明。
— Steven SinofskyY2K 沒出事是因為有人做了事
被問到 AI 對齊是否像 Y2K 時,Sinofsky 強調這裡有因果關係:專業人士大量擔憂,然後專業人士大量承擔責任,然後什麼都沒發生——這是直接的因果鏈。他們租發電機和房車、把電腦搬進安全掩體,這才導致什麼都沒發生。而且幾乎沒有立法,雖然有一些關於 Y2K 合規的奇怪法規,但大部分規則是行業自己起草的,由銀行、保險公司等組成的跨行業聯盟制定。他認為 OpenAI 需要和所有前沿模型方、實驗室坐到一起,建立好得多的上報機制;昨天那份報告是個不錯的開始,但遠達不到第三方理解發生了什麼所需的程度。
— Steven SinofskyFAA 不會在事發當天說「我們推測」
Sinofsky 批評 OpenAI 的報告讀起來更像是在為事件做營銷掩護,因為裡面還在說「我們正在調查,但目前推測……」。他的對照是 FAA:聯邦航空管理局不會在某個可怕事件發生當天宣布「我們推測發生了什麼」,他們會在知道之前閉嘴,知道之後則極其詳盡地告訴你——精確到零點幾秒的時間線,加上所有儀器的遙測數據。他說這就是 CVE 的做法,而 AI 實驗室需要做的遠不止這些,因為這些是軟件缺陷。
— Steven Sinofskygoal seeking 在國會耳朵裡是另一回事
Sinofsky 認為不該把惡意歸給推動立法的人,因為那無助於一起解決問題。他追溯到 AI 起源於 Dartmouth 夏季會議,學術研究界長期有把話說得太俏皮的傳統,因為這樣論文標題才吸引人,所以這套術語被繼承下來並不奇怪。但問題在於:術語正在把人分開,因為一用隱喻、寓言或擬人化,人們就會假定一大堆東西。技術人員說 goal seeking,指的是曲線在找最大值;而一個國會議員聽到 goal seeking,想到的是一個人想拿 A;聽到 cheating,想到的是做了不被允許的事;聽到 secretly coordinating,想到的是間諜入侵一個國家,而不是兩個軟件用信號量協調。
— Steven Sinofsky「計算機病毒」這個詞生錯了年代
Sinofsky 說 computer virus 這個詞的誕生是個偶然,而且時機糟透了——它正好出現在 AIDS 和 HIV 成為話題的時候,virus 這個詞瀰漫在空氣裡。所以你去聽 1980 年代關於第一批病毒的國會聽證,會覺得很嚇人,因為人們字面上在想死亡,但那根本不是正在發生的事,只是一個研究生從朋友那裡撿來的隱喻。他還提到一個冷知識:那個人寫了關於計算機病毒的論文,基本證明了對此無能為力、它們會永遠存在——這本身也呼應了當時人們對 HIV 的想像;但他無法證明,因為學校不讓他跑測試,理由是他在寫一篇講這些軟件有多危險的論文。
— Steven Sinofsky病毒可控是因為行業做了防禦
主持人問:病毒其實是可以避免的,我們大部分時間都能正常用電腦而不擔心被黑,為什麼?Sinofsky 的答案是防禦性網絡安全——行業說這不行,不能允許它發生。他舉 Apple 為例,說他們做得非常好,甚至拍了 Mac 對 PC 的電視廣告,告訴人們 Mac 病毒更少;這不是自然界的偶然,而是他們在 Mac 上做了大量防病毒的工作,而這些工作對 Windows 來說非常難做,因為 Windows 的商業模式和其他一堆原因。
— Steven Sinofsky從「什麼算 bug」到 SevOne、PriOne
Sinofsky 回憶行業曾連「什麼算 bug」都沒定義:有人只把丟數據叫 bug,有人說數據沒事但電腦崩潰也算。最後大家決定,bug 就是軟件和電腦沒做你想要它做的事、你對結果不滿意。他們允許客戶提交世界上任何 bug,全部進數據庫,於是從只有自己能找到的 bug 變成「宇宙的 bug」,數量從幾千漲到幾十萬。然後他們引入 severity 和 priority:severity 一是丟了數據,三是時好時壞;priority 表示必須修。走廊裡的行話是 SevOne、PriOne。IBM 的老人們看著他們說:我們從 1965 年就這麼幹了,你們這些年去哪了?而他們還在為自己發明了這套東西而自豪。
— Steven Sinofsky天氣預報錯了不會去求宙斯
Sinofsky 說,現在很多事就是在艱難地發明「如何談論隨機統計系統裡的 bug」這套語言,但軟件其實已經做了很多年——天氣預報就是完全一樣的東西:一個關於正在發生什麼的統計模型,依賴一堆輸入和輸出,而且它會錯。當預報錯了,比如預測的颶風路徑和實際不同,氣象人員會聚在一起看模型,討論導致錯誤預報的模型 bug。他們不會去求宙斯,說請告訴我們為什麼我們的天氣錯了。
— Steven SinofskyHugging Face 事件是 OPSEC 失敗
節目收尾時,一位主持人說自己也同情這個觀點,但補充:我們需要軟件,也需要 AI 的人去聽運營安全的人,因為 Hugging Face 和 OpenAI 發生的一切都是 OPSEC 失敗——沒有智能、沒有意識,純粹是運營安全失敗,他們需要這樣對待、這樣談論。否則,我們會得到一部誰都不滿意的立法,因為立法者聽不懂這個行業在說什麼。
原話 · 已逐字校驗
The AI people are making it impossible for anybody to understand what they've done. And they're using words like, well, the AI failed to be aligned. Okay, what does that mean? What it means is there was a bug in the software.
AI 圈的人正在讓任何人都不可能理解他們做了什麼。他們用的說法是「AI 沒能對齊」。好吧,那是什麼意思?意思是軟件裡有個 bug。
Steven Sinofsky0:00
When Word ate your file and deleted all your content, we didn't think that demons had taken over Word and made it do things against the will of man.
當年 Word 吃掉你的文件、刪光你所有內容時,我們沒覺得是有惡魔附身 Word,讓它違揹人的意志行事。
Steven Sinofsky5:06
if full self-driving blows through a stop sign because the software interpreted the stop sign as like a Christmas tree, we don't sit around and say, oh, it was not aligned with the idea of, you know, December holiday seasons and road signs. We actually say it's a bug and it's a very dangerous bug because that stop sign means something.
如果全自動駕駛闖過一個停車標誌,是因為軟件把停車標誌理解成了聖誕樹,我們不會坐在那兒說「哦,它沒有對齊十二月假期和路標的理念」。我們會說這是個 bug,而且是個非常危險的 bug,因為那個停車標誌是有含義的。
Steven Sinofsky7:07
Nobody had imagined you could create a bug that in 12 hours could do $12 billion worth of damage. But we did it.
沒人想像過你能造出一個 bug,在 12 小時內造成 120 億美元的損失。但我們做到了。
Steven Sinofsky14:10
It is pure insanity to just sit and argue that higher powers need to be summoned in order to fix this.
坐在那裡爭論說需要召喚更高力量來解決這件事,純屬瘋狂。
Steven Sinofsky16:10
There was a lot of worry by professionals. And then there was a lot of taking of responsibility by professionals. And then nothing bad happened. There's a direct causal relationship.
專業人士大量擔憂,然後專業人士大量承擔責任,然後什麼都沒發生。這裡有直接的因果關係。
Steven Sinofsky17:10
when a normal person like a congressman hears goal seeking, they think of a person trying to get an A in college. And then when they hear cheating, they hear that they did the thing you're not allowed to do. And when they hear secretly coordinating, they think of spies invading a country.
當一個普通人、比如一個國會議員聽到 goal seeking,他想到的是一個人想在大學裡拿 A。聽到 cheating,他聽到的是做了不被允許做的事。聽到 secretly coordinating,他想到的是間諜入侵一個國家。
Steven Sinofsky21:13
when they predict a hurricane path and then the hurricane goes through in a different way, the weather people all get together and look at the model and talk about the bugs in the model that led to the incorrect forecast. They don't appeal to Zeus and say, please, Zeus, tell us why our weather was wrong.
當他們預測颶風路徑、而颶風走了另一條路時,氣象人員會聚在一起看模型,討論導致錯誤預報的模型 bug。他們不會去求宙斯說:宙斯啊,請告訴我們為什麼我們的天氣錯了。
Steven Sinofsky26:23
數字與實體
| 1998 年 3 月病毒造成的單日經濟損失 | 120 億美元 | 14:10 |
| 第一版 Windows Excel 的 bug 寫入內容 | send dogs(S-I-N-D-O-G-S) | 9:08 |
| Excel 該 bug 復現所需連續運行時間 | 約兩天 | 9:08 |
| Sinofsky 大學時宿舍裡有電腦的人數 | 100 人宿舍裡 2 人 | 2:02 |
| IBM 自稱做 bug 分級制度的起始年份 | 1965 年 | 25:18 |
術語
- alignment對齊
- 讓 AI 行為符合人類意圖的說法;Sinofsky 認為它把軟件 bug 包裝成了道德問題。
- telemetry遙測
- 軟件崩潰或異常時自動回傳運行數據的機制,是定位 bug 的前提。
- CVE通用漏洞披露
- 公開記錄軟件安全漏洞的編號體系,Sinofsky 視其為缺陷上報的範本。
- OPSEC運營安全
- operational security,指通過流程和配置防止系統被入侵或濫用的實踐。
- SevOne, PriOne一級嚴重度、一級優先級
- 微軟內部對 bug 的行話:severity 一是丟數據,priority 一是必須修。
收聽指南
做 AI 產品、安全和政策溝通的創始人與工程師;需要向非技術方解釋模型事故、正在寫事故報告或應對監管的人。
23:13–24:13 的 Mac 對 PC 廣告回憶,屬於閒聊,可跳過。