AI 安全聯盟突然成型,但沒人知道怎麼量「前沿」
Hugging Face 事件讓左翼和 AI 安全派第一次合流,可「pacing the frontier」這個詞本身就沒法測量——沒有立法,第三方評估只是自願的善意。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
反數據中心和 AI 安全合流了
Jasmine 追蹤的時間線是:八月上旬的 pacing 公開信、緊接著的 Hugging Face 事件,兩條線撞在一起。此前反數據中心、反 AI 的民粹情緒是彌散的,而 AI 安全圈一直在糾結要不要跟 Tucker Carlson、Bernie 這類人對話——擔心對方不是「追求真相」的人。結果左翼先放下了對 AI 安全的懷疑,Bernie 比任何人都更讓大眾相信「AI 是真的、AI 風險是真的」,不是公司編的營銷話術。於是當 Hugging Face 撞上來,公眾剛好願意去關心真正的前沿安全議題。
— Jasmine公眾不關心滅絕,但關心公司失控
Jasmine 的判斷是:沒人是按 AI 議題投票的,連前五都排不上。但「這些公司太無法無天、權力太集中、需要監管數據中心、需要透明度、需要政府審計」是很普遍的直覺。你問公眾要不要第三方評估員、要不要給 Casey 撥款,沒人有意見;但你說 AI 跑偏了、該讓 FBI 去查,大家點頭。Nathan 補了一句:Hugging Face 事件敘事上太順了,《紐約郵報》封面用終結者都不算離譜,事實的韻腳剛好能對上普通人能看懂的恐懼。
— Jasmine對齊是暫時的,網絡安全是永久的
Nathan 把問題拆成兩層:前沿的差異化能力上確實有對齊責任,但前沿實驗室捅開的洞,三到六個月後就有三個模型能做,一年後二十多個組織能做。所以對齊問題只是「暫時」屬於前沿實驗室,而網絡安全問題不會自己消失,直到被真正解決。他同時說,網絡圈的人很清楚:我們的基礎設施還沒準備好迎接即將無處不在的工具。
— Nathanpacing 這個詞選得就很自利
Jordan 指出 pacing 既不是 pause 也不是 slowdown,選這個詞本身就暗示還在往前走。Nathan 更直接:我們根本不知道怎麼測量前沿模型,任何 pacing 都預設了你能測。他真正不滿的是實驗室內部那套話術——「你看不到,我們內部也害怕進展速度」——在缺乏透明度的情況下這句話沒有意義。他設想的機制是:每個實驗室裡都有一批能同時看到一兩個實驗室的人,共同認可當前能力下的安全工作量已經足夠。
— Nathan信任只存在於認識五年的人之間
Jasmine 點出評估機構落地的真實障礙:Anthropic 之所以願意給 METR 的人 Slack 權限,是因為跟這些人私交五年以上,是「A.J. 或 Ryan Greenblatt 可以進來」這種級別的信任,而這種信任未必能轉移到 METR 的其他人或別的機構。第二個問題是 Jordan 提的:如果第三方評估員跟那個美國經濟所依賴的巨頭意見相左,政府聽誰的?她同時認為第三方評估其實是比「特朗普政府直接派人上門關模型」更親 AI 進步的妥協方案。
— Jasmine沒有立法,評估就是自願的善意
Jasmine 的結論很硬:只要沒有立法,一切都是自願的,那麼 METR、Redwood 這些機構在某種程度上就不會去激怒那個給他們自願訪問權的組織。她舉了 METR 和 Redwood 對 Hugging Face 事件的調查——完全自願,只拿到七天 Slack 日誌,所有人都想要更多,但當時沒有任何立法要求 OpenAI 做任何事,純粹靠他們恰好信任這三個隨機的人。她還設想了一個更糟的未來:XAI、Anthropic、OpenAI 都在 pacing,Meta 不在,評估員在三家都發現了同一個致命失效模式,但這是各家的私有信息,Meta 直接 YOLO 放出去。
— Jasmine中國實驗室在爬坡,不在換範式
Nathan 判斷:在當前範式內,中國實驗室被組織成非常擅長爬山的樣子。Zhipu 和 ZAI 的後訓練棧已經很成熟,GLM 5.2、5.3 都很紮實,Kimi 的基座模型配方也摸清了,正在做的事就是擴 RL 環境、擴 RL、找對用戶分布、拉長 horizon。除非 OpenAI 和 Anthropic 找到新範式,否則近期中國這邊的進展速度不會有太大差別。關於蒸餾:如果美國實驗室停止發布或大幅放慢,中國進展會不會慢下來?Nathan 認為那要很久才會顯現。
— Nathan中國開源權重開始延遲三週
Jordan 觀察到中國模型的開放權重部分已經慢下來了:先在自己的產品和 API 裡發布,權重兩到三週後才放出來。Kimi 和 ZAI 都是先宣布模型,差不多正好三週後才在 Hugging Face 上傳權重。他不確定這是不是內部監管流程——中國所有 AI 實驗室都要跟政府溝通、登記發布——但覺得這個巧合太奇怪。Nathan 補充:這個行業歷來沒有給發布夥伴留大量額外時間的傳統,通常是「模型給你,燙手山芋,祝你好運」,所以如果真能提前幾週拿到權重,那本身就是個信號。
— Jordan原話 · 已逐字校驗
And actually now the AI safety folks and the broader public that was already souring on AI, souring on data centers, souring on the companies have like collided into a mega moment for AI safety and regulation.
而現在,AI 安全圈和那些本來就已經對 AI、對數據中心、對這些公司不滿的公眾,撞成了一個 AI 安全與監管的大時刻。
Jasmine2:09
So I think that it's like, therefore, like, it's not that it's like an alignment issue for a transient period of time. But there's a very constant cyber issue that is not going away until we solve it.
所以我認為,對齊問題只是一段時間內的問題。但網絡安全問題會一直存在,直到我們解決它為止。
Nathan12:38
We don't know how to measure frontier models. We don't know how to measure it. So like any pacing would infer, like you're trying to not go past certain measurements.
我們不知道怎麼測量前沿模型。我們不知道怎麼測。所以任何 pacing 都預設了你想不越過某些測量值。
Nathan14:43
It's like voluntary, which means that the org, even if they're like trying their best to be like independent and aggressive and whatever, like there is an extent to which meter Redwood or whoever will not antagonize org that is giving them voluntary access.
它是自願的,這意味著即使這些機構盡力想保持獨立、強硬,METR、Redwood 或任何一家,在某種程度上都不會去激怒那個給他們自願訪問權的組織。
Jasmine24:22
Within the current paradigm, I think the Chinese labs are set up to hill climb very well.
在當前範式內,我認為中國實驗室被組織成非常擅長爬山的樣子。
Nathan29:32
At least the like open wait part of the Chinese models has slowed down. So they have started releasing their models in their own offerings and APIs. And then like the waits come two to three weeks later.
至少中國模型的開放權重部分已經慢下來了。他們開始先在自己的產品和 API 裡發布模型,然後權重兩到三週後才出來。
Jordan34:40
And so if we just get a bunch of like actual real world mundane utility progress because we stop focusing on RSI, that might be kind of great.
所以如果我們因為不再專注於 RSI,而獲得一堆真實世界裡平凡但有用的進展,那可能還挺好的。
Nathan45:13
數字與實體
| Casey 的預算規模 | 1000 萬美元 | 21:15 |
| METR 和 Redwood 調查 Hugging Face 事件拿到的 Slack 日誌 | 7 天 | 28:32 |
| 中國實驗室先發模型、後放權重的間隔 | 2 到 3 周 | 34:40 |
| 前沿能力擴散到多個組織的時間 | 3 到 6 個月後有 3 個模型能做,一年後 20 多個組織能做 | 12:38 |
術語
- pacing the frontier為前沿定速
- 既非暫停也非減速,暗示仍在前進但控制節奏,被批評為無法測量的自利說法。
- RSI遞歸自我改進
- 模型自己改進自己,被認為是一切不在其路徑上的能力都被忽視的原因。
- open weights開放權重
- 把模型參數公開下載,中國實驗室近期改為先發產品、延遲兩三週再放權重。
- hill climb爬山
- 在現有範式內靠調參和擴環境持續提升,而非換範式。
收聽指南
關注 AI 監管走向的創業者與投資人,尤其是想知道美國安全聯盟怎麼成型、中國開源節奏會不會被打斷的人。
47:14 到 50:18 關於 Sam Altman 電影選角和演員的閒聊,可以跳過。