AI 安全缺的不是錢,是願意下泥潭的創始人
Coefficient Giving 的 AI 安全資助上限不是 2 億美元,未來一兩年會出現更大的單筆;真正的瓶頸是人才,尤其是願意在問題還沒發生時就下注的創始人。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 時間戳為按文稿位置估算
唯一瓶頸是人才,不是錢
Max 說得很直接:最重要的瓶頸,也許是唯一的瓶頸,就是人才。AI 安全組織手裡都有一長串想做但沒人力執行的項目,包括和 AGI 公司、政府的合作。Coefficient Giving 給技術 AI 安全組織的單筆資助上限不是 2 億美元,未來一兩年會出現更大的單筆。所以問題不是沒錢,是沒人舉手。
— Max Nadeau資助分三檔,最快兩週給決定
Project Tailwind 把資助分成三檔:preseed 給還沒組隊、只有初步想法的創始人,20 萬到 200 萬美元;seed 要求有創始團隊、多人覆蓋關鍵職能、有初步結果,200 萬到 2000 萬美元;對已經建立 track record 的組織,願意單筆給到 2 億美元,甚至這可以是第一筆。他們還借用了 VC 的 pitch day,創始人講 15 分鐘,幾週內給決定。
— Max Nadeauhits-based giving:大多數資助註定沒影響
Coefficient Giving 一直沿用 hits-based giving,借自 VC 的 hits-based investing:做一堆資助,大部分沒有影響,少數幾個好到讓整個組合值得。他們現在更用力地押這個邏輯,刻意避免資助機構的常見失敗模式——過度審查預算、確保每一分錢都花得對——而是確保最好的項目拿到它需要的全部資金。
— Max Nadeau1.6 億美元給的是「用 AI 加速安全研究」
Resolution 拿到 1.6 億美元,CEO Geoffrey Irving 是技術 AI 安全的領軍人物,曾任英國 AI Security Institute 首席科學家,之前在 Google DeepMind 和 OpenAI 帶 AI 安全團隊。打動 Coefficient 的不只是他的履歷,還有他的計劃:建一個直接研究對齊超級智能的大型研究中心,並且花大量時間用 AI 加速安全研究——因為能力研究那邊正在發生「五年進展壓縮到一年」的機會,他們希望受資助者抓住。
— Max NadeauAI 安全創始人要願意想還沒發生的問題
Max 說 AI 安全公益創業和普通創業共享毅力、能量、管理能力,但有一個獨特要求:對 impact theory 極度挑剔,願意大幅 pivot;並且願意思考沒有明確答案的推測性問題,對未來 AI 走向下注。很多人的本能是只做今天更紮實、更可驗證的問題,但 AI 安全的問題大多還沒顯現。METR 就是例子:在 AI 能力還沒起飛時就想出評估方法,比同期的 benchmark 更經得起時間考驗。
— Max Nadeau非營利最容易忘記「誰要因此改變行為」
Max 點出非營利的一個常見失敗模式:因為不需要真的讓客戶掏錢,就不夠認真地想「世界上到底誰要因為你的工作改變做法」。你要麼希望別人讀你的報告改變看法,要麼希望他們採用你開發的做法,要麼希望他們去做一條你做不了的研究線。作為公益創業,你得想清楚整條影響供應鏈的每一步,好想法和讓好想法進入別人腦子,靠的是不同的能力。
— Max NadeauRedwood 砍到兩個人,一年後重新做大
Redwood Research 的 Buck Shlegeris 和 Ryan Greenblatt 判斷機械可解釋性產出不夠,做了艱難決定:把組織縮到只剩兩人,花一年想 AI 安全版圖裡最大的洞和最被低估的方法,然後帶著 AI control 等想法重新擴張。當時他們捱了很多罵,對所有人都不好受。但 Max 說,現在回頭看,他們和幾乎所有人認識的人都認為,這比按原路走下去影響大得多。沒有市場力量逼他們,資助方也沒施壓,壓力反而來自熟人。
— Max NadeauAI 公司內部的安全團隊被向下競爭壓著
Max 認為 AI 公司內部的安全團隊處在一場殘酷的向下競爭裡:他們被壓著去開發實施成本不高的安全技術,快速做部署前評估,好讓模型趕緊內部部署加速研究、或外部部署賺錢,還要撲滅眼前正在燒的火。結論是這些公司沒有足夠支付意願,缺少自上而下的組織優先級和資源分配。要增加支付意願、鬆開向下競爭的壓力,最好的機會在 AI 公司外面。
— Max Nadeau外部組織要做 AI 公司做不了的事
Max 說外部組織開發新的經驗性安全技術,影響會小很多:你拿不到 AI 公司內部的約束和成本細節,也拿不到它們的數據。過去幾年越獄變難了,但很少能歸功於外部研究者。外部真正不會被取代的,是提供證據和分析、評估 AI 風險狀態的工作——AI 公司不是可信聲音,而且這類工作要跨多家公司的多個 AI 做比較。讀 system card 和讀 METR 的 misalignment 風險評估,得到的圖景完全不同。
— Max NadeauAnthropic 吸走人才,但裡面的人未必在最高影響崗位
Max 承認 Anthropic 招人很快,從 AI 安全領域各機構拉人。但他觀察到,即使在 Anthropic 內部,很多人也沒有在追求自己當前軌跡上影響更大的機會。他認為對其中不少人來說,離開 Anthropic 去第三方生態會更好。他由此推斷:很多在 Anthropic 工作的人,主要動機並不是儘可能有影響——這不一定是錯的,但新人看到這麼多人在 Anthropic 做 AI 安全,容易誤以為他們都認真想過並認定這是最高影響的選擇。
— Max Nadeau非營利比營利更敢碰沒客戶的問題
Max 認為 AI 安全領域的非營利在影響力和所處理問題的規模上,比營利組織更有野心。營利組織傾向於做已經被理解、已經有客戶願意付錢、VC 也懂的問題,而且影響的是有錢付賬的人。非營利由 impact-motivated 資助方支持,可以專注還沒顯現的問題。他舉例:AI agent 行為不端、prompt injection 這些今天真實的問題,按美元或痛苦/快樂的總量算,比 AI 引發大流行、AI 失控消滅或淘汰人類這類推測性風險小得多——但後者很難從 VC 融錢,因為「產品是什麼?客戶是誰?」
— Max Nadeau六類最想看到被創立的組織
Max 列出六類:一,獨立審計和評估 AI 公司安全實踐的組織,Hugging Face 事件和 Mythos UK AISI 事件顯示了必要性;二,研究對齊和讓強大模型安全的新技術的研究中心,比如 chain-of-thought monitorability;三,更好的證據生成,比如 OpenAI 內部的 misalignment 事件是外部 Hugging Face 發現的;四,安全和驗證相關的技術研究,包括供應鏈漏洞和訓練數據投毒;五,AI 安全領域的公共品,比如 MATS 把 fellowship 集中起來,或新的算力集群;六,fieldbuilding 組織,幫全世界新感興趣的人進入這個領域。
— Max Nadeau原話 · 已逐字校驗
I think the most important bottleneck, maybe the only bottleneck, is talent.
我認為最重要的瓶頸,也許是唯一的瓶頸,是人才。
Max Nadeau0:00
I mean, $200 million is not like an upper limit on the largest size of a grant Coefficient Giving will ever give to an organisation in the technical AI safety space.
我的意思是,2 億美元並不是 Coefficient Giving 在技術 AI 安全領域給一個組織的單筆資助上限。
Max Nadeau0:00
So I think that there’s a lot of opportunity for people who are willing to get down in the mud of these speculative questions, and are willing to entertain these sorts of out-there hypotheticals.
所以我認為,對於那些願意下到這些推測性問題的泥潭裡、願意認真對待這些離譜假設的人來說,機會很多。
Max Nadeau16:00
Because unlike with for-profits, where you can learn on the job and learn from this impossible-to-fake demand signal of, “Are you making money?,” in AI safety, no one will tell you if you’re not having impact.
因為和營利組織不同——在那裡你可以在幹中學,從「你在賺錢嗎」這個無法偽造的需求信號裡學習——在 AI 安全領域,如果你沒有產生影響,沒有人會告訴你。
Max Nadeau18:16
And we’re going to need more slack and more willingness to pay — for both research, and then also, just in practice, putting in place costly measures while we’re using AIs that are going to slow down things and reduce revenue and otherwise get in the way in order to prevent large negative externalities from being imposed on the world.
我們需要更多餘裕和更多支付意願——既用於研究,也用於實踐中:在使用 AI 時採取會拖慢進度、減少收入、礙事的昂貴措施,以防止巨大的負外部性被強加給世界。
Max Nadeau31:02
So if you’re very morally ambitious, and you’re trying to have as much impact as you can, I think those are not necessarily the role models that you should be looking towards for what it looks like to try and have as much impact as you can.
所以如果你在道德上非常有野心,想盡可能有影響,我認為那些人不一定是你該看齊的榜樣——如果你想知道盡可能有影響是什麼樣子。
Max Nadeau38:52
From my perspective, I see the nonprofits in the AI safety space as being much more ambitious with respect to impact and with respect to the problems they’re tackling than the for-profits.
在我看來,AI 安全領域的非營利組織,在影響力和所處理問題的規模上,比營利組織有野心得多。
Max Nadeau46:41
For example, the misalignment incidents inside OpenAI were only detected by Hugging Face, which was a third party outside of OpenAI.
例如,OpenAI 內部的 misalignment 事件,是被 OpenAI 之外的第三方 Hugging Face 發現的。
Max Nadeau56:53
數字與實體
| Project Tailwind seed 資助區間 | 200 萬到 2000 萬美元 | 4:30 |
| Coefficient Giving 單筆資助上限 | 2 億美元,且不是最終上限 | 0:00 |
| Resolution 獲得的資助 | 1.6 億美元 | 8:00 |
| Redwood 的 ML for alignment bootcamp 和 REMIX 參與人數 | 30 到 50 人 | 2:00 |
| Tailwind 網站上的項目 stub 數量 | 36 個 | 3:26 |
術語
- hits-based giving押注式資助
- 做一堆資助,大部分沒影響,少數幾個好到讓整個組合值得。
- chain-of-thought monitorability思維鏈可監控性
- 能否用 AI 的思維鏈來監督 AI,在它行為不當時抓住它。
- preseed grant種子前資助
- 給還沒組隊、只有初步想法的創始人的小額資助。
- seed grant種子資助
- 給已有創始團隊和初步結果的組織的中額資助。
- fieldbuilding領域建設
- 通過培訓、社群、匹配等方式幫人進入並留在某個領域。
收聽指南
想拿資助做 AI 安全公益創業的創始人、考慮從 AI 公司跳出來的安全研究者、關注 AI 安全資助格局的捐贈人。
對 AI 安全資助機制不感興趣的人,可跳過 3:26 到 6:07 的資助檔位細節。