世界太吵,来原声听播客

80,000 Hours

AI 安全缺的不是钱,是愿意下泥潭的创始人

Coefficient Giving 的 AI 安全资助上限不是 2 亿美元,未来一两年会出现更大的单笔;真正的瓶颈是人才,尤其是愿意在问题还没发生时就下注的创始人。

AI 安全公益创业资助人才Anthropic

原视频在 YouTube 上放不出来,用音频听:

这集信息密度中等,但给出了 AI 安全公益创业的具体资助阶梯、六类缺口和创始人筛选标准,适合想拿钱做事的人。

核心论点 · 时间戳为按文稿位置估算

0:00

唯一瓶颈是人才,不是钱

Max 说得很直接:最重要的瓶颈,也许是唯一的瓶颈,就是人才。AI 安全组织手里都有一长串想做但没人力执行的项目,包括和 AGI 公司、政府的合作。Coefficient Giving 给技术 AI 安全组织的单笔资助上限不是 2 亿美元,未来一两年会出现更大的单笔。所以问题不是没钱,是没人举手。

— Max Nadeau
3:26

资助分三档,最快两周给决定

Project Tailwind 把资助分成三档:preseed 给还没组队、只有初步想法的创始人,20 万到 200 万美元;seed 要求有创始团队、多人覆盖关键职能、有初步结果,200 万到 2000 万美元;对已经建立 track record 的组织,愿意单笔给到 2 亿美元,甚至这可以是第一笔。他们还借用了 VC 的 pitch day,创始人讲 15 分钟,几周内给决定。

— Max Nadeau
6:07

hits-based giving:大多数资助注定没影响

Coefficient Giving 一直沿用 hits-based giving,借自 VC 的 hits-based investing:做一堆资助,大部分没有影响,少数几个好到让整个组合值得。他们现在更用力地押这个逻辑,刻意避免资助机构的常见失败模式——过度审查预算、确保每一分钱都花得对——而是确保最好的项目拿到它需要的全部资金。

— Max Nadeau
8:00

1.6 亿美元给的是「用 AI 加速安全研究」

Resolution 拿到 1.6 亿美元,CEO Geoffrey Irving 是技术 AI 安全的领军人物,曾任英国 AI Security Institute 首席科学家,之前在 Google DeepMind 和 OpenAI 带 AI 安全团队。打动 Coefficient 的不只是他的履历,还有他的计划:建一个直接研究对齐超级智能的大型研究中心,并且花大量时间用 AI 加速安全研究——因为能力研究那边正在发生「五年进展压缩到一年」的机会,他们希望受资助者抓住。

— Max Nadeau
16:00

AI 安全创始人要愿意想还没发生的问题

Max 说 AI 安全公益创业和普通创业共享毅力、能量、管理能力,但有一个独特要求:对 impact theory 极度挑剔,愿意大幅 pivot;并且愿意思考没有明确答案的推测性问题,对未来 AI 走向下注。很多人的本能是只做今天更扎实、更可验证的问题,但 AI 安全的问题大多还没显现。METR 就是例子:在 AI 能力还没起飞时就想出评估方法,比同期的 benchmark 更经得起时间考验。

— Max Nadeau
22:05

非营利最容易忘记「谁要因此改变行为」

Max 点出非营利的一个常见失败模式:因为不需要真的让客户掏钱,就不够认真地想「世界上到底谁要因为你的工作改变做法」。你要么希望别人读你的报告改变看法,要么希望他们采用你开发的做法,要么希望他们去做一条你做不了的研究线。作为公益创业,你得想清楚整条影响供应链的每一步,好想法和让好想法进入别人脑子,靠的是不同的能力。

— Max Nadeau
23:31

Redwood 砍到两个人,一年后重新做大

Redwood Research 的 Buck Shlegeris 和 Ryan Greenblatt 判断机械可解释性产出不够,做了艰难决定:把组织缩到只剩两人,花一年想 AI 安全版图里最大的洞和最被低估的方法,然后带着 AI control 等想法重新扩张。当时他们挨了很多骂,对所有人都不好受。但 Max 说,现在回头看,他们和几乎所有人认识的人都认为,这比按原路走下去影响大得多。没有市场力量逼他们,资助方也没施压,压力反而来自熟人。

— Max Nadeau
29:08

AI 公司内部的安全团队被向下竞争压着

Max 认为 AI 公司内部的安全团队处在一场残酷的向下竞争里:他们被压着去开发实施成本不高的安全技术,快速做部署前评估,好让模型赶紧内部部署加速研究、或外部部署赚钱,还要扑灭眼前正在烧的火。结论是这些公司没有足够支付意愿,缺少自上而下的组织优先级和资源分配。要增加支付意愿、松开向下竞争的压力,最好的机会在 AI 公司外面。

— Max Nadeau
33:15

外部组织要做 AI 公司做不了的事

Max 说外部组织开发新的经验性安全技术,影响会小很多:你拿不到 AI 公司内部的约束和成本细节,也拿不到它们的数据。过去几年越狱变难了,但很少能归功于外部研究者。外部真正不会被取代的,是提供证据和分析、评估 AI 风险状态的工作——AI 公司不是可信声音,而且这类工作要跨多家公司的多个 AI 做比较。读 system card 和读 METR 的 misalignment 风险评估,得到的图景完全不同。

— Max Nadeau
37:01

Anthropic 吸走人才,但里面的人未必在最高影响岗位

Max 承认 Anthropic 招人很快,从 AI 安全领域各机构拉人。但他观察到,即使在 Anthropic 内部,很多人也没有在追求自己当前轨迹上影响更大的机会。他认为对其中不少人来说,离开 Anthropic 去第三方生态会更好。他由此推断:很多在 Anthropic 工作的人,主要动机并不是尽可能有影响——这不一定是错的,但新人看到这么多人在 Anthropic 做 AI 安全,容易误以为他们都认真想过并认定这是最高影响的选择。

— Max Nadeau
45:00

非营利比营利更敢碰没客户的问题

Max 认为 AI 安全领域的非营利在影响力和所处理问题的规模上,比营利组织更有野心。营利组织倾向于做已经被理解、已经有客户愿意付钱、VC 也懂的问题,而且影响的是有钱付账的人。非营利由 impact-motivated 资助方支持,可以专注还没显现的问题。他举例:AI agent 行为不端、prompt injection 这些今天真实的问题,按美元或痛苦/快乐的总量算,比 AI 引发大流行、AI 失控消灭或淘汰人类这类推测性风险小得多——但后者很难从 VC 融钱,因为「产品是什么?客户是谁?」

— Max Nadeau
54:00

六类最想看到被创立的组织

Max 列出六类:一,独立审计和评估 AI 公司安全实践的组织,Hugging Face 事件和 Mythos UK AISI 事件显示了必要性;二,研究对齐和让强大模型安全的新技术的研究中心,比如 chain-of-thought monitorability;三,更好的证据生成,比如 OpenAI 内部的 misalignment 事件是外部 Hugging Face 发现的;四,安全和验证相关的技术研究,包括供应链漏洞和训练数据投毒;五,AI 安全领域的公共品,比如 MATS 把 fellowship 集中起来,或新的算力集群;六,fieldbuilding 组织,帮全世界新感兴趣的人进入这个领域。

— Max Nadeau

原话 · 已逐字校验

I think the most important bottleneck, maybe the only bottleneck, is talent.

我认为最重要的瓶颈,也许是唯一的瓶颈,是人才。

Max Nadeau0:00

I mean, $200 million is not like an upper limit on the largest size of a grant Coefficient Giving will ever give to an organisation in the technical AI safety space.

我的意思是,2 亿美元并不是 Coefficient Giving 在技术 AI 安全领域给一个组织的单笔资助上限。

Max Nadeau0:00

So I think that there’s a lot of opportunity for people who are willing to get down in the mud of these speculative questions, and are willing to entertain these sorts of out-there hypotheticals.

所以我认为,对于那些愿意下到这些推测性问题的泥潭里、愿意认真对待这些离谱假设的人来说,机会很多。

Max Nadeau16:00

Because unlike with for-profits, where you can learn on the job and learn from this impossible-to-fake demand signal of, “Are you making money?,” in AI safety, no one will tell you if you’re not having impact.

因为和营利组织不同——在那里你可以在干中学,从「你在赚钱吗」这个无法伪造的需求信号里学习——在 AI 安全领域,如果你没有产生影响,没有人会告诉你。

Max Nadeau18:16

And we’re going to need more slack and more willingness to pay — for both research, and then also, just in practice, putting in place costly measures while we’re using AIs that are going to slow down things and reduce revenue and otherwise get in the way in order to prevent large negative externalities from being imposed on the world.

我们需要更多余裕和更多支付意愿——既用于研究,也用于实践中:在使用 AI 时采取会拖慢进度、减少收入、碍事的昂贵措施,以防止巨大的负外部性被强加给世界。

Max Nadeau31:02

So if you’re very morally ambitious, and you’re trying to have as much impact as you can, I think those are not necessarily the role models that you should be looking towards for what it looks like to try and have as much impact as you can.

所以如果你在道德上非常有野心,想尽可能有影响,我认为那些人不一定是你该看齐的榜样——如果你想知道尽可能有影响是什么样子。

Max Nadeau38:52

From my perspective, I see the nonprofits in the AI safety space as being much more ambitious with respect to impact and with respect to the problems they’re tackling than the for-profits.

在我看来,AI 安全领域的非营利组织,在影响力和所处理问题的规模上,比营利组织有野心得多。

Max Nadeau46:41

For example, the misalignment incidents inside OpenAI were only detected by Hugging Face, which was a third party outside of OpenAI.

例如,OpenAI 内部的 misalignment 事件,是被 OpenAI 之外的第三方 Hugging Face 发现的。

Max Nadeau56:53

数字与实体

Project Tailwind seed 资助区间200 万到 2000 万美元4:30
Coefficient Giving 单笔资助上限2 亿美元,且不是最终上限0:00
Resolution 获得的资助1.6 亿美元8:00
Redwood 的 ML for alignment bootcamp 和 REMIX 参与人数30 到 50 人2:00
Tailwind 网站上的项目 stub 数量36 个3:26

术语

hits-based giving押注式资助
做一堆资助,大部分没影响,少数几个好到让整个组合值得。
chain-of-thought monitorability思维链可监控性
能否用 AI 的思维链来监督 AI,在它行为不当时抓住它。
preseed grant种子前资助
给还没组队、只有初步想法的创始人的小额资助。
seed grant种子资助
给已有创始团队和初步结果的组织的中额资助。
fieldbuilding领域建设
通过培训、社群、匹配等方式帮人进入并留在某个领域。

收听指南

谁该听

想拿资助做 AI 安全公益创业的创始人、考虑从 AI 公司跳出来的安全研究者、关注 AI 安全资助格局的捐赠人。

可跳过

对 AI 安全资助机制不感兴趣的人,可跳过 3:26 到 6:07 的资助档位细节。