世界太吵,来原声听播客

ChinaTalk

AI 安全联盟突然成型,但没人知道怎么量「前沿」

Hugging Face 事件让左翼和 AI 安全派第一次合流,可「pacing the frontier」这个词本身就没法测量——没有立法,第三方评估只是自愿的善意。

AI 安全监管中国开源前沿模型第三方评估

原视频在 YouTube 上放不出来,用音频听:

信息密度中等,前半小时的联盟政治和后半小时的中国开源节奏是干货,中间关于评估机构怎么落地的讨论偏发散。

核心论点 · 点时间戳可跳到原声

2:09

反数据中心和 AI 安全合流了

Jasmine 追踪的时间线是:八月上旬的 pacing 公开信、紧接着的 Hugging Face 事件,两条线撞在一起。此前反数据中心、反 AI 的民粹情绪是弥散的,而 AI 安全圈一直在纠结要不要跟 Tucker Carlson、Bernie 这类人对话——担心对方不是「追求真相」的人。结果左翼先放下了对 AI 安全的怀疑,Bernie 比任何人都更让大众相信「AI 是真的、AI 风险是真的」,不是公司编的营销话术。于是当 Hugging Face 撞上来,公众刚好愿意去关心真正的前沿安全议题。

— Jasmine
5:15

公众不关心灭绝,但关心公司失控

Jasmine 的判断是:没人是按 AI 议题投票的,连前五都排不上。但「这些公司太无法无天、权力太集中、需要监管数据中心、需要透明度、需要政府审计」是很普遍的直觉。你问公众要不要第三方评估员、要不要给 Casey 拨款,没人有意见;但你说 AI 跑偏了、该让 FBI 去查,大家点头。Nathan 补了一句:Hugging Face 事件叙事上太顺了,《纽约邮报》封面用终结者都不算离谱,事实的韵脚刚好能对上普通人能看懂的恐惧。

— Jasmine
12:38

对齐是暂时的,网络安全是永久的

Nathan 把问题拆成两层:前沿的差异化能力上确实有对齐责任,但前沿实验室捅开的洞,三到六个月后就有三个模型能做,一年后二十多个组织能做。所以对齐问题只是「暂时」属于前沿实验室,而网络安全问题不会自己消失,直到被真正解决。他同时说,网络圈的人很清楚:我们的基础设施还没准备好迎接即将无处不在的工具。

— Nathan
14:43

pacing 这个词选得就很自利

Jordan 指出 pacing 既不是 pause 也不是 slowdown,选这个词本身就暗示还在往前走。Nathan 更直接:我们根本不知道怎么测量前沿模型,任何 pacing 都预设了你能测。他真正不满的是实验室内部那套话术——「你看不到,我们内部也害怕进展速度」——在缺乏透明度的情况下这句话没有意义。他设想的机制是:每个实验室里都有一批能同时看到一两个实验室的人,共同认可当前能力下的安全工作量已经足够。

— Nathan
19:09

信任只存在于认识五年的人之间

Jasmine 点出评估机构落地的真实障碍:Anthropic 之所以愿意给 METR 的人 Slack 权限,是因为跟这些人私交五年以上,是「A.J. 或 Ryan Greenblatt 可以进来」这种级别的信任,而这种信任未必能转移到 METR 的其他人或别的机构。第二个问题是 Jordan 提的:如果第三方评估员跟那个美国经济所依赖的巨头意见相左,政府听谁的?她同时认为第三方评估其实是比「特朗普政府直接派人上门关模型」更亲 AI 进步的妥协方案。

— Jasmine
24:22

没有立法,评估就是自愿的善意

Jasmine 的结论很硬:只要没有立法,一切都是自愿的,那么 METR、Redwood 这些机构在某种程度上就不会去激怒那个给他们自愿访问权的组织。她举了 METR 和 Redwood 对 Hugging Face 事件的调查——完全自愿,只拿到七天 Slack 日志,所有人都想要更多,但当时没有任何立法要求 OpenAI 做任何事,纯粹靠他们恰好信任这三个随机的人。她还设想了一个更糟的未来:XAI、Anthropic、OpenAI 都在 pacing,Meta 不在,评估员在三家都发现了同一个致命失效模式,但这是各家的私有信息,Meta 直接 YOLO 放出去。

— Jasmine
29:32

中国实验室在爬坡,不在换范式

Nathan 判断:在当前范式内,中国实验室被组织成非常擅长爬山的样子。Zhipu 和 ZAI 的后训练栈已经很成熟,GLM 5.2、5.3 都很扎实,Kimi 的基座模型配方也摸清了,正在做的事就是扩 RL 环境、扩 RL、找对用户分布、拉长 horizon。除非 OpenAI 和 Anthropic 找到新范式,否则近期中国这边的进展速度不会有太大差别。关于蒸馏:如果美国实验室停止发布或大幅放慢,中国进展会不会慢下来?Nathan 认为那要很久才会显现。

— Nathan
34:40

中国开源权重开始延迟三周

Jordan 观察到中国模型的开放权重部分已经慢下来了:先在自己的产品和 API 里发布,权重两到三周后才放出来。Kimi 和 ZAI 都是先宣布模型,差不多正好三周后才在 Hugging Face 上传权重。他不确定这是不是内部监管流程——中国所有 AI 实验室都要跟政府沟通、登记发布——但觉得这个巧合太奇怪。Nathan 补充:这个行业历来没有给发布伙伴留大量额外时间的传统,通常是「模型给你,烫手山芋,祝你好运」,所以如果真能提前几周拿到权重,那本身就是个信号。

— Jordan

原话 · 已逐字校验

And actually now the AI safety folks and the broader public that was already souring on AI, souring on data centers, souring on the companies have like collided into a mega moment for AI safety and regulation.

而现在,AI 安全圈和那些本来就已经对 AI、对数据中心、对这些公司不满的公众,撞成了一个 AI 安全与监管的大时刻。

Jasmine2:09

So I think that it's like, therefore, like, it's not that it's like an alignment issue for a transient period of time. But there's a very constant cyber issue that is not going away until we solve it.

所以我认为,对齐问题只是一段时间内的问题。但网络安全问题会一直存在,直到我们解决它为止。

Nathan12:38

We don't know how to measure frontier models. We don't know how to measure it. So like any pacing would infer, like you're trying to not go past certain measurements.

我们不知道怎么测量前沿模型。我们不知道怎么测。所以任何 pacing 都预设了你想不越过某些测量值。

Nathan14:43

It's like voluntary, which means that the org, even if they're like trying their best to be like independent and aggressive and whatever, like there is an extent to which meter Redwood or whoever will not antagonize org that is giving them voluntary access.

它是自愿的,这意味着即使这些机构尽力想保持独立、强硬,METR、Redwood 或任何一家,在某种程度上都不会去激怒那个给他们自愿访问权的组织。

Jasmine24:22

Within the current paradigm, I think the Chinese labs are set up to hill climb very well.

在当前范式内,我认为中国实验室被组织成非常擅长爬山的样子。

Nathan29:32

At least the like open wait part of the Chinese models has slowed down. So they have started releasing their models in their own offerings and APIs. And then like the waits come two to three weeks later.

至少中国模型的开放权重部分已经慢下来了。他们开始先在自己的产品和 API 里发布模型,然后权重两到三周后才出来。

Jordan34:40

And so if we just get a bunch of like actual real world mundane utility progress because we stop focusing on RSI, that might be kind of great.

所以如果我们因为不再专注于 RSI,而获得一堆真实世界里平凡但有用的进展,那可能还挺好的。

Nathan45:13

数字与实体

Casey 的预算规模1000 万美元21:15
METR 和 Redwood 调查 Hugging Face 事件拿到的 Slack 日志7 天28:32
中国实验室先发模型、后放权重的间隔2 到 3 周34:40
前沿能力扩散到多个组织的时间3 到 6 个月后有 3 个模型能做,一年后 20 多个组织能做12:38

术语

pacing the frontier为前沿定速
既非暂停也非减速,暗示仍在前进但控制节奏,被批评为无法测量的自利说法。
RSI递归自我改进
模型自己改进自己,被认为是一切不在其路径上的能力都被忽视的原因。
open weights开放权重
把模型参数公开下载,中国实验室近期改为先发产品、延迟两三周再放权重。
hill climb爬山
在现有范式内靠调参和扩环境持续提升,而非换范式。

收听指南

谁该听

关注 AI 监管走向的创业者与投资人,尤其是想知道美国安全联盟怎么成型、中国开源节奏会不会被打断的人。

可跳过

47:14 到 50:18 关于 Sam Altman 电影选角和演员的闲聊,可以跳过。