世界太吵,来原声听播客

ML Street Talk

加密思考不是秘密:小模型能把大模型的推理念出来

前沿模型把加密的思考过程随答案一起还给用户,但这段加密可以被同族小模型原样重放并直接「念出来」,导致隐私泄露、越狱、提示注入,甚至成为蒸馏能力的通道。

推理加密越狱模型蒸馏AI安全提示注入隐私泄露
这集把「加密 reasoning 可被重放」讲到了可复现级别,并提供隐私、投毒、蒸馏三条攻击路径;对做 AI 安全和 agent 生产的人来说密度很高。

核心论点 · 点时间戳可跳到原声

3:29

所有前沿模型同一漏洞

核心发现不是破解了某一家,而是 Anthropic、OpenAI、Google 全都一样:更大模型的加密 reasoning 可以被重放到同一家族的小模型里,小模型会顺着这段思考继续生成,于是把原本视为机密的思考内容直接说出来。攻击者不需要多高的技术门槛,大约第三次尝试就能拿到 Anthropic 模型的通用解码。由此可以做降级模型、窃取用户会话里的 secret、训练蒸馏、prompt injection、jailbreak 等一系列操作。

8:56

删掉可见文本也防不住泄密

用户分享对话前通常会清理可见部分的 API key、密码,但附带的加密 reasoning blob 还留在文件里。攻击者从 GitHub 或 Hugging Face 下载这些会话,直接解码思考内容,就能看到模型当时在内部写下的密码、邮箱、内网 IP。即使你连问题和答案都做了脱敏,只要保留 reasoning blob,隐私一样会从思考痕迹里漏出来,医疗信息也不例外。

15:53

Kimi 身上出现 Opus 的影子

研究者在用户真实会话里提取 Opus 的 reasoning,只取前两个 token 放进 Kimi 的思考开头,让 Kimi 自由续写;结果 Kimi 最终可见答案的措辞变得和 Opus 几乎一样。作者强调这不是蒸馏的实锤,而只是目前公开网络上最接近的关联证据;这个效应只在 Kimi 上出现,其他被测模型都没有。它直接回应了「中国模型是否蒸馏前沿模型」的猜测,但作者把话说得很谨慎。

24:36

开源追平前沿的直接通道

作者被问到「干脆把 reasoning 明文还给用户怎么样」时回答:如果基于 reasoning 的蒸馏真的有效,这会立刻让开源模型追上前沿模型。这句话点出了整个攻击的另一面——同一机制既是泄密通道,也是能力平权的杠杆,取决于你站在哪一边。这也解释了为什么 Labs 的反应是着手抗蒸馏团队,而不是简单地停用加密 reasoning。

30:00

最意外:第三次尝试就成功

作者说整篇论文里最让他震惊的是,这甚至算不上精心设计的攻击:大约第三次尝试就拿到 Anthropic 推理的通用解码。他原以为至少要处理加密、签名、完整性校验,结果系统自己就破了——服务器端正常解密,小模型很乐意把思考内容复述出来,根本没有破解任何密码学。难点不在攻破,而在于没有人想到试这一步。

35:00

两个 token 改变推理长度分布

预填实验做出一个作者至今无法解释的现象:把 Opus reasoning 的头两个 token 放到 Kimi 或 GLM 的思考开头,不仅改变续写风格,还改变整段推理的长度分布,让长度向源模型偏移。作者强调这不构成因果证据,不能说谁蒸馏了谁,但分布层面的异常信号比措辞模仿更奇怪,也更值得继续做实验。

37:05

共享 trace 里的隐形投毒

更隐蔽的威胁是投毒:如果一个人把自己 agent 会话的长 trace 分享出来,攻击者可以把从别的上下文抽取的恶意 reasoning 注入其中。因为 reasoning 是加密的,下载 trace 的人肉眼看不出异常;一旦继续跑这条 trace,agent 可能只因为思考被植入而做出怪事。作者把它类比成下载一个源码看着干净、旁边却附带未校验二进制文件的项目。

43:28

答案在安全文献里已有25年

被问到该做什么时,作者的回答是这个问题问错了:能力型访问控制、软件完全验证这些手段在安全文献里已经存在 25 年,关键不是不知道怎么做,而是世界执行得慢。另一个判断是防御性提升可能远大于攻击性提升,模型反而能帮安全工程师规模化写出更可靠的代码,只是这一面还没被充分意识到。

原话 · 已逐字校验

thoughts of bigger models can be replay into smaller models

更大模型的思考可以被重放到更小的模型里。

instantly enable open source models catching up with the frontier models

立刻让开源模型追上前沿模型。

I think it's very unlikely that they use the same key. that would be very odd. I think it's more likely that it doesn't really matter what the key is because we can still nonetheless, like, inject the same thoughts everywhere.

我认为他们用同一个密钥的可能性很低,那会很奇怪。更可能的是密钥是什么根本不重要,因为我们仍然可以把同样的思考注入到任何地方。

Ilia31:03

But nobody checks like a signature and a binary.

但没人会去校验二进制里的签名。

Ilia39:11

We all know it's in the security literature for the past 25 years. It's there. We know exactly what to do. It's I think we'll get there. It's just the world is slow.

这些在安全文献里已经存在 25 年了,都在那里。我们完全知道该做什么。我觉得我们最终会做到,只是世界运转得很慢。

I think it's a bit premature now because we are in the heat of the moment. It's not, it's not very obvious what what what the reality is like.

我觉得现在说这些还太早,因为我们正处在事件高潮里。现实到底是什么样,还非常不清楚。

术语

reasoning trace推理迹
模型在给出最终答案前生成的内部思考过程,通常以加密形式随答案返回。
prefill预填
在模型生成前指定开头若干 token,引导它按某种风格或思路续写。
replay attack重放攻击
把一段合法请求原样注入另一个上下文,让系统误以为来自同一合法会话。
responsible disclosure负责任披露
公开前先私下告知厂商漏洞,给厂商时间修复。

收听指南

谁该听

做 LLM 安全和红队的人、把 agent 放进生产环境的工程团队,以及关注开源模型蒸馏与监管政策的研究者。

可跳过

如果只关心结论,跳过开头两段产品和结尾闲聊;中间 3 分钟到 43 分钟是全部硬核内容。