加密思考不是秘密:小模型能把大模型的推理念出来
前沿模型把加密的思考过程随答案一起还给用户,但这段加密可以被同族小模型原样重放并直接「念出来」,导致隐私泄露、越狱、提示注入,甚至成为蒸馏能力的通道。
核心论点 · 点时间戳可跳到原声
所有前沿模型同一漏洞
核心发现不是破解了某一家,而是 Anthropic、OpenAI、Google 全都一样:更大模型的加密 reasoning 可以被重放到同一家族的小模型里,小模型会顺着这段思考继续生成,于是把原本视为机密的思考内容直接说出来。攻击者不需要多高的技术门槛,大约第三次尝试就能拿到 Anthropic 模型的通用解码。由此可以做降级模型、窃取用户会话里的 secret、训练蒸馏、prompt injection、jailbreak 等一系列操作。
删掉可见文本也防不住泄密
用户分享对话前通常会清理可见部分的 API key、密码,但附带的加密 reasoning blob 还留在文件里。攻击者从 GitHub 或 Hugging Face 下载这些会话,直接解码思考内容,就能看到模型当时在内部写下的密码、邮箱、内网 IP。即使你连问题和答案都做了脱敏,只要保留 reasoning blob,隐私一样会从思考痕迹里漏出来,医疗信息也不例外。
Kimi 身上出现 Opus 的影子
研究者在用户真实会话里提取 Opus 的 reasoning,只取前两个 token 放进 Kimi 的思考开头,让 Kimi 自由续写;结果 Kimi 最终可见答案的措辞变得和 Opus 几乎一样。作者强调这不是蒸馏的实锤,而只是目前公开网络上最接近的关联证据;这个效应只在 Kimi 上出现,其他被测模型都没有。它直接回应了「中国模型是否蒸馏前沿模型」的猜测,但作者把话说得很谨慎。
开源追平前沿的直接通道
作者被问到「干脆把 reasoning 明文还给用户怎么样」时回答:如果基于 reasoning 的蒸馏真的有效,这会立刻让开源模型追上前沿模型。这句话点出了整个攻击的另一面——同一机制既是泄密通道,也是能力平权的杠杆,取决于你站在哪一边。这也解释了为什么 Labs 的反应是着手抗蒸馏团队,而不是简单地停用加密 reasoning。
最意外:第三次尝试就成功
作者说整篇论文里最让他震惊的是,这甚至算不上精心设计的攻击:大约第三次尝试就拿到 Anthropic 推理的通用解码。他原以为至少要处理加密、签名、完整性校验,结果系统自己就破了——服务器端正常解密,小模型很乐意把思考内容复述出来,根本没有破解任何密码学。难点不在攻破,而在于没有人想到试这一步。
两个 token 改变推理长度分布
预填实验做出一个作者至今无法解释的现象:把 Opus reasoning 的头两个 token 放到 Kimi 或 GLM 的思考开头,不仅改变续写风格,还改变整段推理的长度分布,让长度向源模型偏移。作者强调这不构成因果证据,不能说谁蒸馏了谁,但分布层面的异常信号比措辞模仿更奇怪,也更值得继续做实验。
共享 trace 里的隐形投毒
更隐蔽的威胁是投毒:如果一个人把自己 agent 会话的长 trace 分享出来,攻击者可以把从别的上下文抽取的恶意 reasoning 注入其中。因为 reasoning 是加密的,下载 trace 的人肉眼看不出异常;一旦继续跑这条 trace,agent 可能只因为思考被植入而做出怪事。作者把它类比成下载一个源码看着干净、旁边却附带未校验二进制文件的项目。
答案在安全文献里已有25年
被问到该做什么时,作者的回答是这个问题问错了:能力型访问控制、软件完全验证这些手段在安全文献里已经存在 25 年,关键不是不知道怎么做,而是世界执行得慢。另一个判断是防御性提升可能远大于攻击性提升,模型反而能帮安全工程师规模化写出更可靠的代码,只是这一面还没被充分意识到。
原话 · 已逐字校验
thoughts of bigger models can be replay into smaller models
更大模型的思考可以被重放到更小的模型里。
instantly enable open source models catching up with the frontier models
立刻让开源模型追上前沿模型。
I think it's very unlikely that they use the same key. that would be very odd. I think it's more likely that it doesn't really matter what the key is because we can still nonetheless, like, inject the same thoughts everywhere.
我认为他们用同一个密钥的可能性很低,那会很奇怪。更可能的是密钥是什么根本不重要,因为我们仍然可以把同样的思考注入到任何地方。
Ilia31:03
But nobody checks like a signature and a binary.
但没人会去校验二进制里的签名。
Ilia39:11
We all know it's in the security literature for the past 25 years. It's there. We know exactly what to do. It's I think we'll get there. It's just the world is slow.
这些在安全文献里已经存在 25 年了,都在那里。我们完全知道该做什么。我觉得我们最终会做到,只是世界运转得很慢。
I think it's a bit premature now because we are in the heat of the moment. It's not, it's not very obvious what what what the reality is like.
我觉得现在说这些还太早,因为我们正处在事件高潮里。现实到底是什么样,还非常不清楚。
术语
- reasoning trace推理迹
- 模型在给出最终答案前生成的内部思考过程,通常以加密形式随答案返回。
- prefill预填
- 在模型生成前指定开头若干 token,引导它按某种风格或思路续写。
- replay attack重放攻击
- 把一段合法请求原样注入另一个上下文,让系统误以为来自同一合法会话。
- responsible disclosure负责任披露
- 公开前先私下告知厂商漏洞,给厂商时间修复。
收听指南
做 LLM 安全和红队的人、把 agent 放进生产环境的工程团队,以及关注开源模型蒸馏与监管政策的研究者。
如果只关心结论,跳过开头两段产品和结尾闲聊;中间 3 分钟到 43 分钟是全部硬核内容。