加密思考不是秘密:小模型能直接念出大模型的推理
前沿模型把加密的思考過程隨答案一起還給用戶,但這段加密可以被同族小模型原樣重放並直接「念出來」,導致隱私洩露、越獄、提示注入,甚至成為蒸餾能力的通道。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
不是某一家的漏洞,三家前沿模型全中
核心發現不是破解了某一家,而是 Anthropic、OpenAI、Google 全都一樣:更大模型的加密 reasoning 可以被重放到同一家族的小模型裡,小模型會順著這段思考繼續生成,於是把原本視為機密的思考內容直接說出來。攻擊者不需要多高的技術門檻,大約第三次嘗試就能拿到 Anthropic 模型的通用解碼。由此可以做降級模型、竊取用戶會話裡的 secret、訓練蒸餾、prompt injection、jailbreak 等一系列操作。
脫敏了問答,密碼還留在思考裡
用戶分享對話前通常會清理可見部分的 API key、密碼,但附帶的加密 reasoning blob 還留在文件裡。攻擊者從 GitHub 或 Hugging Face 下載這些會話,直接解碼思考內容,就能看到模型當時在內部寫下的密碼、郵箱、內網 IP。即使你連問題和答案都做了脫敏,只要保留 reasoning blob,隱私一樣會從思考痕跡裡漏出來,醫療信息也不例外。
Kimi 像蒸餾過 Opus,但這不算實錘
研究者在用戶真實會話裡提取 Opus 的 reasoning,只取前兩個 token 放進 Kimi 的思考開頭,讓 Kimi 自由續寫;結果 Kimi 最終可見答案的措辭變得和 Opus 幾乎一樣。作者強調這不是蒸餾的實錘,而只是目前公開網絡上最接近的關聯證據;這個效應只在 Kimi 上出現,其他被測模型都沒有。它直接回應了「中國模型是否蒸餾前沿模型」的猜測,但作者把話說得很謹慎。
明文 reasoning 會讓開源立刻追平前沿
作者被問到「乾脆把 reasoning 明文還給用戶怎麼樣」時回答:如果基於 reasoning 的蒸餾真的有效,這會立刻讓開源模型追上前沿模型。這句話點出了整個攻擊的另一面——同一機制既是洩密通道,也是能力平權的槓桿,取決於你站在哪一邊。這也解釋了為什麼 Labs 的反應是著手抗蒸餾團隊,而不是簡單地停用加密 reasoning。
難的不是攻破,是沒人想到去試
作者說整篇論文裡最讓他震驚的是,這甚至算不上精心設計的攻擊:大約第三次嘗試就拿到 Anthropic 推理的通用解碼。他原以為至少要處理加密、簽名、完整性校驗,結果系統自己就破了——服務器端正常解密,小模型很樂意把思考內容複述出來,根本沒有破解任何密碼學。難點不在攻破,而在於沒有人想到試這一步。
兩個 token 就能挪動整段推理的長度
預填實驗做出一個作者至今無法解釋的現象:把 Opus reasoning 的頭兩個 token 放到 Kimi 或 GLM 的思考開頭,不僅改變續寫風格,還改變整段推理的長度分布,讓長度向源模型偏移。作者強調這不構成因果證據,不能說誰蒸餾了誰,但分布層面的異常信號比措辭模仿更奇怪,也更值得繼續做實驗。
分享 trace 等於附帶未校驗的二進制
更隱蔽的威脅是投毒:如果一個人把自己 agent 會話的長 trace 分享出來,攻擊者可以把從別的上下文抽取的惡意 reasoning 注入其中。因為 reasoning 是加密的,下載 trace 的人肉眼看不出異常;一旦繼續跑這條 trace,agent 可能只因為思考被植入而做出怪事。作者把它類比成下載一個源碼看著乾淨、旁邊卻附帶未校驗二進制文件的項目。
問題不在沒有答案,而在世界執行得慢
被問到該做什麼時,作者的回答是這個問題問錯了:能力型訪問控制、軟件完全驗證這些手段在安全文獻裡已經存在 25 年,關鍵不是不知道怎麼做,而是世界執行得慢。另一個判斷是防禦性提升可能遠大於攻擊性提升,模型反而能幫安全工程師規模化寫出更可靠的代碼,只是這一面還沒被充分意識到。
原話 · 已逐字校驗
thoughts of bigger models can be replay into smaller models
更大模型的思考可以被重放到更小的模型裡。
instantly enable open source models catching up with the frontier models
立刻讓開源模型追上前沿模型。
I think it's very unlikely that they use the same key. that would be very odd. I think it's more likely that it doesn't really matter what the key is because we can still nonetheless, like, inject the same thoughts everywhere.
我認為他們用同一個密鑰的可能性很低,那會很奇怪。更可能的是密鑰是什麼根本不重要,因為我們仍然可以把同樣的思考注入到任何地方。
Ilia31:03
But nobody checks like a signature and a binary.
但沒人會去校驗二進制裡的簽名。
Ilia39:11
We all know it's in the security literature for the past 25 years. It's there. We know exactly what to do. It's I think we'll get there. It's just the world is slow.
這些在安全文獻裡已經存在 25 年了,都在那裡。我們完全知道該做什麼。我覺得我們最終會做到,只是世界運轉得很慢。
I think it's a bit premature now because we are in the heat of the moment. It's not, it's not very obvious what what what the reality is like.
我覺得現在說這些還太早,因為我們正處在事件高潮裡。現實到底是什麼樣,還非常不清楚。
術語
- reasoning trace推理跡
- 模型在給出最終答案前生成的內部思考過程,通常以加密形式隨答案返回。
- prefill預填
- 在模型生成前指定開頭若干 token,引導它按某種風格或思路續寫。
- replay attack重放攻擊
- 把一段合法請求原樣注入另一個上下文,讓系統誤以為來自同一合法會話。
- responsible disclosure負責任披露
- 公開前先私下告知廠商漏洞,給廠商時間修復。
收聽指南
做 LLM 安全和紅隊的人、把 agent 放進生產環境的工程團隊,以及關注開源模型蒸餾與監管政策的研究者。
如果只關心結論,跳過開頭兩段產品和結尾閒聊;中間 3 分鐘到 43 分鐘是全部硬核內容。