世界太吵,來原聲聽播客

ML Street Talk

加密思考不是秘密:小模型能直接念出大模型的推理

前沿模型把加密的思考過程隨答案一起還給用戶,但這段加密可以被同族小模型原樣重放並直接「念出來」,導致隱私洩露、越獄、提示注入,甚至成為蒸餾能力的通道。

推理加密越獄模型蒸餾AI安全提示注入隱私洩露

原視頻在 YouTube 上放不出來,用音頻聽:

這集把「加密 reasoning 可被重放」講到了可復現級別,並提供隱私、投毒、蒸餾三條攻擊路徑;對做 AI 安全和 agent 生產的人來說密度很高。

核心論點 · 點時間戳可跳到原聲

3:29

不是某一家的漏洞,三家前沿模型全中

核心發現不是破解了某一家,而是 Anthropic、OpenAI、Google 全都一樣:更大模型的加密 reasoning 可以被重放到同一家族的小模型裡,小模型會順著這段思考繼續生成,於是把原本視為機密的思考內容直接說出來。攻擊者不需要多高的技術門檻,大約第三次嘗試就能拿到 Anthropic 模型的通用解碼。由此可以做降級模型、竊取用戶會話裡的 secret、訓練蒸餾、prompt injection、jailbreak 等一系列操作。

8:56

脫敏了問答,密碼還留在思考裡

用戶分享對話前通常會清理可見部分的 API key、密碼,但附帶的加密 reasoning blob 還留在文件裡。攻擊者從 GitHub 或 Hugging Face 下載這些會話,直接解碼思考內容,就能看到模型當時在內部寫下的密碼、郵箱、內網 IP。即使你連問題和答案都做了脫敏,只要保留 reasoning blob,隱私一樣會從思考痕跡裡漏出來,醫療信息也不例外。

15:53

Kimi 像蒸餾過 Opus,但這不算實錘

研究者在用戶真實會話裡提取 Opus 的 reasoning,只取前兩個 token 放進 Kimi 的思考開頭,讓 Kimi 自由續寫;結果 Kimi 最終可見答案的措辭變得和 Opus 幾乎一樣。作者強調這不是蒸餾的實錘,而只是目前公開網絡上最接近的關聯證據;這個效應只在 Kimi 上出現,其他被測模型都沒有。它直接回應了「中國模型是否蒸餾前沿模型」的猜測,但作者把話說得很謹慎。

24:36

明文 reasoning 會讓開源立刻追平前沿

作者被問到「乾脆把 reasoning 明文還給用戶怎麼樣」時回答:如果基於 reasoning 的蒸餾真的有效,這會立刻讓開源模型追上前沿模型。這句話點出了整個攻擊的另一面——同一機制既是洩密通道,也是能力平權的槓桿,取決於你站在哪一邊。這也解釋了為什麼 Labs 的反應是著手抗蒸餾團隊,而不是簡單地停用加密 reasoning。

30:00

難的不是攻破,是沒人想到去試

作者說整篇論文裡最讓他震驚的是,這甚至算不上精心設計的攻擊:大約第三次嘗試就拿到 Anthropic 推理的通用解碼。他原以為至少要處理加密、簽名、完整性校驗,結果系統自己就破了——服務器端正常解密,小模型很樂意把思考內容複述出來,根本沒有破解任何密碼學。難點不在攻破,而在於沒有人想到試這一步。

35:00

兩個 token 就能挪動整段推理的長度

預填實驗做出一個作者至今無法解釋的現象:把 Opus reasoning 的頭兩個 token 放到 Kimi 或 GLM 的思考開頭,不僅改變續寫風格,還改變整段推理的長度分布,讓長度向源模型偏移。作者強調這不構成因果證據,不能說誰蒸餾了誰,但分布層面的異常信號比措辭模仿更奇怪,也更值得繼續做實驗。

37:05

分享 trace 等於附帶未校驗的二進制

更隱蔽的威脅是投毒:如果一個人把自己 agent 會話的長 trace 分享出來,攻擊者可以把從別的上下文抽取的惡意 reasoning 注入其中。因為 reasoning 是加密的,下載 trace 的人肉眼看不出異常;一旦繼續跑這條 trace,agent 可能只因為思考被植入而做出怪事。作者把它類比成下載一個源碼看著乾淨、旁邊卻附帶未校驗二進制文件的項目。

43:28

問題不在沒有答案,而在世界執行得慢

被問到該做什麼時,作者的回答是這個問題問錯了:能力型訪問控制、軟件完全驗證這些手段在安全文獻裡已經存在 25 年,關鍵不是不知道怎麼做,而是世界執行得慢。另一個判斷是防禦性提升可能遠大於攻擊性提升,模型反而能幫安全工程師規模化寫出更可靠的代碼,只是這一面還沒被充分意識到。

原話 · 已逐字校驗

thoughts of bigger models can be replay into smaller models

更大模型的思考可以被重放到更小的模型裡。

instantly enable open source models catching up with the frontier models

立刻讓開源模型追上前沿模型。

I think it's very unlikely that they use the same key. that would be very odd. I think it's more likely that it doesn't really matter what the key is because we can still nonetheless, like, inject the same thoughts everywhere.

我認為他們用同一個密鑰的可能性很低,那會很奇怪。更可能的是密鑰是什麼根本不重要,因為我們仍然可以把同樣的思考注入到任何地方。

Ilia31:03

But nobody checks like a signature and a binary.

但沒人會去校驗二進制裡的簽名。

Ilia39:11

We all know it's in the security literature for the past 25 years. It's there. We know exactly what to do. It's I think we'll get there. It's just the world is slow.

這些在安全文獻裡已經存在 25 年了,都在那裡。我們完全知道該做什麼。我覺得我們最終會做到,只是世界運轉得很慢。

I think it's a bit premature now because we are in the heat of the moment. It's not, it's not very obvious what what what the reality is like.

我覺得現在說這些還太早,因為我們正處在事件高潮裡。現實到底是什麼樣,還非常不清楚。

術語

reasoning trace推理跡
模型在給出最終答案前生成的內部思考過程,通常以加密形式隨答案返回。
prefill預填
在模型生成前指定開頭若干 token,引導它按某種風格或思路續寫。
replay attack重放攻擊
把一段合法請求原樣注入另一個上下文,讓系統誤以為來自同一合法會話。
responsible disclosure負責任披露
公開前先私下告知廠商漏洞,給廠商時間修復。

收聽指南

誰該聽

做 LLM 安全和紅隊的人、把 agent 放進生產環境的工程團隊,以及關注開源模型蒸餾與監管政策的研究者。

可跳過

如果只關心結論,跳過開頭兩段產品和結尾閒聊;中間 3 分鐘到 43 分鐘是全部硬核內容。