AI 檢測不是查文風,是查信息有沒有注水
AI 寫作的破綻不是文風,而是輸出比輸入多出來的「信息注水」。對沖基金大佬的 AI 社論公開認賬成了拐點——Pangram 四代誤報率約 2.4 萬分之一,且模型越收斂反而越好抓。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
「用沒用 AI」是假問題,該問想法從哪來
事件:Stanley Druckenmiller 在 WSJ 發了一篇社論,明眼人一看就是 AI 寫的,有人丟進 Pangram 直接判 100% AI。轉折點在於他不掩飾,直接承認「我本質上不是好寫手、就是用了 AI」,WSJ 也拒絕撤回。Bryan 追問一步:既然認賬,把 prompt 亮出來。「用沒用 AI」是假二分,真正的問題是想法從哪來——是「幫我寫一篇反對財政部行動的社論」,還是「這是我的五頁筆記,幫我潤色成文」。
— Max Spero檢測 AI 理論上不可能,實踐上夠用了
2023 年 Max 問做研究的 friends 能不能檢測 AI 文本,答案一致是「不可能、別試、模型還會越來越強」。Pangram 的回應是放棄理論反例(「讓 ChatGPT 複述任何文本就能證偽」),只關心實踐場景:輸入的信息量小於輸出,就是 AI 參與的痕跡,Bryan 稱之為 word inflation。這一定義也解釋了為什麼早期 Yelp/Amazon 假評沒成為突破口——平臺覺得 AI 評論只佔 3%,不疼不癢。
— Max Spero抓 AI 不靠 em dash,靠合成鏡像對照
Pangram 是分類器模型,不是 em dash 檢測器那類表面規則。做法:砍掉開源 LLM 的「預測下一個詞」頭,換成分類頭,輸出 0-15 檔 AI 參與度。訓練數據用「合成鏡像」造:拿人寫文章讓 LLM 壓縮成 prompt(「寫一篇 200 字、覆蓋這三點」),再餵給隨機的 frontier model,得到同主題人類版/AI 版一對樣本。第二層是 editing prompts,再做 clause 級標註:原樣的是 human,被改過的是 AI-assisted,憑空多出的新句子是 AI-generated。
— Max Spero檢測器的生命線是誤報率,不是準確率
Pangram 4 的誤報率約 1/24,000,測法是拿數百萬份 2022 年前的文檔跑(那時代幾乎不可能有人工智能代寫);漏報率約 1/300,用 WildChat 的真實用戶 prompt 重新餵給前沿模型生成來量。不完美,但方向對了。Bryan 的體驗是誤報極低,而這正是產品能不能被認真使用的生命線。Pangram 4 的 step change 來自把 512 token 窗口改成 token 級輸出:一整篇人寫的文檔中間夾兩句 AI,也能逐詞點出來。
— Max Spero檢測器不必做到 100%,只要讓抄作業有成本
Max 說教育是巨大市場,今年是第一次有人意識到「存在真正能用的 AI 檢測器」。產品邏輯不是 100% 精準,而是在捷徑上製造摩擦——讓「把作業扔給 AI」從零成本變成有成本,學生就會走次容易的路,也就是自己做。這句判斷同樣適用於企業場景:Oxide 的招聘是寫作密集型流程,LLM 復讀官話寫出的「為什麼想加入 Oxide」一眼就能認出來,檢測器只是把話挑明。
— Max Spero「被誤判」的哭訴帖,多半是水軍廣告
Max 區分了兩類反對聲音。一類人真心希望檢測器不存在:它讓自己職業裡出產的 AI 文本可以被權威指認。另一類是 humanizer 生態的營銷:這些工具聲稱能把 AI 文本改寫得騙過 Turnitin、Pangram,賣給被查作業的學生;它們通常還自帶一個「AI 檢測器」,先判定你的文本是 AI,再賣改寫服務。Reddit 上「被老師誤判 76% AI、得零分」的哭訴帖,很多是這種 lead gen 的 astroturf——丟進 Pangram 一測,全是 AI 寫的。
— Max Spero模型變強沒讓檢測變難,反而更容易
被問到「是不是永遠在追著 frontier model 跑」,Max 給出反直覺判斷:兩件事同時發生——模型更聰明,但 post-training 一遍遍教「正確性」和偏好後,輸出分布比 GPT-2 時代窄得多。GPT-2 試圖模擬完整的人類輸出分布,今天的模型只給「正確」的 token,而不是普通人會說的話。他和 Oxide 三人的體感一致:新模型說話帶著一股「奇怪地博學」的味道,檢測並沒有變難,反而更容易上手。
— Max Spero下一個爭論點是人到底輸入了多少
Pangram 已能在內部把模型家族猜出來:probe 的 top-1 準確率 90%,但要產品化還得練到 98%。更遠的方向是「reverse Pangram」——反推是什麼 prompt 可能生成這段文本、模型當時拿到多少上下文:兩個要點還是十五個?這個維度的信息量,對 Druckenmiller 那篇社論的定性完全不同——給五頁筆記讓他潤色算協作,給五個要點讓他擴寫就是代寫。檢測的下一個爭論點不是「有沒有用 AI」,而是「人到底輸入了多少」。
— Max Spero原話 · 已逐字校驗
He says, yes. Of course I used AI to write this. I'm not a good writer, essentially.
他說:對,我當然用 AI 寫了這篇。我本質上不是個好寫手。
Max Spero3:15
I actually think that, like, doing one's own writing actually helps you form your thoughts.
我確實認為,親自動筆寫作,反而能幫你把想法真正想清楚。
Bryan Cantrill7:30
We don't we don't care about, like, solving it in a, like, theoretical sense. We care about solving it in a practical sense.
我們不關心在理論意義上把它解決,我們在乎的是在實踐意義上解決它。
Max Spero13:00
And so how we create the training data for Pangram is a method that we call synthetic mirroring.
我們為 Pangram 造訓練數據的方法,叫做 synthetic mirroring(合成鏡像)。
Max Spero34:30
For Pangrom four, it's about one in twenty four thousand.
Pangram 四代的誤報率大約是兩萬四千分之一。
Max Spero39:30
creating friction on the, like, the easy path just makes people do the the next easiest path, which is doing the assignment themselves.
在捷徑上製造摩擦,人們就會走次容易的那條路——也就是自己把作業做出來。
Max Spero46:00
Their claim is that it will evade any AI detector, like Turnitin, now Pangram.
他們的賣點是:這能騙過任何 AI 檢測器——Turnitin 也好,現在的 Pangram 也好。
Max Spero50:00
today's LLMs have a much more narrow distribution of what they output than, like, g p t two.
今天的 LLM 輸出分布,比 GPT-2 那個時代窄得多。
Max Spero59:30
數字與實體
| Pangram 漏報率 | 約 1/300(WildChat 真實 prompt + 前沿模型重生成測量) | 40:30 |
| 誤報率測量語料規模 | 數百萬份 2022 年前文檔 | 39:30 |
| 首個 Pangram 模型發布 | 2024 年 2 月 | 41:00 |
| Pangram 4 發布 | 本集錄制前一個多月 | 42:30 |
| Pangram 4 之前的分類粒度 | 512 token 窗口 | 43:30 |
| 識別模型家族的內部探針 top-1 準確率 | 90% | 1:01:00 |
| 有人為騙過 Pangram 消耗的 API 額度 | 700 美元 | 28:00 |
| 大型平臺對 AI 評論的早期估計 | 3% | 15:30 |
術語
- synthetic mirroring合成鏡像
- 拿人類文章反推 prompt、再由模型重寫,構造「人類/AI」成對樣本。
- humanizer人化器
- 聲稱改寫 AI 文本可繞過檢測器的服務,主要賣給被查作業的學生。
- classifier head分類頭
- 大模型原有「預測下一個詞」的輸出頭被換成的分類打分頭。
- WildChatWildChat
- 真實用戶與 AI 的對話數據集,Pangram 用它估漏報率。
收聽指南
做內容審核、招聘篩選、教育反作弊的產品與技術負責人,以及大量用 LLM 產出文字、需要知道邊界在哪的內容團隊。
53:00-57:00 的 Shell Game 播客與哲學漫談可略過,不影響主線。