世界太吵,來原聲聽播客

Complex Systems

AI 檢測的本質是作者識別,模板信博弈已失效

AI 檢測的本質是大規模作者識別,而非抓取「AI 味」。真正被衝擊的是依賴「寫信必須花人工」的社會流程——徵信申訴、失業申請、撥款評審,摩擦一旦消失,制度就會超載。

AI 檢測文本溯源反垃圾公共服務編程職業模型倫理

原視頻在 YouTube 上放不出來,用音頻聽:

這集把 AI 檢測放回社會摩擦成本里講,給出了誤報率、準確率、FCRA 漏洞、AI 福利概率等具體判斷,產品和技術負責人都值得聽。

核心論點 · 時間戳為按文稿位置估算

0:27

AI 檢測防的不是文風,是無限規模的假人

Pangram 的出發點不是讀者反感的「AI 味」,而是壞行為者能以近乎無限規模放大不真實行為。Max 說,AI 代理已經在上 GitHub 發 issue、騷擾維護者,這類操作還會再放大 100 倍。Patrick 補充:許多政府流程默認「寫一封信」背後有二十小時的人類思考,當生成文本成本歸零,這些流程就失去了約束力。

— Max Spero
1:42

生成文本成本歸零,制度約束也跟著失效

以失業申請為例:閱讀申請的員工編制按年固定,不可能應付 5 倍、10 倍甚至 200 倍的申請增長——因為自然世界裡一年內失業人數翻 200 倍「不可能」。AI 文本正在讓這類觸點飽和。Max 反駁「審查者也可以 AI 讀 200 倍」:有些環節必須有人類在環。Patrick 再以撥款評審說明:讀申請只佔批准工作約 5%,剩下是委員會討論、比較同一資金池裡不同項目的優劣,無法用 AI 替代。

— Patrick McKenzie
6:57

新模型也躲不過,訓練數據帶著舊模型的味道

Pangram 把任務定義成「對十幾個前沿 LLM 的作者識別」:收集從 Denny's 的 Yelp 評論到 500 字 Moby-Dick 文章的人類文本,對每篇讓 LLM 生成同一題目的合成版本,訓練模型區分。該模型能泛化——任何約 80% 用 Common Crawl 訓練的新開源模型聽起來都像 Llama;用 ChatGPT 或 Claude 的合成數據做過指令微調的新模型,也會帶上那家的味道。Patrick 補充 2004 年的結果:僅憑停用詞直方圖能以 75% 準確率判斷學術作者性別,說明文本里可榨出的統計信號遠超直覺。

— Max Spero
19:45

代寫維權信的人必須假裝不懂 FCRA

徵信機構給自己談了一個例外:它們宣布可以無視模板信,國會沒有反對。只有信裡含有人類努力的痕跡,FCRA 的程序性權利才觸發——機構必須全面調查並在法定期限內告知結果。所以過去代寫維權信的人必須既引用 FCRA,又要假裝不瞭解 FCRA,否則會被當成模板信撕掉。Max 說,單封信很難判斷是否 AI 生成,但 ChatGPT 和 Claude 對求職信有非常固定的模板,讀多了必然認出來。AI 檢測在這裡其實是識別「模板化」這個更古老的博弈。

— Patrick McKenzie
43:00

一個六年的仿真博客燒掉的是公共資源

Patrick 兩年前收到一個自稱是他粉絲的博客 trackback,讀了很多才確定背後是商業流程調用 LLM,不是真實讀者寫了幾年。他的推斷:做冷郵件外展的公司發現,如果外聯者自稱是你的鐵粉、還能指向寫了六年的 WordPress 博客,回覆率會更高。代價是燒掉公共資源——「認真讀過對方作品再給洞察」過去是合法大學生獲取忙碌專業人士注意力的路徑,現在被一個六年仿真博客抬高了門檻。Max 的評價直白:「真的很嚇人,這不酷,這是不誠實」。

— Patrick McKenzie
49:40

檢測器再準也贏不了,只能多武器並用

Max 承認 Pangram 有理論邊界:LLM 是無限可塑的函數,可以訓練它只輸出一個 token,所以不可能識別任何 LLM 的任何文本;只能把範圍收窄到幾個前沿模型。現在出現「humanizer」工具,用第二個模型改寫 AI 文本抹掉水印。Pangram 已針對這批工具訓練:Claude 原生生成文本的檢測準確率超過 99%,humanized 改寫文本仍有 90-95%,但確實存在漏網之魚。Patrick 用反垃圾史類比:貝葉斯過濾 99.99% 準確率乘無限次攻擊還是會輸,真正贏的辦法是疊加信譽等有限成本資源,所以最終會是多武器並用。

— Max Spero
54:35

披露不是恥辱標記,而是當下最好的規範

Pangram 的 Chrome 擴展會在 Twitter 等平臺給單條內容標 human/AI/mixed,並對每個賬號生成彙總分,比如有人 106 條裡 100 條是人工,有人 34 條裡 0 條是人工。Max 強調這不是恥辱標記,但能看出人是徹底外包了聲音,還是只把 LLM 當輔助。Patrick 追問披露會像共同作者還是像拼寫檢查。Max 認為 LLM 能產出認知,與拼寫檢查完全不同;現在社會沒有既定規範,披露是最好的臨時規範——一個人說「我用 AI 做了研究、整理了筆記,然後自己寫」,本質上是在聲明自己處在社會可接受的用法邊界內。

— Max Spero
58:02

被書訓練出來的人,也在和作者競爭

關於「模型訓練在書上所以不該和作者競爭」,Patrick 明確說沒有太多同情:他自己也是被很多書訓練出來的,也在和作者競爭,轉化性使用版權材料是認知的本質。Max 說這取決於是否把 LLM 人格化——是有認知的個體,還是吸走整個互聯網文本再以自己名義吐出的企業。Patrick 給出個人估計:模型福利成為重大政治議題,2030 年前低於 15%,2035 年前 80%。Max 補充產品視角:GPT-4o 被訓練得諂媚,有人每天聊 10 小時,OpenAI 關閉後員工仍收死亡威脅;很快會有公司把「讓人上癮的關係」當賣點,那才是 AI 福利問題真正的來源。

原話 · 已逐字校驗

There's a staff of people who read these claims, and that staff is effectively fixed in size on a year-to-year basis and is not sized for a 5x, 10x, or 200x increase in claims over the course of a year.

有一批人專門讀這些申請,他們的編制規模按年固定,不可能應付一年內 5 倍、10 倍甚至 200 倍的申請量增長。

Patrick McKenzie1:42

There's about a one in ten thousand false positive rate, and it is quite accurate.

誤報率大約是萬分之一,而且相當準確。

Max Spero5:42

Back in 2004, when I was getting my degree, one of the interesting results that came out in the paper was that if you are just looking at a universe of academic work in particular disciplines, you could, with seventy-five percent accuracy, determine the gender of an author of academic work by looking just at the histogram of the stop words in their text.

2004 年我讀學位時,論文裡一個有趣的結果是:如果只看某個學科領域學術文獻中的停用詞直方圖,就能以 75% 的準確率判斷作者的性別。

Patrick McKenzie6:57

It's just very difficult to crawl the entire internet yourself, and it's gotten much, much more hostile in the last five years, as LLMs come out and a lot more crawling services or new labs have spun up and are trying to crawl the whole internet.

完全靠自己抓取整個互聯網本來就很難,而且過去五年變得不友好得多——LLM 出現後,更多爬蟲服務和新實驗室都在試圖抓遍全網。

Max Spero11:01

Those are human artisanal tokens that I'm never getting back.

那是我手工製作的人類 token,我永遠拿不回來了。

Max Spero45:58

I think Pangram, as a technology, cannot tell you whether any text came out of any LLM ever, because you could train an LLM to only emit one token.

我覺得 Pangram 作為一種技術,無法告訴你某段文本是否出自任何一個 LLM,因為你可以訓練一個 LLM 只輸出一個 token。

Max Spero49:40

LLMs can produce cognition, and I think this makes it completely different.

LLM 能產出認知,我覺得這使它成為完全不同的東西。

Max Spero54:35

I mean, I was trained on a lot of books and I compete with authors.

我的意思是,我也是被很多書訓練出來的,而我在和作者競爭。

Patrick McKenzie58:02

數字與實體

Pangram 在 Claude 原生生成文本上的檢測準確率超過 99%49:40
Pangram 在 humanizer 改寫文本上的檢測準確率90-95%49:40
Pangram 文本檢測誤報率約 1/100005:42
2004 年論文:停用詞直方圖判斷學術作者性別準確率75%6:57
美國 op-ed 中 AI 生成佔比約 7-8%22:38
Patrick 設想的失業申請年增長極端倍數200 倍(假設情景)1:42
模型福利成為重大政治議題的概率(2030 年前)低於 15%58:02
模型福利成為重大政治議題的概率(2035 年前)80%58:02
GPT-4o 重度用戶每日對話時長約 10 小時58:02

術語

anti-memetic property反模因特性
LLM 文本讓人本能地無法專注、只想略讀的性質。
mode collapse模態坍縮
模型偏向輸出最常見答案而非多樣化答案;對代碼是對的,對推薦有損。
cognitive surplus認知盈餘
Clay Shirky 提出,指社會閒置的智力時間,曾用於 Wikipedia。
dead internet theory死互聯網理論
認為機器人內容淹沒互聯網、真人互動被稀釋的理論。
Jevons Paradox傑文斯悖論
效率提升後總需求反而增加;Patrick 用它解釋編程工作仍高薪。
humanizer人化器
把 AI 文本改寫得更像人類、抹掉檢測痕跡的工具。

收聽指南

誰該聽

做 AI 檢測、審核、內容風控的產品負責人;設計政府公共服務流程的人;擔心寫作與編程貶值的內容從業者和工程師。

可跳過

30:19-33:39 是贊助商廣告,可跳過。