AI 检测的本质是作者识别,模板信博弈已失效
AI 检测的本质是大规模作者识别,而非抓取「AI 味」。真正被冲击的是依赖「写信必须花人工」的社会流程——征信申诉、失业申请、拨款评审,摩擦一旦消失,制度就会超载。
核心论点 · 时间戳为按文稿位置估算
AI 检测为何存在
Pangram 的出发点不是读者反感的「AI 味」,而是坏行为者能以近乎无限规模放大不真实行为。Max 说,AI 代理已经在上 GitHub 发 issue、骚扰维护者,这类操作还会再放大 100 倍。Patrick 补充:许多政府流程默认「写一封信」背后有二十小时的人类思考,当生成文本成本归零,这些流程就失去了约束力。
— Max Spero摩擦是速率限制器
以失业申请为例:阅读申请的员工编制按年固定,不可能应付 5 倍、10 倍甚至 200 倍的申请增长——因为自然世界里一年内失业人数翻 200 倍「不可能」。AI 文本正在让这类触点饱和。Max 反驳「审查者也可以 AI 读 200 倍」:有些环节必须有人类在环。Patrick 再以拨款评审说明:读申请只占批准工作约 5%,剩下是委员会讨论、比较同一资金池里不同项目的优劣,无法用 AI 替代。
— Patrick McKenzie作者识别与泛化
Pangram 把任务定义成「对十几个前沿 LLM 的作者识别」:收集从 Denny's 的 Yelp 评论到 500 字 Moby-Dick 文章的人类文本,对每篇让 LLM 生成同一题目的合成版本,训练模型区分。该模型能泛化——任何约 80% 用 Common Crawl 训练的新开源模型听起来都像 Llama;用 ChatGPT 或 Claude 的合成数据做过指令微调的新模型,也会带上那家的味道。Patrick 补充 2004 年的结果:仅凭停用词直方图能以 75% 准确率判断学术作者性别,说明文本里可榨出的统计信号远超直觉。
— Max SperoFCRA 漏洞与模板信
征信机构给自己谈了一个例外:它们宣布可以无视模板信,国会没有反对。只有信里含有人类努力的痕迹,FCRA 的程序性权利才触发——机构必须全面调查并在法定期限内告知结果。所以过去代写维权信的人必须既引用 FCRA,又要假装不了解 FCRA,否则会被当成模板信撕掉。Max 说,单封信很难判断是否 AI 生成,但 ChatGPT 和 Claude 对求职信有非常固定的模板,读多了必然认出来。AI 检测在这里其实是识别「模板化」这个更古老的博弈。
— Patrick McKenzieAI 粉丝博客烧信任
Patrick 两年前收到一个自称是他粉丝的博客 trackback,读了很多才确定背后是商业流程调用 LLM,不是真实读者写了几年。他的推断:做冷邮件外展的公司发现,如果外联者自称是你的铁粉、还能指向写了六年的 WordPress 博客,回复率会更高。代价是烧掉公共资源——「认真读过对方作品再给洞察」过去是合法大学生获取忙碌专业人士注意力的路径,现在被一个六年仿真博客抬高了门槛。Max 的评价直白:「真的很吓人,这不酷,这是不诚实」。
— Patrick McKenzie这场博弈能赢吗
Max 承认 Pangram 有理论边界:LLM 是无限可塑的函数,可以训练它只输出一个 token,所以不可能识别任何 LLM 的任何文本;只能把范围收窄到几个前沿模型。现在出现「humanizer」工具,用第二个模型改写 AI 文本抹掉水印。Pangram 已针对这批工具训练:Claude 原生生成文本的检测准确率超过 99%,humanized 改写文本仍有 90-95%,但确实存在漏网之鱼。Patrick 用反垃圾史类比:贝叶斯过滤 99.99% 准确率乘无限次攻击还是会输,真正赢的办法是叠加信誉等有限成本资源,所以最终会是多武器并用。
— Max Spero声誉分与披露规范
Pangram 的 Chrome 扩展会在 Twitter 等平台给单条内容标 human/AI/mixed,并对每个账号生成汇总分,比如有人 106 条里 100 条是人工,有人 34 条里 0 条是人工。Max 强调这不是耻辱标记,但能看出人是彻底外包了声音,还是只把 LLM 当辅助。Patrick 追问披露会像共同作者还是像拼写检查。Max 认为 LLM 能产出认知,与拼写检查完全不同;现在社会没有既定规范,披露是最好的临时规范——一个人说「我用 AI 做了研究、整理了笔记,然后自己写」,本质上是在声明自己处在社会可接受的用法边界内。
— Max SperoAI 道德与成瘾产品
关于「模型训练在书上所以不该和作者竞争」,Patrick 明确说没有太多同情:他自己也是被很多书训练出来的,也在和作者竞争,转化性使用版权材料是认知的本质。Max 说这取决于是否把 LLM 人格化——是有认知的个体,还是吸走整个互联网文本再以自己名义吐出的企业。Patrick 给出个人估计:模型福利成为重大政治议题,2030 年前低于 15%,2035 年前 80%。Max 补充产品视角:GPT-4o 被训练得谄媚,有人每天聊 10 小时,OpenAI 关闭后员工仍收死亡威胁;很快会有公司把「让人上瘾的关系」当卖点,那才是 AI 福利问题真正的来源。
原话 · 已逐字校验
There's a staff of people who read these claims, and that staff is effectively fixed in size on a year-to-year basis and is not sized for a 5x, 10x, or 200x increase in claims over the course of a year.
有一批人专门读这些申请,他们的编制规模按年固定,不可能应付一年内 5 倍、10 倍甚至 200 倍的申请量增长。
Patrick McKenzie1:42
There's about a one in ten thousand false positive rate, and it is quite accurate.
误报率大约是万分之一,而且相当准确。
Max Spero5:42
Back in 2004, when I was getting my degree, one of the interesting results that came out in the paper was that if you are just looking at a universe of academic work in particular disciplines, you could, with seventy-five percent accuracy, determine the gender of an author of academic work by looking just at the histogram of the stop words in their text.
2004 年我读学位时,论文里一个有趣的结果是:如果只看某个学科领域学术文献中的停用词直方图,就能以 75% 的准确率判断作者的性别。
Patrick McKenzie6:57
It's just very difficult to crawl the entire internet yourself, and it's gotten much, much more hostile in the last five years, as LLMs come out and a lot more crawling services or new labs have spun up and are trying to crawl the whole internet.
完全靠自己抓取整个互联网本来就很难,而且过去五年变得不友好得多——LLM 出现后,更多爬虫服务和新实验室都在试图抓遍全网。
Max Spero11:01
Those are human artisanal tokens that I'm never getting back.
那是我手工制作的人类 token,我永远拿不回来了。
Max Spero45:58
I think Pangram, as a technology, cannot tell you whether any text came out of any LLM ever, because you could train an LLM to only emit one token.
我觉得 Pangram 作为一种技术,无法告诉你某段文本是否出自任何一个 LLM,因为你可以训练一个 LLM 只输出一个 token。
Max Spero49:40
LLMs can produce cognition, and I think this makes it completely different.
LLM 能产出认知,我觉得这使它成为完全不同的东西。
Max Spero54:35
I mean, I was trained on a lot of books and I compete with authors.
我的意思是,我也是被很多书训练出来的,而我在和作者竞争。
Patrick McKenzie58:02
数字与实体
| Pangram 在 Claude 原生生成文本上的检测准确率 | 超过 99% | 49:40 |
| Pangram 在 humanizer 改写文本上的检测准确率 | 90-95% | 49:40 |
| Pangram 文本检测误报率 | 约 1/10000 | 5:42 |
| 2004 年论文:停用词直方图判断学术作者性别准确率 | 75% | 6:57 |
| 美国 op-ed 中 AI 生成占比 | 约 7-8% | 22:38 |
| Patrick 设想的失业申请年增长极端倍数 | 200 倍(假设情景) | 1:42 |
| 模型福利成为重大政治议题的概率(2030 年前) | 低于 15% | 58:02 |
| 模型福利成为重大政治议题的概率(2035 年前) | 80% | 58:02 |
| GPT-4o 重度用户每日对话时长 | 约 10 小时 | 58:02 |
术语
- anti-memetic property反模因特性
- LLM 文本让人本能地无法专注、只想略读的性质。
- mode collapse模态坍缩
- 模型偏向输出最常见答案而非多样化答案;对代码是对的,对推荐有损。
- cognitive surplus认知盈余
- Clay Shirky 提出,指社会闲置的智力时间,曾用于 Wikipedia。
- dead internet theory死互联网理论
- 认为机器人内容淹没互联网、真人互动被稀释的理论。
- Jevons Paradox杰文斯悖论
- 效率提升后总需求反而增加;Patrick 用它解释编程工作仍高薪。
- humanizer人化器
- 把 AI 文本改写得更像人类、抹掉检测痕迹的工具。
收听指南
做 AI 检测、审核、内容风控的产品负责人;设计政府公共服务流程的人;担心写作与编程贬值的内容从业者和工程师。
30:19-33:39 是赞助商广告,可跳过。