世界太吵,来原声听播客

Oxide and Friends

AI 检测不是查文风,是查信息有没有注水

AI 写作的破绽不是文风,而是输出比输入多出来的「信息注水」。对冲基金大佬的 AI 社论公开认账成了拐点——Pangram 四代误报率约 2.4 万分之一,且模型越收敛反而越好抓。

AI 检测内容真伪后训练教育反作弊营销水军

原视频在 YouTube 上放不出来,用音频听:

CEO 亲自拆解分类器原理、训练数据怎么造、误报率口径,还顺手拆穿了网上一类「误判投诉」的水军套路。对判断 AI 写作真伪的决策者来说,信息密度很高。

核心论点 · 点时间戳可跳到原声

4:00

「用没用 AI」是假问题,该问想法从哪来

事件:Stanley Druckenmiller 在 WSJ 发了一篇社论,明眼人一看就是 AI 写的,有人丢进 Pangram 直接判 100% AI。转折点在于他不掩饰,直接承认「我本质上不是好写手、就是用了 AI」,WSJ 也拒绝撤回。Bryan 追问一步:既然认账,把 prompt 亮出来。「用没用 AI」是假二分,真正的问题是想法从哪来——是「帮我写一篇反对财政部行动的社论」,还是「这是我的五页笔记,帮我润色成文」。

— Max Spero
13:00

检测 AI 理论上不可能,实践上够用了

2023 年 Max 问做研究的 friends 能不能检测 AI 文本,答案一致是「不可能、别试、模型还会越来越强」。Pangram 的回应是放弃理论反例(「让 ChatGPT 复述任何文本就能证伪」),只关心实践场景:输入的信息量小于输出,就是 AI 参与的痕迹,Bryan 称之为 word inflation。这一定义也解释了为什么早期 Yelp/Amazon 假评没成为突破口——平台觉得 AI 评论只占 3%,不疼不痒。

— Max Spero
34:30

抓 AI 不靠 em dash,靠合成镜像对照

Pangram 是分类器模型,不是 em dash 检测器那类表面规则。做法:砍掉开源 LLM 的「预测下一个词」头,换成分类头,输出 0-15 档 AI 参与度。训练数据用「合成镜像」造:拿人写文章让 LLM 压缩成 prompt(「写一篇 200 字、覆盖这三点」),再喂给随机的 frontier model,得到同主题人类版/AI 版一对样本。第二层是 editing prompts,再做 clause 级标注:原样的是 human,被改过的是 AI-assisted,凭空多出的新句子是 AI-generated。

— Max Spero
40:00

检测器的生命线是误报率,不是准确率

Pangram 4 的误报率约 1/24,000,测法是拿数百万份 2022 年前的文档跑(那时代几乎不可能有人工智能代写);漏报率约 1/300,用 WildChat 的真实用户 prompt 重新喂给前沿模型生成来量。不完美,但方向对了。Bryan 的体验是误报极低,而这正是产品能不能被认真使用的生命线。Pangram 4 的 step change 来自把 512 token 窗口改成 token 级输出:一整篇人写的文档中间夹两句 AI,也能逐词点出来。

— Max Spero
46:00

检测器不必做到 100%,只要让抄作业有成本

Max 说教育是巨大市场,今年是第一次有人意识到「存在真正能用的 AI 检测器」。产品逻辑不是 100% 精准,而是在捷径上制造摩擦——让「把作业扔给 AI」从零成本变成有成本,学生就会走次容易的路,也就是自己做。这句判断同样适用于企业场景:Oxide 的招聘是写作密集型流程,LLM 复读官话写出的「为什么想加入 Oxide」一眼就能认出来,检测器只是把话挑明。

— Max Spero
50:00

「被误判」的哭诉帖,多半是水军广告

Max 区分了两类反对声音。一类人真心希望检测器不存在:它让自己职业里出产的 AI 文本可以被权威指认。另一类是 humanizer 生态的营销:这些工具声称能把 AI 文本改写得骗过 Turnitin、Pangram,卖给被查作业的学生;它们通常还自带一个「AI 检测器」,先判定你的文本是 AI,再卖改写服务。Reddit 上「被老师误判 76% AI、得零分」的哭诉帖,很多是这种 lead gen 的 astroturf——丢进 Pangram 一测,全是 AI 写的。

— Max Spero
59:00

模型变强没让检测变难,反而更容易

被问到「是不是永远在追着 frontier model 跑」,Max 给出反直觉判断:两件事同时发生——模型更聪明,但 post-training 一遍遍教「正确性」和偏好后,输出分布比 GPT-2 时代窄得多。GPT-2 试图模拟完整的人类输出分布,今天的模型只给「正确」的 token,而不是普通人会说的话。他和 Oxide 三人的体感一致:新模型说话带着一股「奇怪地博学」的味道,检测并没有变难,反而更容易上手。

— Max Spero
1:01:00

下一个争论点是人到底输入了多少

Pangram 已能在内部把模型家族猜出来:probe 的 top-1 准确率 90%,但要产品化还得练到 98%。更远的方向是「reverse Pangram」——反推是什么 prompt 可能生成这段文本、模型当时拿到多少上下文:两个要点还是十五个?这个维度的信息量,对 Druckenmiller 那篇社论的定性完全不同——给五页笔记让他润色算协作,给五个要点让他扩写就是代写。检测的下一个争论点不是「有没有用 AI」,而是「人到底输入了多少」。

— Max Spero

原话 · 已逐字校验

He says, yes. Of course I used AI to write this. I'm not a good writer, essentially.

他说:对,我当然用 AI 写了这篇。我本质上不是个好写手。

Max Spero3:15

I actually think that, like, doing one's own writing actually helps you form your thoughts.

我确实认为,亲自动笔写作,反而能帮你把想法真正想清楚。

Bryan Cantrill7:30

We don't we don't care about, like, solving it in a, like, theoretical sense. We care about solving it in a practical sense.

我们不关心在理论意义上把它解决,我们在乎的是在实践意义上解决它。

Max Spero13:00

And so how we create the training data for Pangram is a method that we call synthetic mirroring.

我们为 Pangram 造训练数据的方法,叫做 synthetic mirroring(合成镜像)。

Max Spero34:30

For Pangrom four, it's about one in twenty four thousand.

Pangram 四代的误报率大约是两万四千分之一。

Max Spero39:30

creating friction on the, like, the easy path just makes people do the the next easiest path, which is doing the assignment themselves.

在捷径上制造摩擦,人们就会走次容易的那条路——也就是自己把作业做出来。

Max Spero46:00

Their claim is that it will evade any AI detector, like Turnitin, now Pangram.

他们的卖点是:这能骗过任何 AI 检测器——Turnitin 也好,现在的 Pangram 也好。

Max Spero50:00

today's LLMs have a much more narrow distribution of what they output than, like, g p t two.

今天的 LLM 输出分布,比 GPT-2 那个时代窄得多。

Max Spero59:30

数字与实体

Pangram 漏报率约 1/300(WildChat 真实 prompt + 前沿模型重生成测量)40:30
误报率测量语料规模数百万份 2022 年前文档39:30
首个 Pangram 模型发布2024 年 2 月41:00
Pangram 4 发布本集录制前一个多月42:30
Pangram 4 之前的分类粒度512 token 窗口43:30
识别模型家族的内部探针 top-1 准确率90%1:01:00
有人为骗过 Pangram 消耗的 API 额度700 美元28:00
大型平台对 AI 评论的早期估计3%15:30

术语

synthetic mirroring合成镜像
拿人类文章反推 prompt、再由模型重写,构造「人类/AI」成对样本。
humanizer人化器
声称改写 AI 文本可绕过检测器的服务,主要卖给被查作业的学生。
classifier head分类头
大模型原有「预测下一个词」的输出头被换成的分类打分头。
WildChatWildChat
真实用户与 AI 的对话数据集,Pangram 用它估漏报率。

收听指南

谁该听

做内容审核、招聘筛选、教育反作弊的产品与技术负责人,以及大量用 LLM 产出文字、需要知道边界在哪的内容团队。

可跳过

53:00-57:00 的 Shell Game 播客与哲学漫谈可略过,不影响主线。