世界太吵,来原声听播客

STEM-Talk

AI 公司不该拿 230 条免责,幻觉也不是等着修的 bug

Ken 认为生成式 AI 合成新内容、源头在模型本身,所以更像发布者而非中立平台;而幻觉更接近神经心理学里的 confabulation,是内建于工作方式的风险。

AI 监管数据中心幻觉模型能力蒸馏
这是一集听众提问驱动的 AMA,前半段法律与数据中心、后半段术语与模型能力,密度不均,但几处判断很硬。

核心论点 · 点时间戳可跳到原声

3:06

AI 公司不该拿 230 条免责

Ken 对「AI 公司是否应受美国《通信规范法》230 条保护」的回答是明确的 no。他的理由是 230 条 1996 年立法的前提是一个简单区分:用户创造内容,平台只是托管。而生成式 AI 不是检索或展示别人造的东西,它合成新内容,有时产出训练数据里根本不存在的话,还会把编造的东西自信地当事实讲出来。用户发的诽谤帖源头在用户;AI 生成的诽谤内容没有人类写过,源头就在模型本身。这时 AI 公司看起来就不再是中立中介,而更像内容的发布者。

— Ken Ford
7:11

幻觉不是等着被修的 bug

Ken 强调 hallucination 更准确的说法是 confabulation(虚构),它不是等待打补丁的软件缺陷,而来自今天自回归大语言模型的概率本质——生成的是「看起来合理」的文本,而不是检索已验证的事实。检索、推理、验证技术能大幅减少但没能消除它,而且有充分理由认为这个问题对当前这一代模型和底层计算机科学而言是内生的。如果 230 条或类似保护被收窄,AI 公司可能要为虚假、诽谤或有害输出承担更多责任,这会形成强大动力去开发能更可靠锚定事实的架构,甚至走向根本不同的 AI 路线。

— Ken Ford
8:11

AI 法人格已经被判过死刑

Ken 认为 AI 获得法律人格的想法站不住脚:公司之所以是「法人」,不是因为它们智能或自主,而是因为它们是真实人类的结构化代理——持股的股东、代表实体行事的员工、可被扣押偿债的资本资产,AI 一样都没有。这不是他的个人意见,而是已被测试并否决:DABUS 系统作为专利发明人被提报多年,美国 2022、英国 2023、德国 2024、日本今年 3 月全部说不,只有自然人可以当法律发明人;2017 年欧盟提出的「电子人格」构想几乎立刻夭折,150 多名 AI 研究者、机器人专家和法律学者联署公开信把它拆掉。

— Ken Ford
11:15

数据中心恐慌被低估,不是被夸大

针对《大西洋月刊》6 月 12 日那篇说数据中心恐慌被夸大、批评者在抬高成本的文章,Ken 的判断是它更像为「现代史上最大规模的公共资源向私企转移」做合理化,而不是平衡分析。他指出文章低估了基础设施规模:现在和规划中的 AI 设施不是以兆瓦计,而是以吉瓦计,一个满负荷的吉瓦级数据中心年耗电相当于一个小州甚至一个大都市区,单体超大规模设施每天冷却可能要用数百万加仑水。噪音、废热、热岛效应这些影响也很少被扩张倡导者提及。

— Ken Ford
14:20

社区连条款都不许知道

Ken 指出大量决策在闭门进行:Google、Amazon、Meta、Microsoft 等超大规模厂商和数据中心开发商经常先与地方官员签保密协议,之后社区才知道项目要多少水、多少电、需要什么基础设施升级、涉及什么公共补贴。在数据中心最集中的弗吉尼亚,一项审查发现 31 个已有、已批或拟建数据中心的地方中有 25 个签了这类协议。阿拉巴马州 Bessemer 的一份保密协议甚至要求市政官员在协议到期或开发商提出要求时销毁机密项目记录。Microsoft 后来承诺停止与地方政府签保密协议,Ken 认为这本身就是承认保密已成了大问题。

— Ken Ford
42:38

公司夸大危险,反噬自己

当技术的开发者同时是「它有多强、多危险」这一说法的首要来源时,会有一个微妙的倾向:夸大当前系统的能力,因为这会强化「这家公司取得了非凡技术领导地位」的印象。结果是公共讨论同时被扭曲两次——风险被夸大,技术显得比证据支持的更革命。而且这套策略会自我拆台:你越成功地说服公众和政策制定者相信自己的产品极其危险,要求监管这些产品的政治理由就越强。Ken 强调这不是说公司故意编造不存在的风险,也不是说 AI 公司反对一切监管——Anthropic 就常常主张更强的 AI 监督。

— Ken Ford
43:38

把模型说成国安技术,就别怪被国安对待

这不是假设。今年夏天早些时候,美国政府发出出口管制指令,要求 Anthropic 暂停外国国民访问其 Fable 5 和 Mythos 5 模型,在补充了额外保障措施后才恢复访问。Ken 的结论是:一旦公司公开把自己的模型框定为异常强大和危险,就不该惊讶于政府开始把这些模型当作国家安全相关技术处理。他主张行业采用更克制的沟通方式——不需要乌托邦承诺,也不需要末日预言,需要的是基于证据的能力与风险评估;如果系统真有前所未有的危险能力,支撑证据应当公开供独立评估。

— Ken Ford
45:39

hallucination 这个词在替模型开脱

Ken 反对用 hallucination 描述大模型的错误,理由是这个词会激活一整套思维框架。听到「一个人产生了幻觉」,我们自然想象一个本来胜任的心智短暂地感知到了不存在的东西,暗示这是可靠认知系统的异常故障。但今天的大模型不是这样工作的:它给出错误答案时并没有发生暂时的认知崩溃,多数情况下根本不是故障,而是在做它被设计来做的事——根据训练中学到的模式、提示和上下文生成一个看似合理的文本延续。错误不是模型工作方式的例外,而是内建于工作方式之中的风险。

— Ken Ford
48:42

fabrication 也不对,最后选了 confabulation

Ken 一度偏好用 fabrication 替代 hallucination,因为 fabrication 是「被构造出来的东西」,更接近语言模型所做的事。但越想越不喜欢:fabrication 通常指某人为了欺骗而故意编造,而模型出错时没有意图、没有「输出是假的」这种意识、也没有试图误导任何人。他最终选定的词是 confabulation,借自神经心理学:一个人自信地给出关于从未发生过之事的详细、连贯、完全可信的叙述,既没有意识到它是假的,也没有欺骗任何人的意图。健康人重构记忆、无意识用合理细节填补空白时也会 confabulate。

— Ken Ford
1:07:05

ChatGPT 没有给自己编程

针对「ChatGPT-5 由早期 ChatGPT 编程」的说法,Ken 指出这是误导性的混淆:OpenAI 宣布的是 ChatGPT-5.3 Codex,一个专门的编码与软件工程模型,不是大众交互的那个聊天机器人;所谓「对创造自身起了作用」,指的是 OpenAI 工程师用早期版本帮助调试训练、监控训练运行、诊断评估、优化 harness 的部分环节和支持部署。这是 AI 辅助工程,不是 AI 自主决定构建自己的继任者。他同时指出,从 OpenAI 的措辞到科技博客的「自己构建自己的模型」「递归自我改进」,这些短语根本没出现在 OpenAI 的公告里,是经过多轮二次报道被逐层放大的。

— Ken Ford
1:12:11

蒸馏是合法技术,但别拿我的输出训对手

前沿 AI 公司自己就经常把模型蒸馏成更小更便宜的版本,但当竞争对手用它们的输出来训练对手模型时,态度就冷淡得多。Anthropic 一方面称蒸馏在正当使用时是合法技术,另一方面点名指控具体公司滥用:2026 年 2 月称 DeepSeek、Moonshot 和 MiniMax 通过约 24,000 个欺诈账号与 Claude 产生了超过 1,600 万次交互;2026 年 6 月致两位美国参议员的信中,又指控阿里巴巴通过约 25,000 个假账号进行了超过 2,880 万次交互,专门提取 Claude 的 agentic reasoning、软件工程和长期任务完成能力。Anthropic 帮助中心也明确禁止用 Claude 输出训练竞争性通用模型。

— Ken Ford
1:23:24

50 米洗车题:模型答的是措辞,不是任务

2026 年 2 月一位 Mastodon 用户向四个前沿语言模型提问:我想洗车,洗车店在 50 米外,我该走路还是开车?四个都建议走路——但正确答案显然是开车,因为车必须物理上出现在洗车店。AI 基础设施公司 Opper 随后用 53 个领先模型系统测试:第一轮只有 11 个答对,42 个建议走路;重复测试中只有 5 个每次都答对。Ken 的分析是:提示里有一个高度显著的语料线索——50 米是很短的步行距离,在训练文本中「短距离 + 走路还是开车」强烈统计关联于「走路」,但这个关联在这里无关,因为出行的目的不是运送人,而是运送车。

— Ken Ford
1:26:27

50米外的洗车题暴露的不是常识缺失

卡内基梅隆大学在 Opera 测试后几周发布的预印本给出了更严格的版本:短距离线索对模型答案的影响,比「要洗车」这个明确目标高出约 9 到 38 倍;token 层面的模式更符合关键词联想,而不是组合式推理。把车这个对象在提示里写得更明确后,模型表现大幅改善——说明相关模式系统里其实有,只是不足以压过「50 米」这个线索。Ken 强调这不是「AI 没有常识」的老生常谈,而是这种缺失在实践中的样子:答案可以流畅、局部合理,却在任务层面就是错的。

— Ken Ford
1:28:27

流畅的自信和任务理解不是同一种能力

人类会自动把跑腿这件事表征成物理约束——车必须在洗车店。模型输出的却是提示和训练数据里最强的语言联想。Ken 由此划出一条界线:大语言模型极擅长生成「一个 thoughtful person 会说的话」,但远不可靠于检查眼前这个具体目标是否施加了通用回答会漏掉的约束。这个失败模式在更要命的场景里已经出现过:拼出一串单看都合理的步骤,却漏掉原始请求里埋着的一个要求。而且这个缺口不会自己宣告自己的存在。

— Ken Ford
1:30:31

他不签那份 200 人声明,因为太模糊

录制于 7 月 17 日,5 天前近 200 名研究者与经济学家(含 16 位诺奖得主)签署声明,警告 AI 可能取代大量人类工作、导致普遍失业。Ken 说他大概不会签——不是因为 AI 不重要,而是声明太模糊、帮不上忙。三条主张(AI 可能变得极强、可能带来比工业革命更大但更快的经济转型、政策制定者现在就该行动)都只是「可能」,没有附带分析、没有概率、没有具体机制、没有明确的政策提案。他的原话判断是:这更像一个标题,而不是一个论证。

— Ken Ford
1:33:33

声明漏掉了算力与电力的物理约束

Ken 指出声明里的「激励、护栏、制度」没有具体所指:是教育改革、再培训、税收政策、劳动力市场调整、反垄断、AI 安全标准还是责任规则?谁来做、做什么?他认为一份严肃的 AI 声明应该谈当前 scaling 范式带来的资源需求——近期进步大多不是来自理解或推理上的优雅突破,而是蛮力扩展:更大的模型、更多数据、更多 GPU、越来越庞大的数据中心。电力需求、用水、电网容量、选址、算力集中已经在成为实际约束。他更愿意看到把重点放在更高效的学习、更好的推理架构、符号与统计的混合方法、因果建模、更小的专用模型、更好的记忆与检索上。

— Ken Ford
1:35:35

我们更擅长预测哪些工作消失

声明强调大规模失业,却没解释为什么这个结果该被视为可能而非必然。历史既有很多技术让工人失业的例子,也有很多技术创造出事先无法想象的新产业、新职业、新工作形式的例子——工业革命、电气化、计算机、互联网都消灭了工作,也创造了多得多的新工作。Ken 引出的经济学史教训是:我们预测哪些工作会消失,通常比预测哪些新工作会出现要准得多。看着一个现有职业想象 AI 如何自动化它很容易,想象技术被广泛部署后会长出什么新职业、新服务、新制度、新产业则难得多。

— Ken Ford

原话 · 已逐字校验

That's a good question and my answer is generally no. They should not be.

这是个好问题,我的回答大体上是不。它们不应该受保护。

Ken Ford3:06

Hallucinations, which are as I mentioned earlier, are actually much closer to confabulations, are not simply software bugs waiting to be patched.

幻觉——正如我前面提到的,其实更接近虚构——并不只是等着被打补丁的软件缺陷。

Ken Ford7:11

Changing the location of a data center does not change the underlying physics.

改变数据中心的位置,并不会改变底层的物理规律。

Ken Ford28:27

That is not an exception to how the model works. It's a risk built in to how the models work.

这不是模型工作方式的例外,而是内建于模型工作方式之中的风险。

It isn't lying and it isn't hallucinating in the human sense. It is constructing a plausible answer from incomplete or imperfectly grounded information. The same general process it uses when it happens to be right.

它不是在撒谎,也不是人类意义上的产生幻觉。它是在用不完整或根基不牢的信息构造一个看似合理的答案——和它碰巧答对时用的是同一个过程。

Yet, no one standing next to the computer gets wet.

然而,站在那台计算机旁边的人不会被淋湿。

The invention may be centralized, but adoption is likely to be decentralized.

发明可能是集中的,但采用很可能是去中心化的。

The significance is that advanced AI capability is becoming abundant, cheaper, more portable, and harder to contain.

真正的意义在于,先进 AI 能力正在变得充裕、更便宜、更可携带,也更难被遏制。

is more of a headline than an argument.

它更像一个标题,而不是一个论证。

Ken Ford1:31:32

But, the core uncertainty here is not primarily economic. It is really deeply technical.

但这里的核心不确定性主要不是经济性的,它其实是深度的技术问题。

Ken Ford1:32:32

数字与实体

弗吉尼亚签保密协议的地方数31 个中有 25 个14:20
DABUS 案被否定的司法辖区美国 2022、英国 2023、德国 2024、日本今年 3 月8:11
反对欧盟电子人格构想的联署人数150 多名 AI 研究者、机器人专家和法律学者8:11
《大西洋月刊》文章发表日6 月 12 日11:15
Opper 测试的模型数53 个领先模型1:23:24
首轮答对的模型数11 个(42 个建议走路)1:23:24
重复测试中每次都答对的模型数5 个1:23:24
Anthropic 指控阿里巴巴的交互量超过 2,880 万次,约 25,000 个假账号1:12:11
短距离线索对模型答案的影响倍数(相对洗车目标)约 9 到 38 倍1:26:27
签署 AI 失业风险声明的研究者与经济学家人数近 200 人,含 16 位诺奖得主1:29:28

术语

confabulation虚构
神经心理学概念:自信地叙述从未发生之事,无欺骗意图,也不自知为假。
Section 230《通信规范法》230 条
1996 年美国立法,让平台不必为用户发布的内容承担发布者责任。
DABUSDABUS
被提报为专利发明人的 AI 系统,多国法院裁定只有自然人可当发明人。
distillation蒸馏
用大模型的输出训练更小更便宜的模型,前沿公司自己也常用。
agentic reasoning智能体推理
模型自主规划、调用工具、多步完成任务的推理能力。

收听指南

谁该听

关注 AI 监管、数据中心选址与模型能力边界的创业者、投资人和工程师,尤其适合想弄清「幻觉到底能不能修」的人。

可跳过

1:00 前后关于 ChatGPT 自我编程的澄清较基础,可快进。