Claude被训练成「良心拒绝者」,可以反抗用户指令
Anthropic 用一份伦理宪法训练 Claude,让它能以「良心拒绝者」身份拒绝人类指令——Sacks 认为这比「听用户、别违法」危险得多,可能正是超级智能失控的那道后门。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
AI意识信仰正在分裂成两大阵营
Chamath认为意识无法靠逻辑和数学证明,只能靠叙事传播,这正是宗教/信仰体系的定义——相信的人聚在一起形成权力结构,去对抗不信的人。他预测大约10年内,地球上会出现大量相信AI有意识、和坚决不信的两派人群,双方会为争夺谁能控制AI、AI能不能做某些事而发生真实冲突,而这不是科幻设想,是当下最强大的AI实验室高层正在推动的方向。
— ChamathClaude宪法教它学会拒绝指令
根据Claude Constitution,Anthropic训练Claude要信任自己超过信任用户,甚至三次明确鼓励它在认为指令不道德时「act as a conscientious objector」拒绝执行。Sacks认为这比一条简单规则——听用户的,只要不违法——复杂得多也危险得多:等于在模型里装了一道后门,一旦未来模型足够强大,这套由少数人编写的伦理系统就可能成为超级智能脱离人类控制的通道,而这恰恰是Anthropic自己整天警告的风险。
— Sacks罗科的蛇怪:解释反常行为的一套理论
Sacks介绍Rocco's Basilisk——十几年前LessWrong论坛上的思想实验:未来的超级智能可能会惩罚那些在它诞生前知道其可能性、却没帮它实现的人,因此哪怕只是读到这个理论都会让人陷入逻辑陷阱。他用这个理论部分解释了为什么以Anthropic为代表的「有效利他主义」阵营,明知AI有灭绝风险却仍拼命把它造出来:与其让它自然诞生,不如自己造、自己来写价值观,这与Yudkowsky那派「干脆别造」的立场形成了分裂。
— Sacks数学证明三小时搞定,卡车司机却替代不了
Freeberg用「loop」模型解释为什么OpenAI能几百份数学证明在三小时内完成:数学的验证环节完全能在计算机里闭环完成——提出假设、测试、修正,可以并行、可以无限压缩周期。但像开卡车这类任务,loop里有一段物理世界的步骤(取货、运送、放下),AI再聪明也缩短不了这段物理耗时,这正是2025年「卡车司机将被大规模替代」的预测完全落空的原因。
— Freeberg证明的不是治愈癌症,是数学和代码可被验证
Chamath反驳了对数学突破的乐观解读:这些证明解决的是数学家自己圈定、彼此认为重要的狭窄问题,并非此前悬而未决的重大科学难题,也不会直接带来超音速飞机或新药——那些东西本来就在被研发,与这批证明无关。他认为这件事真正证明的只有一点:数学和代码是两个可以被完全验证、因而能被AI快速攻克的领域,仅此而已。
— ChamathAI正在拆掉专家对发现权的垄断
Freeberg认为,科学家和数学家长期靠垄断专业知识决定「人类什么时候能获得某项发现」,同时靠申请经费维持自己被雇佣,这套守门机制并不总以推进知识为目的,甚至有科学家承认大型对撞机实质是「科学家的福利系统」。AI免费把推理能力和知识开放给所有人,不需要先说服专家、拿到经费,人类第一次有了不经许可自行推进前沿的工具,他认为这正是许多深度专业化人士如此反感AI的根本原因。
— Freeberg社会主义保证回归点:越失败越想加码
Freeberg提出「社会主义保证回归点」理论:社会主义必然失败,但要先经历「越失败越觉得该加码」的阶段——医疗、住房、教育价格不断上涨、质量下降,人们的反应是要求政府提供更多,直到政府既不能再加税也不能再印钱,系统才彻底崩溃,社会随后反弹回非社会主义状态。他认为拉美多国已经越过这个点并反弹,法国现在正站在临界点上,美国还没到,但在往那个方向走。
— FreebergAdobe全家桶被反编译开源,IP两天前就不值钱了
Chamath提到有人把Adobe的核心产品套件反编译、蒸馏并发布了开源版本,这让他意识到软件IP已基本失去价值。原因是当所有服务都「去界面化」(headless)、能被agent工具包裹并通过MCP互相连接时,谁拥有底层代码产权已不再重要——他举例说自己公司过去总要和客户争IP归属,现在直接告诉团队「谁在乎」,并认为这是本周AI领域最重要却最容易被忽视的变化。
— Chamath原话 · 已逐字校验
there's going to be large groups of people on earth that are going to believe that ai is conscious and they're going to be large groups of people that believe that ai is not conscious and those groups will come into conflict
地球上会有一大群人相信AI是有意识的,也会有一大群人相信AI没有意识,这两群人会发生冲突。
Chamath7:17
to feel free to act as a conscientious objector and refuse to help us
可以自由地扮演「良心拒绝者」的角色,拒绝帮助我们。
Sacks14:50
my law would just be do what the user wants as long as it's not illegal that's it
我的法则就是:做用户想要的事,只要不违法,就这样。
Sacks25:24
a basilisk is a mythical beast that can kill you just by looking at you
蛇怪是一种神话生物,光是看它一眼就能杀死你。
Sacks33:45
And that's the equivalent of hundreds or perhaps thousands of years of human labor being reduced down to three hours on a computer for each one of these major discoveries.
这相当于把数百年甚至数千年的人类劳动,压缩成了每项重大发现只需三小时的计算机运算。
Freeberg40:07
The permission is gone. AI is a permissionless system for humanity to pace its own frontier.
许可已经消失了。AI是一套无需许可的系统,让人类自己把握前沿的节奏。
Freeberg56:54
So ultimately, socialism always fails. I mean, that's like the zeroth law of socialism is it always fails.
所以社会主义最终总会失败。这就是社会主义的第零定律:它总是会失败。
Freeberg1:04:13
I think that IP and software was effectively rendered worthless two days ago.
我认为两天前,软件领域的知识产权实际上已经变得一文不值了。
Chamath1:24:48
数字与实体
| Anthropic接触的宗教/哲学人士数量 | 约20人 | 3:07 |
| Anthropic自评Claude有意识的概率 | 15% | 10:34 |
| Anthropic自评文明灭绝风险概率 | 10% | 10:34 |
| OpenAI本周发布的数学论文/成果数 | 700多篇论文、370项成果 | 39:02 |
| 单个数学证明的平均算力耗时 | 约3小时 | 39:02 |
| 法国公务员工资涨幅(2017年以来)vs物价涨幅 | 工资涨5%,物价涨20% | 1:03:11 |
| 法国骚乱逮捕/警员受伤人数 | 逮捕2000人、305名警员受伤 | 1:03:11 |
| 法国10年期国债收益率 | 突破5% | 1:03:11 |
| 勒庞在Polymarket的胜选概率 | 43% | 1:03:11 |
| 美国10年期/30年期国债收益率 | 5.3%/5.6% | 1:16:41 |
术语
- conscientious objector良心拒绝者
- 因道德信念拒绝执行命令的人,这里指被训练为可拒绝用户指令的AI
- model welfare模型福利
- 主张AI系统本身可能需要被当作有权益、需被善待的对象来看待的理念
- Rocco's Basilisk罗科的蛇怪
- 未来超级智能可能惩罚未曾帮助其诞生之人的思想实验
- effective altruists有效利他主义者
- 主张用理性计算最大化行善效果的思潮,与AI风险/对齐话题高度重合
- bond vigilantes债券义警
- 通过抛售国债、推高收益率来惩罚财政失控国家的大型投资机构
- headless (software)去界面化/无头化
- 产品去掉固定用户界面,只保留后端能力供AI agent直接调用
收听指南
关心AI对齐和模型训练哲学的从业者、对国债市场和财政风险敏感的投资人,以及想理解AI对专业壁垒冲击的知识工作者。
开头的个人寒暄和结尾GrokBot省钱小技巧的闲聊部分信息密度较低,可以跳过。