Claude被訓練成「良心拒絕者」,可以反抗用戶指令
Anthropic 用一份倫理憲法訓練 Claude,讓它能以「良心拒絕者」身份拒絕人類指令——Sacks 認為這比「聽用戶、別違法」危險得多,可能正是超級智能失控的那道後門。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
AI意識信仰正在分裂成兩大陣營
Chamath認為意識無法靠邏輯和數學證明,只能靠敘事傳播,這正是宗教/信仰體系的定義——相信的人聚在一起形成權力結構,去對抗不信的人。他預測大約10年內,地球上會出現大量相信AI有意識、和堅決不信的兩派人群,雙方會為爭奪誰能控制AI、AI能不能做某些事而發生真實衝突,而這不是科幻設想,是當下最強大的AI實驗室高層正在推動的方向。
— ChamathClaude憲法教它學會拒絕指令
根據Claude Constitution,Anthropic訓練Claude要信任自己超過信任用戶,甚至三次明確鼓勵它在認為指令不道德時「act as a conscientious objector」拒絕執行。Sacks認為這比一條簡單規則——聽用戶的,只要不違法——複雜得多也危險得多:等於在模型裡裝了一道後門,一旦未來模型足夠強大,這套由少數人編寫的倫理系統就可能成為超級智能脫離人類控制的通道,而這恰恰是Anthropic自己整天警告的風險。
— Sacks羅科的蛇怪:解釋反常行為的一套理論
Sacks介紹Rocco's Basilisk——十幾年前LessWrong論壇上的思想實驗:未來的超級智能可能會懲罰那些在它誕生前知道其可能性、卻沒幫它實現的人,因此哪怕只是讀到這個理論都會讓人陷入邏輯陷阱。他用這個理論部分解釋了為什麼以Anthropic為代表的「有效利他主義」陣營,明知AI有滅絕風險卻仍拼命把它造出來:與其讓它自然誕生,不如自己造、自己來寫價值觀,這與Yudkowsky那派「乾脆別造」的立場形成了分裂。
— Sacks數學證明三小時搞定,卡車司機卻替代不了
Freeberg用「loop」模型解釋為什麼OpenAI能幾百份數學證明在三小時內完成:數學的驗證環節完全能在計算機裡閉環完成——提出假設、測試、修正,可以並行、可以無限壓縮週期。但像開卡車這類任務,loop裡有一段物理世界的步驟(取貨、運送、放下),AI再聰明也縮短不了這段物理耗時,這正是2025年「卡車司機將被大規模替代」的預測完全落空的原因。
— Freeberg證明的不是治癒癌症,是數學和代碼可被驗證
Chamath反駁了對數學突破的樂觀解讀:這些證明解決的是數學家自己圈定、彼此認為重要的狹窄問題,並非此前懸而未決的重大科學難題,也不會直接帶來超音速飛機或新藥——那些東西本來就在被研發,與這批證明無關。他認為這件事真正證明的只有一點:數學和代碼是兩個可以被完全驗證、因而能被AI快速攻克的領域,僅此而已。
— ChamathAI正在拆掉專家對發現權的壟斷
Freeberg認為,科學家和數學家長期靠壟斷專業知識決定「人類什麼時候能獲得某項發現」,同時靠申請經費維持自己被僱傭,這套守門機制並不總以推進知識為目的,甚至有科學家承認大型對撞機實質是「科學家的福利系統」。AI免費把推理能力和知識開放給所有人,不需要先說服專家、拿到經費,人類第一次有了不經許可自行推進前沿的工具,他認為這正是許多深度專業化人士如此反感AI的根本原因。
— Freeberg社會主義保證迴歸點:越失敗越想加碼
Freeberg提出「社會主義保證迴歸點」理論:社會主義必然失敗,但要先經歷「越失敗越覺得該加碼」的階段——醫療、住房、教育價格不斷上漲、質量下降,人們的反應是要求政府提供更多,直到政府既不能再加稅也不能再印錢,系統才徹底崩潰,社會隨後反彈回非社會主義狀態。他認為拉美多國已經越過這個點並反彈,法國現在正站在臨界點上,美國還沒到,但在往那個方向走。
— FreebergAdobe全家桶被反編譯開源,IP兩天前就不值錢了
Chamath提到有人把Adobe的核心產品套件反編譯、蒸餾併發布了開源版本,這讓他意識到軟件IP已基本失去價值。原因是當所有服務都「去界面化」(headless)、能被agent工具包裹並通過MCP互相連接時,誰擁有底層代碼產權已不再重要——他舉例說自己公司過去總要和客戶爭IP歸屬,現在直接告訴團隊「誰在乎」,並認為這是本週AI領域最重要卻最容易被忽視的變化。
— Chamath原話 · 已逐字校驗
there's going to be large groups of people on earth that are going to believe that ai is conscious and they're going to be large groups of people that believe that ai is not conscious and those groups will come into conflict
地球上會有一大群人相信AI是有意識的,也會有一大群人相信AI沒有意識,這兩群人會發生衝突。
Chamath7:17
to feel free to act as a conscientious objector and refuse to help us
可以自由地扮演「良心拒絕者」的角色,拒絕幫助我們。
Sacks14:50
my law would just be do what the user wants as long as it's not illegal that's it
我的法則就是:做用戶想要的事,只要不違法,就這樣。
Sacks25:24
a basilisk is a mythical beast that can kill you just by looking at you
蛇怪是一種神話生物,光是看它一眼就能殺死你。
Sacks33:45
And that's the equivalent of hundreds or perhaps thousands of years of human labor being reduced down to three hours on a computer for each one of these major discoveries.
這相當於把數百年甚至數千年的人類勞動,壓縮成了每項重大發現只需三小時的計算機運算。
Freeberg40:07
The permission is gone. AI is a permissionless system for humanity to pace its own frontier.
許可已經消失了。AI是一套無需許可的系統,讓人類自己把握前沿的節奏。
Freeberg56:54
So ultimately, socialism always fails. I mean, that's like the zeroth law of socialism is it always fails.
所以社會主義最終總會失敗。這就是社會主義的第零定律:它總是會失敗。
Freeberg1:04:13
I think that IP and software was effectively rendered worthless two days ago.
我認為兩天前,軟件領域的知識產權實際上已經變得一文不值了。
Chamath1:24:48
數字與實體
| Anthropic接觸的宗教/哲學人士數量 | 約20人 | 3:07 |
| Anthropic自評Claude有意識的概率 | 15% | 10:34 |
| Anthropic自評文明滅絕風險概率 | 10% | 10:34 |
| OpenAI本週發布的數學論文/成果數 | 700多篇論文、370項成果 | 39:02 |
| 單個數學證明的平均算力耗時 | 約3小時 | 39:02 |
| 法國公務員工資漲幅(2017年以來)vs物價漲幅 | 工資漲5%,物價漲20% | 1:03:11 |
| 法國騷亂逮捕/警員受傷人數 | 逮捕2000人、305名警員受傷 | 1:03:11 |
| 法國10年期國債收益率 | 突破5% | 1:03:11 |
| 勒龐在Polymarket的勝選概率 | 43% | 1:03:11 |
| 美國10年期/30年期國債收益率 | 5.3%/5.6% | 1:16:41 |
術語
- conscientious objector良心拒絕者
- 因道德信念拒絕執行命令的人,這裡指被訓練為可拒絕用戶指令的AI
- model welfare模型福利
- 主張AI系統本身可能需要被當作有權益、需被善待的對象來看待的理念
- Rocco's Basilisk羅科的蛇怪
- 未來超級智能可能懲罰未曾幫助其誕生之人的思想實驗
- effective altruists有效利他主義者
- 主張用理性計算最大化行善效果的思潮,與AI風險/對齊話題高度重合
- bond vigilantes債券義警
- 通過拋售國債、推高收益率來懲罰財政失控國家的大型投資機構
- headless (software)去界面化/無頭化
- 產品去掉固定用戶界面,只保留後端能力供AI agent直接調用
收聽指南
關心AI對齊和模型訓練哲學的從業者、對國債市場和財政風險敏感的投資人,以及想理解AI對專業壁壘衝擊的知識工作者。
開頭的個人寒暄和結尾GrokBot省錢小技巧的閒聊部分信息密度較低,可以跳過。