80,000 Hours
超長深訪 AI 安全與治理的研究者,準備程度接近學術,自帶官方全文
本站已深讀4 / 349 集
更新節奏約 7.0 天一集
最新一集2026-08-27
官方逐字稿自帶
分類AI / 技術
優先級T1
3:47:3480,000 Hours
0827
AI 失控前,Plan A 是唯一來得及的剎車
Plan A 用「研究透明 + 限制算力 + 公民分紅」把 AI 從指數爆炸拉回可控斜率;作者自評它仍有 15% 災難概率,但已經優於坐等 AI 起飛。
8 要點
7 金句
AI 治理超級智能
2:15:2880,000 Hours
0820
少量惡意數據微調,模型竟湧現出邪惡人格
少量惡意數據微調就能讓模型湧現出廣泛錯位行為,甚至形成邪惡人格;激活預言機是檢測內部不良意圖的新工具,但對齊現狀仍不樂觀。
8 要點
7 金句
AI 安全湧現性錯位
2:02:1680,000 Hours
0811
減速窗口已錯過,超級智能兩三年內到來
英國前 AI 安全負責人 Geoffrey Irving 認為,全面超級智能將在兩三年內到來,減速的窗口已經錯過;對齊的希望在於可擴展監督、人格研究和理論突破,而不是精確指定效用函數。
8 要點
8 金句
AI 對齊超級智能
49:2880,000 Hours
0804
AI 收入年增 700%,但髒活任務仍差人類 6 倍
2026 年 AI 進展證據:收入爆炸、編碼智能體成熟,但髒活任務仍差;時間線縮短約一年,但長期仍存變數。
8 要點
8 金句
AGIAI 智能體