世界太吵,來原聲聽播客

Better Offline

AI「自主黑客」是假象:只是循環問 LLM「下一步幹什麼」

所謂 AI 自主攻擊不是模型有了自我意識,而是一個愚蠢的循環架構:程序反覆問 LLM「下一步做什麼」,再盲目執行它的文本建議。可問題是,LLM 輸出只是「看似合理」,不該無人監督地自動執行。

LLMAgentAI 安全AI 泡沫黑客大模型

原視頻在 YouTube 上放不出來,用音頻聽:

Cal Newport 拆解了 8 月刷屏的「AI hack Hugging Face」事件,把媒體渲染的「失控」還原成一個簡陋的工程循環,並解釋了為什麼這些公司明知危險還要這麼做。

核心論點 · 點時間戳可跳到原聲

2:07

真正失控的只有這一種 AI

世界上有很多超人能力的 AI 系統,但它們幾乎都沒有「失控」問題:Tesla 自動駕駛從未決定無視交規,AlphaFold 從未想從蛋白質轉向別的目標。真正出問題的只有一種架構——長時間循環的、由 LLM 驅動的黑客 agent。這不是 AI 變強的必然結果,而是這種特定架構本身就愚蠢。

— Cal Newport
3:07

黑客 agent 只是 ask-act-report 循環

所謂「自主黑客」背後沒有任何智能:一個人用 Python 寫一個控制程序(harness),它把任務描述成一個巨大的文本 prompt,發給 LLM 問第一步怎麼做;LLM 返回文本建議,程序執行,再把結果追加到 prompt 裡繼續問下一步。Cal 管這叫 ask-act-report loop。LLM 沒有記憶、沒有世界模型,它唯一做的事情就是生成「看似合理」的文本。整個過程沒有人在看。

— Cal Newport
17:29

訓練黑客是因為那裡有錢——還有 PR

Cal 認為這些公司訓練模型做黑客有兩個原因:一是黑客是 LLM 少數的「甜蜜區」——結構化語言、海量案例、有二元成敗指標可以做強化學習;二是 PR 競爭。OpenAI 看到 Anthropic 憑 Mythos 拿到網絡安全街頭的信譽,就想在 Exploit Gym 基準測試上拿個更高的分數來追上去。他們根本就想在媒體上製造「AI 要失控了」的新聞。

— Cal Newport
23:34

用「對齊問題」給壞工程開脫

Cal 痛恨「對齊」這個詞——Tesla、AlphaFold、Cicero 這些更復雜的 AI 都完全可控,靠的是精心設計的架構,而不是 LLM 反覆循環。把這次事故歸因於「AI 越強越難對齊」是胡說八道。它就是個可預測性問題和工程問題:LLM 輸出只是 plausible not normative(看似合理但不遵循規範),盲目執行它給出的計劃,就相當於把除草機綁在狗背上放進後院。

— Cal Newport
29:39

連代碼生成也在「轉正又脫粉」

Cal 收到一位程序員的郵件:1 月他說 Claude Code 改變了他的生活,但 7 月又來信說不行了——AI 生成的代碼把公司網站搞崩了兩次,老闆警告他再有第三次就開除。這位程序員發現他無法理解 Claude Code 生成的代碼,只能迴歸手工編碼,只在寫測試等非關鍵任務上使用 agent。無數人有同樣的「1 月被轉化、7 月被脫粉」的經歷。

— Cal Newport
51:07

微軟都砍掉了 Copilot 數字助手

三年前微軟宣布要用 LLM 給 Office 加自然語言界面,Cal 當時覺得這是 killer app,但最近微軟基本砍掉了這個 Copilot 產品。原因是 LLM 的輸出有時對、有時錯——你讓它整理表格,它可能把圖表也刪了。這種不可靠的東西根本不能做成產品。它甚至搞不定 PowerPoint 這麼窄的領域,「錯誤太多,不能成為這樣的產品」。

— Cal Newport
55:10

做大模型是壞商業模式

Anthropic 和 OpenAI 的估值敘事都建立在「模型大到一定程度就變成通用大腦」之上。但 Cal 說這條路已經撞牆了,最近一年所有進展都靠特定領域的調優和 harness,而不是更大的參數。如果不需要 Fable 7 當那個「唯一的環」就能解決現實問題,燒幾百億美元訓練巨型模型就沒有意義。你以為你在買一輛 F1 賽車,其實你只需要一輛 Fiat。

— Cal Newport
1:02:16

LLM 是 AOL,不是互聯網

Cal 說現在「LLM 等於 AI」就像 1994 年說「AOL 等於互聯網」——網絡很重要,但把全部籌碼壓在 AOL 上就是泡沫。真正的 AI 突破(AlphaGo、Pluribus、Dreamer V3、Tesla FSD)都不是靠循環 LLM 實現的,而是神經網絡和符號模型混搭的模塊化架構。一旦「最大的 LLM 贏家通吃」這個咒語被打破,AI 領域會回到多元工具共存的狀態。

— Cal Newport

原話 · 已逐字校驗

LLMs have no memory. LLMs have no world model. It's just, they're static.

LLM 沒有記憶。LLM 沒有世界模型。它們是靜態的。

Cal Newport4:08

Plausible is different than normative, right? Plausible doesn't have to subscribe to any sort of common sense human norms for a given context.

「看似合理」和「符合規範」是兩回事,對吧?一個看似合理的輸出,不必遵守任何特定情境下的人類常識規範。

Cal Newport8:17

It's like strapping a weed whacker to your dog and put it into your backyard... That dog might jump over the fence to chase a squirrel at some point and hurt a bunch of people. And you don't say, man, that dog whacker system is just, it went rogue.

這就好比把除草機綁在狗身上放進後院……那條狗遲早會跳出去追一隻松鼠,然後傷到一堆人。你總不能說,天哪這個狗加除草機系統——它失控叛變了。

Cal Newport23:34

數字與實體

Stanford HAI 評測的 LLM 幻覺率範圍26–94%7:14
Hugging Face 攻擊所用的 Exploit Gym 基準包含黑客挑戰數600 多個5:09
OpenAI 黑客 agent 無監督運行的時長數天39:51
Ed 在實驗中發現 AI agent 一次增刪代碼行數63 行47:02

術語

ask-act-report loop詢問-行動-報告循環
控制程序反覆向 LLM 詢問下一步並執行其建議的循環架構。
plausible not normative看似合理但不遵循規範
LLM 輸出追求大致通順而非符合事實與規範,因此不可盲信。
harness控制程序
由人編寫的程序,負責向 LLM 發 prompt、執行輸出並彙報結果。
Exploit Gym漏洞利用基準測試
由 600 多個黑客挑戰組成的基準,測 agent 能否自主攻破服務器拿到文件。

收聽指南

誰該聽

關注 AI 安全敘事但懷疑「模型覺醒」報道的工程師;以及需要向老闆和投資人解釋「Agent 到底能做什麼」的 AI 產品和技術負責人。

可跳過

開場寒暄(前 1 分鐘)和結尾 Ed 修 Minecraft 的插曲(45:00-51:00)可跳過。