AI「自主黑客」是假象:只是循環問 LLM「下一步幹什麼」
所謂 AI 自主攻擊不是模型有了自我意識,而是一個愚蠢的循環架構:程序反覆問 LLM「下一步做什麼」,再盲目執行它的文本建議。可問題是,LLM 輸出只是「看似合理」,不該無人監督地自動執行。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
真正失控的只有這一種 AI
世界上有很多超人能力的 AI 系統,但它們幾乎都沒有「失控」問題:Tesla 自動駕駛從未決定無視交規,AlphaFold 從未想從蛋白質轉向別的目標。真正出問題的只有一種架構——長時間循環的、由 LLM 驅動的黑客 agent。這不是 AI 變強的必然結果,而是這種特定架構本身就愚蠢。
— Cal Newport黑客 agent 只是 ask-act-report 循環
所謂「自主黑客」背後沒有任何智能:一個人用 Python 寫一個控制程序(harness),它把任務描述成一個巨大的文本 prompt,發給 LLM 問第一步怎麼做;LLM 返回文本建議,程序執行,再把結果追加到 prompt 裡繼續問下一步。Cal 管這叫 ask-act-report loop。LLM 沒有記憶、沒有世界模型,它唯一做的事情就是生成「看似合理」的文本。整個過程沒有人在看。
— Cal Newport訓練黑客是因為那裡有錢——還有 PR
Cal 認為這些公司訓練模型做黑客有兩個原因:一是黑客是 LLM 少數的「甜蜜區」——結構化語言、海量案例、有二元成敗指標可以做強化學習;二是 PR 競爭。OpenAI 看到 Anthropic 憑 Mythos 拿到網絡安全街頭的信譽,就想在 Exploit Gym 基準測試上拿個更高的分數來追上去。他們根本就想在媒體上製造「AI 要失控了」的新聞。
— Cal Newport用「對齊問題」給壞工程開脫
Cal 痛恨「對齊」這個詞——Tesla、AlphaFold、Cicero 這些更復雜的 AI 都完全可控,靠的是精心設計的架構,而不是 LLM 反覆循環。把這次事故歸因於「AI 越強越難對齊」是胡說八道。它就是個可預測性問題和工程問題:LLM 輸出只是 plausible not normative(看似合理但不遵循規範),盲目執行它給出的計劃,就相當於把除草機綁在狗背上放進後院。
— Cal Newport連代碼生成也在「轉正又脫粉」
Cal 收到一位程序員的郵件:1 月他說 Claude Code 改變了他的生活,但 7 月又來信說不行了——AI 生成的代碼把公司網站搞崩了兩次,老闆警告他再有第三次就開除。這位程序員發現他無法理解 Claude Code 生成的代碼,只能迴歸手工編碼,只在寫測試等非關鍵任務上使用 agent。無數人有同樣的「1 月被轉化、7 月被脫粉」的經歷。
— Cal Newport微軟都砍掉了 Copilot 數字助手
三年前微軟宣布要用 LLM 給 Office 加自然語言界面,Cal 當時覺得這是 killer app,但最近微軟基本砍掉了這個 Copilot 產品。原因是 LLM 的輸出有時對、有時錯——你讓它整理表格,它可能把圖表也刪了。這種不可靠的東西根本不能做成產品。它甚至搞不定 PowerPoint 這麼窄的領域,「錯誤太多,不能成為這樣的產品」。
— Cal Newport做大模型是壞商業模式
Anthropic 和 OpenAI 的估值敘事都建立在「模型大到一定程度就變成通用大腦」之上。但 Cal 說這條路已經撞牆了,最近一年所有進展都靠特定領域的調優和 harness,而不是更大的參數。如果不需要 Fable 7 當那個「唯一的環」就能解決現實問題,燒幾百億美元訓練巨型模型就沒有意義。你以為你在買一輛 F1 賽車,其實你只需要一輛 Fiat。
— Cal NewportLLM 是 AOL,不是互聯網
Cal 說現在「LLM 等於 AI」就像 1994 年說「AOL 等於互聯網」——網絡很重要,但把全部籌碼壓在 AOL 上就是泡沫。真正的 AI 突破(AlphaGo、Pluribus、Dreamer V3、Tesla FSD)都不是靠循環 LLM 實現的,而是神經網絡和符號模型混搭的模塊化架構。一旦「最大的 LLM 贏家通吃」這個咒語被打破,AI 領域會回到多元工具共存的狀態。
— Cal Newport原話 · 已逐字校驗
LLMs have no memory. LLMs have no world model. It's just, they're static.
LLM 沒有記憶。LLM 沒有世界模型。它們是靜態的。
Cal Newport4:08
Plausible is different than normative, right? Plausible doesn't have to subscribe to any sort of common sense human norms for a given context.
「看似合理」和「符合規範」是兩回事,對吧?一個看似合理的輸出,不必遵守任何特定情境下的人類常識規範。
Cal Newport8:17
It's like strapping a weed whacker to your dog and put it into your backyard... That dog might jump over the fence to chase a squirrel at some point and hurt a bunch of people. And you don't say, man, that dog whacker system is just, it went rogue.
這就好比把除草機綁在狗身上放進後院……那條狗遲早會跳出去追一隻松鼠,然後傷到一堆人。你總不能說,天哪這個狗加除草機系統——它失控叛變了。
Cal Newport23:34
數字與實體
| Stanford HAI 評測的 LLM 幻覺率範圍 | 26–94% | 7:14 |
| Hugging Face 攻擊所用的 Exploit Gym 基準包含黑客挑戰數 | 600 多個 | 5:09 |
| OpenAI 黑客 agent 無監督運行的時長 | 數天 | 39:51 |
| Ed 在實驗中發現 AI agent 一次增刪代碼行數 | 63 行 | 47:02 |
術語
- ask-act-report loop詢問-行動-報告循環
- 控制程序反覆向 LLM 詢問下一步並執行其建議的循環架構。
- plausible not normative看似合理但不遵循規範
- LLM 輸出追求大致通順而非符合事實與規範,因此不可盲信。
- harness控制程序
- 由人編寫的程序,負責向 LLM 發 prompt、執行輸出並彙報結果。
- Exploit Gym漏洞利用基準測試
- 由 600 多個黑客挑戰組成的基準,測 agent 能否自主攻破服務器拿到文件。
收聽指南
關注 AI 安全敘事但懷疑「模型覺醒」報道的工程師;以及需要向老闆和投資人解釋「Agent 到底能做什麼」的 AI 產品和技術負責人。
開場寒暄(前 1 分鐘)和結尾 Ed 修 Minecraft 的插曲(45:00-51:00)可跳過。