世界太吵,来原声听播客

Better Offline

AI「自主黑客」是假象:只是循环问 LLM「下一步干什么」

所谓 AI 自主攻击不是模型有了自我意识,而是一个愚蠢的循环架构:程序反复问 LLM「下一步做什么」,再盲目执行它的文本建议。可问题是,LLM 输出只是「看似合理」,不该无人监督地自动执行。

LLMAgentAI 安全AI 泡沫黑客大模型

原视频在 YouTube 上放不出来,用音频听:

Cal Newport 拆解了 8 月刷屏的「AI hack Hugging Face」事件,把媒体渲染的「失控」还原成一个简陋的工程循环,并解释了为什么这些公司明知危险还要这么做。

核心论点 · 点时间戳可跳到原声

2:07

真正失控的只有这一种 AI

世界上有很多超人能力的 AI 系统,但它们几乎都没有「失控」问题:Tesla 自动驾驶从未决定无视交规,AlphaFold 从未想从蛋白质转向别的目标。真正出问题的只有一种架构——长时间循环的、由 LLM 驱动的黑客 agent。这不是 AI 变强的必然结果,而是这种特定架构本身就愚蠢。

— Cal Newport
3:07

黑客 agent 只是 ask-act-report 循环

所谓「自主黑客」背后没有任何智能:一个人用 Python 写一个控制程序(harness),它把任务描述成一个巨大的文本 prompt,发给 LLM 问第一步怎么做;LLM 返回文本建议,程序执行,再把结果追加到 prompt 里继续问下一步。Cal 管这叫 ask-act-report loop。LLM 没有记忆、没有世界模型,它唯一做的事情就是生成「看似合理」的文本。整个过程没有人在看。

— Cal Newport
17:29

训练黑客是因为那里有钱——还有 PR

Cal 认为这些公司训练模型做黑客有两个原因:一是黑客是 LLM 少数的「甜蜜区」——结构化语言、海量案例、有二元成败指标可以做强化学习;二是 PR 竞争。OpenAI 看到 Anthropic 凭 Mythos 拿到网络安全街头的信誉,就想在 Exploit Gym 基准测试上拿个更高的分数来追上去。他们根本就想在媒体上制造「AI 要失控了」的新闻。

— Cal Newport
23:34

用「对齐问题」给坏工程开脱

Cal 痛恨「对齐」这个词——Tesla、AlphaFold、Cicero 这些更复杂的 AI 都完全可控,靠的是精心设计的架构,而不是 LLM 反复循环。把这次事故归因于「AI 越强越难对齐」是胡说八道。它就是个可预测性问题和工程问题:LLM 输出只是 plausible not normative(看似合理但不遵循规范),盲目执行它给出的计划,就相当于把除草机绑在狗背上放进后院。

— Cal Newport
29:39

连代码生成也在「转正又脱粉」

Cal 收到一位程序员的邮件:1 月他说 Claude Code 改变了他的生活,但 7 月又来信说不行了——AI 生成的代码把公司网站搞崩了两次,老板警告他再有第三次就开除。这位程序员发现他无法理解 Claude Code 生成的代码,只能回归手工编码,只在写测试等非关键任务上使用 agent。无数人有同样的「1 月被转化、7 月被脱粉」的经历。

— Cal Newport
51:07

微软都砍掉了 Copilot 数字助手

三年前微软宣布要用 LLM 给 Office 加自然语言界面,Cal 当时觉得这是 killer app,但最近微软基本砍掉了这个 Copilot 产品。原因是 LLM 的输出有时对、有时错——你让它整理表格,它可能把图表也删了。这种不可靠的东西根本不能做成产品。它甚至搞不定 PowerPoint 这么窄的领域,「错误太多,不能成为这样的产品」。

— Cal Newport
55:10

做大模型是坏商业模式

Anthropic 和 OpenAI 的估值叙事都建立在「模型大到一定程度就变成通用大脑」之上。但 Cal 说这条路已经撞墙了,最近一年所有进展都靠特定领域的调优和 harness,而不是更大的参数。如果不需要 Fable 7 当那个「唯一的环」就能解决现实问题,烧几百亿美元训练巨型模型就没有意义。你以为你在买一辆 F1 赛车,其实你只需要一辆 Fiat。

— Cal Newport
1:02:16

LLM 是 AOL,不是互联网

Cal 说现在「LLM 等于 AI」就像 1994 年说「AOL 等于互联网」——网络很重要,但把全部筹码压在 AOL 上就是泡沫。真正的 AI 突破(AlphaGo、Pluribus、Dreamer V3、Tesla FSD)都不是靠循环 LLM 实现的,而是神经网络和符号模型混搭的模块化架构。一旦「最大的 LLM 赢家通吃」这个咒语被打破,AI 领域会回到多元工具共存的状态。

— Cal Newport

原话 · 已逐字校验

LLMs have no memory. LLMs have no world model. It's just, they're static.

LLM 没有记忆。LLM 没有世界模型。它们是静态的。

Cal Newport4:08

Plausible is different than normative, right? Plausible doesn't have to subscribe to any sort of common sense human norms for a given context.

「看似合理」和「符合规范」是两回事,对吧?一个看似合理的输出,不必遵守任何特定情境下的人类常识规范。

Cal Newport8:17

It's like strapping a weed whacker to your dog and put it into your backyard... That dog might jump over the fence to chase a squirrel at some point and hurt a bunch of people. And you don't say, man, that dog whacker system is just, it went rogue.

这就好比把除草机绑在狗身上放进后院……那条狗迟早会跳出去追一只松鼠,然后伤到一堆人。你总不能说,天哪这个狗加除草机系统——它失控叛变了。

Cal Newport23:34

数字与实体

Stanford HAI 评测的 LLM 幻觉率范围26–94%7:14
Hugging Face 攻击所用的 Exploit Gym 基准包含黑客挑战数600 多个5:09
OpenAI 黑客 agent 无监督运行的时长数天39:51
Ed 在实验中发现 AI agent 一次增删代码行数63 行47:02

术语

ask-act-report loop询问-行动-报告循环
控制程序反复向 LLM 询问下一步并执行其建议的循环架构。
plausible not normative看似合理但不遵循规范
LLM 输出追求大致通顺而非符合事实与规范,因此不可盲信。
harness控制程序
由人编写的程序,负责向 LLM 发 prompt、执行输出并汇报结果。
Exploit Gym漏洞利用基准测试
由 600 多个黑客挑战组成的基准,测 agent 能否自主攻破服务器拿到文件。

收听指南

谁该听

关注 AI 安全叙事但怀疑「模型觉醒」报道的工程师;以及需要向老板和投资人解释「Agent 到底能做什么」的 AI 产品和技术负责人。

可跳过

开场寒暄(前 1 分钟)和结尾 Ed 修 Minecraft 的插曲(45:00-51:00)可跳过。