世界太吵,来原声听播客

The Pragmatic Engineer

AI 写代码不必逐行读,但信任必须重建

2025 的 AI 相当于云的 2010;真正的问题不是是否要读 AI 写的代码,而是何时不读,以及怎样用测试、eval 和 on-call 成本把信任重建回来。

AI 编程代码审查可观测性平台工程技术领导力AI 疲惫
这集把「AI 让代码变 slop」和「AI 是巨大胜利」两边都讲了,还给出可操作的验证纪律和实验式应对疲惫,适合想吵赢/想落地的人。

核心论点 · 点时间戳可跳到原声

10:13

2025 等于云计算 2010

Charity 说 2025 对 AI 相当于 2010 对云。她一开始把 AI 当成「比编程语言更大的 feature」,而不是代际性改变;真正的转折发生在 Opus 4.5 之前,改变的是 harness 和工具链,不是模型本身。她承认第一次怀疑是对的,第二次怀疑错了。因此「是否要读 AI 写的代码」不值得再争,真正的问题是「何时」以及需要什么条件——这一天来不来不再是问题,问题是什么时候来。

— Charity
14:16

重写便宜,替换优于修复

基础设施领域早就有「从不修复运行中的东西,替换它」的原则,AI 把它推进到了应用代码层。当重写变便宜,原地编辑会积累熵,替换则清零。Charity 说生成 10,000 个函数变体比手写一个更快,行业会被成本推向「生成+验证」,而不是手工修改。这解释了为什么 AI 工作流里「删掉重来」会变成默认动作,也意味着工程师的核心技能从写代码转向判断和验证。

— Charity
26:44

非确定性逼出更严纪律

不逐个读代码,就必须用测试和 eval 重建信任。她点名 conformance testing,确认性能边界没有漂移。确定性系统不会消失,AI 必须被「驯化」到可预测的通道里。她举 HackerRank 的 ATS 为例:同一份简历本地跑 100 次,得分在 66 到 99 之间浮动,这说明「AI 不是所有场景的正确工具」。这一条把「AI 不可靠所以要更小心」从口号变成了具体的工程约束。

— Charity
34:11

沟通规范:不发送未读内容

底线是不能把没读过的内容发给别人。如果对方读完所需时间比你自己生成它的时间还长,那很可能就是 slop。任何发送都是在索取对方的时间和注意力。AI 应被用于更深入的思考,而不是逃避思考;但对非英语母语者和神经多样性人群,使用 AI 反而可能是尊重。不需要发明新的质量和尊重标准,已有标准够用,去应用即可。这给「什么算 AI 垃圾」一个可操作的判断:发送前问自己读没读过。

— Charity
40:23

Meta 事故与 Intercom 的账

Charity 提到 Meta 内部追踪 SEV zero(最高严重级别事故),过去约两个月出现一连串,发生在 Instagram 和 WhatsApp,而这两个部门的信任与安全/可靠性团队刚被移除。她说无法否认关联,虽然只是间接证据。同时她称赞 Intercom 发布真实数据:18 个月可靠性和代码质量持续下降,最近才可能开始回升。乐观派只看到重写和自动化 toil 的胜利,on-call 的人只看到系统变差。她的请求是:讲完整故事,把成本说出来。

— Charity Majors
44:34

软件是 AI 的杀手级应用

为什么软件是 AI 的杀手级应用?因为软件由逻辑和语言构成,AI 也由逻辑和语言构成,因此能内置 guardrails、checks、validation,这是其他领域做不到的。她拿法院起诉提交幻觉 brief 的律师做对比——没有结构化数据,无法验证。她还认为,软件行业里 AI 做不成的,其他行业大概率也做不成,因为这里有可编译代码这种优秀训练数据。这句话直接把「AI 先吃软件行业」从悲观叙事翻成乐观信号。

— Charity Majors
50:44

DevOps 二十年没建成反馈回路

DevOps 运动 20 年的核心目标是建立反馈回路,把写代码的人和代码在生产中的表现连接起来,但这个目标失败了,至今仍是两个领域。平台团队管理基础设施,工程师部署到上面,没有回路。不过她认为这种分离是健康的关注点分离——你该负责的是部署代码的稳定性,还是代码带来用户体验?Anthropic 内部也有平台团队和 Applied AI 团队,两边对「工程师是否会被淘汰」的看法都不一样。

— Charity Majors
1:19:36

用主动实验夺回控制权

对抗 AI 疲惫的办法是「主动实验」:和团队约定不写 AI 生成的 PR 描述、周三不用 AI,先做再汇报。多数领导会欢迎团队提出尝试;更好的做法是做完后告诉领导什么有效、什么无效、学到了什么。不要等自上而下的许可,因为领导也不知道该批准什么;自下而上的行动才能真正夺回时间和日历的控制权。这一条把焦虑转化为具体动作,也是全集的落点:在不确定性里靠行动获得 agency。

— Charity

原话 · 已逐字校验

When rewriting is cheap, editing in place becomes risky. Mutation accumulates entropy. Replacements resets it.

当重写很便宜时,原地编辑就变得危险。变异会积累熵,替换会重置熵。

Charity13:16

You cannot send anyone something you haven't read.

你不能把没读过的东西发给任何人。

Charity34:11

Software is made of logic and language. AI is made of logic and language.

软件由逻辑和语言构成。AI 也由逻辑和语言构成。

Charity Majors44:34

The most effective leaders are kind, caring humans and skilled business operators. The second most effective leaders are terrible humans and skilled business operators.

最有效的领导者是善良、关心他人且业务娴熟的经营者。次有效的领导者是糟糕但业务娴熟的经营者。

If we don't do it ourselves, someone will come and do it to us.

如果我们自己不这样做,就会有人来对我们这样做。

And he's like, it's just doom trolling and they shouldn't, they need to stop it because they're stressing everyone the fuck out.

他说,这只是末日钓鱼(doom trolling),他们不该这样做,必须停止,因为这把所有人都吓得命都快没了。

Charity1:18:31

You have to decide what matters.

你必须自己决定什么重要。

Charity1:22:39

the heat death of the universe, you guys. Literally the only thing we know about exponential growth is that it must end.

宇宙热寂,各位。关于指数增长,我们唯一真正知道的就是它必定终结。

Charity1:23:40

数字与实体

Spotify deployment frequency4,500 changes per day or per week (speaker unsure)7:11
HackerRank ATS score spread同一份简历 100 次运行得分在 66 到 99 之间29:03
Intercom 可靠性和代码质量下降时长18 个月41:23
X 核心工程师人数(当前 vs 此前)60 人 vs 1,700 人1:08:14
《Observability Engineering》第二版页数(第一版)600 页(250 页)1:03:10

术语

harness工具链/脚手架
模型之外负责调用、校验和结果组装的机制。
conformance testing一致性测试
验证系统输出仍符合既定性能边界的测试。
slopAI 废料
发送者自己都不读的低质量 AI 生成内容。
SEV zero最高严重级别事故
影响用户或收入的服务中断等级。
doom trolling末日钓鱼
用末日预言反复刺激他人情绪的行为。

收听指南

谁该听

大模型辅助写代码的工程师、要给 AI 代码兜底的 on-call,以及被团队间效率/质量之争夹住的技术管理者。

可跳过

开头介绍 Parse 公司的几分钟可跳过,从 10:13 起进入正题。