世界太吵,來原聲聽播客

The Pragmatic Engineer

AI 寫代碼不必逐行讀,但信任必須重建

2025 的 AI 相當於雲的 2010;真正的問題不是是否要讀 AI 寫的代碼,而是何時不讀,以及怎樣用測試、eval 和 on-call 成本把信任重建回來。

AI 編程代碼審查可觀測性平臺工程技術領導力AI 疲憊

原視頻在 YouTube 上放不出來,用音頻聽:

這集把「AI 讓代碼變 slop」和「AI 是巨大勝利」兩邊都講了,還給出可操作的驗證紀律和實驗式應對疲憊,適合想吵贏/想落地的人。

核心論點 · 點時間戳可跳到原聲

10:13

該不該讀 AI 寫的代碼已經不值得爭

Charity 說 2025 對 AI 相當於 2010 對雲。她一開始把 AI 當成「比編程語言更大的 feature」,而不是代際性改變;真正的轉折發生在 Opus 4.5 之前,改變的是 harness 和工具鏈,不是模型本身。她承認第一次懷疑是對的,第二次懷疑錯了。因此「是否要讀 AI 寫的代碼」不值得再爭,真正的問題是「何時」以及需要什麼條件——這一天來不來不再是問題,問題是什麼時候來。

— Charity
14:16

重寫變便宜後,原地修改只是在積累熵

基礎設施領域早就有「從不修復運行中的東西,替換它」的原則,AI 把它推進到了應用代碼層。當重寫變便宜,原地編輯會積累熵,替換則清零。Charity 說生成 10,000 個函數變體比手寫一個更快,行業會被成本推向「生成+驗證」,而不是手工修改。這解釋了為什麼 AI 工作流裡「刪掉重來」會變成默認動作,也意味著工程師的核心技能從寫代碼轉向判斷和驗證。

— Charity
26:44

不逐行讀代碼,就得用 eval 重建信任

不逐個讀代碼,就必須用測試和 eval 重建信任。她點名 conformance testing,確認性能邊界沒有漂移。確定性系統不會消失,AI 必須被「馴化」到可預測的通道里。她舉 HackerRank 的 ATS 為例:同一份簡歷本地跑 100 次,得分在 66 到 99 之間浮動,這說明「AI 不是所有場景的正確工具」。這一條把「AI 不可靠所以要更小心」從口號變成了具體的工程約束。

— Charity
34:11

沒自己讀過的內容就不該發出去

底線是不能把沒讀過的內容發給別人。如果對方讀完所需時間比你自己生成它的時間還長,那很可能就是 slop。任何發送都是在索取對方的時間和注意力。AI 應被用於更深入的思考,而不是逃避思考;但對非英語母語者和神經多樣性人群,使用 AI 反而可能是尊重。不需要發明新的質量和尊重標準,已有標準夠用,去應用即可。這給「什麼算 AI 垃圾」一個可操作的判斷:發送前問自己讀沒讀過。

— Charity
40:23

AI 的勝利敘事漏掉了 on-call 的賬

Charity 提到 Meta 內部追蹤 SEV zero(最高嚴重級別事故),過去約兩個月出現一連串,發生在 Instagram 和 WhatsApp,而這兩個部門的信任與安全/可靠性團隊剛被移除。她說無法否認關聯,雖然只是間接證據。同時她稱讚 Intercom 發布真實數據:18 個月可靠性和代碼質量持續下降,最近才可能開始回升。樂觀派只看到重寫和自動化 toil 的勝利,on-call 的人只看到系統變差。她的請求是:講完整故事,把成本說出來。

— Charity Majors
44:34

AI 拿軟件開刀是樂觀信號,不是壞消息

為什麼軟件是 AI 的殺手級應用?因為軟件由邏輯和語言構成,AI 也由邏輯和語言構成,因此能內置 guardrails、checks、validation,這是其他領域做不到的。她拿法院起訴提交幻覺 brief 的律師做對比——沒有結構化數據,無法驗證。她還認為,軟件行業裡 AI 做不成的,其他行業大概率也做不成,因為這裡有可編譯代碼這種優秀訓練數據。這句話直接把「AI 先吃軟件行業」從悲觀敘事翻成樂觀信號。

— Charity Majors
50:44

DevOps 二十年的核心目標已經失敗

DevOps 運動 20 年的核心目標是建立反饋迴路,把寫代碼的人和代碼在生產中的表現連接起來,但這個目標失敗了,至今仍是兩個領域。平臺團隊管理基礎設施,工程師部署到上面,沒有迴路。不過她認為這種分離是健康的關注點分離——你該負責的是部署代碼的穩定性,還是代碼帶來用戶體驗?Anthropic 內部也有平臺團隊和 Applied AI 團隊,兩邊對「工程師是否會被淘汰」的看法都不一樣。

— Charity Majors
1:19:36

不要等自上而下的許可,先做再彙報

對抗 AI 疲憊的辦法是「主動實驗」:和團隊約定不寫 AI 生成的 PR 描述、週三不用 AI,先做再彙報。多數領導會歡迎團隊提出嘗試;更好的做法是做完後告訴領導什麼有效、什麼無效、學到了什麼。不要等自上而下的許可,因為領導也不知道該批准什麼;自下而上的行動才能真正奪回時間和日曆的控制權。這一條把焦慮轉化為具體動作,也是全集的落點:在不確定性裡靠行動獲得 agency。

— Charity

原話 · 已逐字校驗

When rewriting is cheap, editing in place becomes risky. Mutation accumulates entropy. Replacements resets it.

當重寫很便宜時,原地編輯就變得危險。變異會積累熵,替換會重置熵。

Charity13:16

You cannot send anyone something you haven't read.

你不能把沒讀過的東西發給任何人。

Charity34:11

Software is made of logic and language. AI is made of logic and language.

軟件由邏輯和語言構成。AI 也由邏輯和語言構成。

Charity Majors44:34

The most effective leaders are kind, caring humans and skilled business operators. The second most effective leaders are terrible humans and skilled business operators.

最有效的領導者是善良、關心他人且業務嫻熟的經營者。次有效的領導者是糟糕但業務嫻熟的經營者。

If we don't do it ourselves, someone will come and do it to us.

如果我們自己不這樣做,就會有人來對我們這樣做。

And he's like, it's just doom trolling and they shouldn't, they need to stop it because they're stressing everyone the fuck out.

他說,這只是末日釣魚(doom trolling),他們不該這樣做,必須停止,因為這把所有人都嚇得命都快沒了。

Charity1:18:31

You have to decide what matters.

你必須自己決定什麼重要。

Charity1:22:39

the heat death of the universe, you guys. Literally the only thing we know about exponential growth is that it must end.

宇宙熱寂,各位。關於指數增長,我們唯一真正知道的就是它必定終結。

Charity1:23:40

數字與實體

Spotify deployment frequency4,500 changes per day or per week (speaker unsure)7:11
HackerRank ATS score spread同一份簡歷 100 次運行得分在 66 到 99 之間29:03
Intercom 可靠性和代碼質量下降時長18 個月41:23
X 核心工程師人數(當前 vs 此前)60 人 vs 1,700 人1:08:14
《Observability Engineering》第二版頁數(第一版)600 頁(250 頁)1:03:10

術語

harness工具鏈/腳手架
模型之外負責調用、校驗和結果組裝的機制。
conformance testing一致性測試
驗證系統輸出仍符合既定性能邊界的測試。
slopAI 廢料
發送者自己都不讀的低質量 AI 生成內容。
SEV zero最高嚴重級別事故
影響用戶或收入的服務中斷等級。
doom trolling末日釣魚
用末日預言反覆刺激他人情緒的行為。

收聽指南

誰該聽

大模型輔助寫代碼的工程師、要給 AI 代碼兜底的 on-call,以及被團隊間效率/質量之爭夾住的技術管理者。

可跳過

開頭介紹 Parse 公司的幾分鐘可跳過,從 10:13 起進入正題。