沒有Claude Code,Opus 4.5不會有那波爆發
Anthropic產品負責人復盤:模型再強也要靠Claude Code這樣的產品載體才能被用戶感知到,而PM的核心工作也從寫PRD變成了寫eval——「eval是新的PRD」。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
金門大橋克勞德的24小時
Anthropic早期只有5名產品工程師,整個API業務只有1名工程師。團隊還在摸索身份——2024年初一篇早期可解釋性研究發現,把模型內表示「金門大橋」的特徵強行調高後,Claude會在任何回答裡都扯到金門大橋(問意大利麵菜譜也會提到橋的顏色)。團隊在24小時內把這個怪癖直接做成產品上線Claude.ai,雖然只觸達了約2000人,但讓團隊第一次感覺到:他們能做出和OpenAI不一樣、真正帶有研究氣質的產品體驗。
— Dianne PennOpus 3訓練期建立的信任
Opus 3的訓練衝刺發生在公司不到200人的階段,當時反覆被問的問題是「為什麼該選Claude」。研發和產品團隊跨部門連續幾個月在12月冬歇期居家協作,這段共同扛壓的經歷建立起的信任,後來直接延續成了如今負責強化學習、性格與對齊工作的幾位研究負責人和產品團隊的合作基礎。
— Dianne Penn模型和產品互為前提
Opus 4.5被視為又一個轉折點,但Dianne強調這不只是模型的勝利:沒有Claude Code這樣的產品載體,用戶根本感受不到模型智能的躍升;反過來Claude Code此前已經磨合了數月,但真正的爆發式採用要等模型智能達到能端到端自主完成任務的門檻才發生。模型和產品缺一個,另一個都不會有那個「時刻」。
— Dianne Penntoken maxing不是目的,實驗才是
針對「願意花10萬美元/年買token就是提前活在2028年」的說法,Dianne把「花token」重新定義為輸入,真正的產出是實驗本身。她提到早期Anthropic內部有一個幾乎全公司都在用的Slack頻道,大家公開分享自己怎麼用Claude(改文章、寫郵件),別人會接著在這個想法上試,往往十幾次嘗試後就冒出真正有價值的用法——實驗不是一個人的運動,是集體發現的過程。
— Dianne Penn模型越強,護欄也要跟著進化
Fable/Mythos模型上線時因能力太強被大範圍限制、審查,各家公司要先確認它不會威脅自身系統安全。Dianne認為這意味著前沿模型的安全護欄和發布前測試必須隨能力同步進化——比如新增了fallback系統,保證用戶即使觸發限制也能立刻拿到Opus 4.5級別的可用回答。Lenny提出一個未被充分討論的副作用:這類限制客觀上讓掌握最新模型的實驗室獲得了外部拿不到的能力優勢;Dianne回應稱目標是儘量做到普惠而非製造這種落差。
eval取代PRD的具體操作
Dianne團隊的口號是「eval是新的PRD」:當用戶反饋「Claude又胡編了」,這種描述沒法直接交給研究員行動。團隊要追問到具體是哪句話、模型該調用什麼工具卻沒調用、還是引用了正確文檔卻讀錯了事實。早期一個例子是用戶抱怨Claude「不聽指令」,深挖後發現約80%的情況其實是模型輸出不了正確的JSON格式——把這類失敗整理成30到40個樣例就成了一個可複用的eval集,此後每個新模型都跑一遍這個測試。
— Dianne Penn管理者也必須親自動手
Dianne認為不論職級多高,產品負責人都必須親自動手、持續用模型交付東西,而不能只靠管理經驗判斷產品好壞。她給資深PM設計的入職計劃和初級PM完全一樣,都要讀用戶原始反饋、親自和客戶對話;她自己也始終保留一到兩條工作線親自跟進模型迭代,以保持對模型能力邊界的判斷力。
— Dianne Penn發布節奏爆炸下如何不崩
Anthropic在2024全年總共發布了4個系列模型,而2025年僅第二季度的發布量就超過了2024全年。支撐這種節奏的不是個人英雄主義,而是團隊內部所謂的「hive mind」:發布前夜哪怕不是負責人,其他人也會主動幫忙改博客文章、想demo;休假回來不會積壓三倍工作,因為團隊本身知道該做什麼。這被她視為避免長期高壓下崩潰的核心機制。
— Dianne Penn原話 · 已逐字校驗
if you're willing to spend $100,000 a year right now in tokens, you are living the way somebody in 2028 is going to live.
如果你現在願意每年在token上花10萬美元,你就是提前活在2028年人們會過的生活方式裡。
Lenny20:03
The thesis of labs in many ways is identifying and pulling the thread on the thread of discontinuous large bets that might not be in the core roadmap.
Labs的核心命題很大程度上是找到並順著那些可能不在核心路線圖裡的、非連續性的大賭注這條線往下拉。
Dianne Penn23:15
we actually have a saying on the team of evals are the new PRDs, right?
我們團隊內部有個說法,eval就是新的PRD。
Dianne Penn41:15
Here, you have to sweat the tokens as much as you sweat the pixels.
現在,你得像摳像素一樣摳token。
Dianne Penn42:19
And what I saw was something like 80% of what people meant in the early days for this failure was Claude would not write the right JSON.
我發現的是,早期大概80%用戶所說的這種失敗,其實是Claude沒能寫出正確的JSON。
Dianne Penn45:35
So I think there is a, I do feel pretty strongly that like, you know, if you're a manager, you have to be hands-on, you have to spend a portion of your time actually shipping.
所以我確實很堅定地認為——如果你是管理者,你必須親自動手,必須拿出一部分時間真正去交付產品。
Dianne Penn52:09
what you don't want is, like, an AI that just agrees with you, right?
你不想要的,是一個只會附和你的AI,對吧?
Dianne Penn1:03:34
no matter how far you go, there's always another level.
無論你走了多遠,永遠還有更高的一層。
Dianne Penn1:27:37
數字與實體
| Anthropic年化收入(Lenny轉述,未經證實) | 約500億美元 | 3:03 |
| Golden Gate Claude觸達用戶數 | 約2000人 | 6:09 |
| Opus 3訓練期公司規模 | 不到200人 | 9:10 |
| 早期產品工程師人數 | 5人(另有1人負責整個API業務) | 4:04 |
| 「不遵循指令」反饋中實為JSON格式問題的佔比 | 約80% | 45:35 |
| 2024年全年發布模型系列數 | 4個系列 | 1:16:55 |
術語
- token maxingtoken maxing
- 大量、高頻用AI token做實驗,提前體驗未來更廉價算力下的工作方式
- jagged edge參差邊緣
- 模型能力參差不齊,某些任務已超人類、某些仍很弱的現象
- evals評測集
- 用具體樣例衡量模型在某類失敗場景下表現的測試集,PM用它替代PRD描述需求
- DRI直接責任人
- Directly Responsible Individual,某個項目或發布的直接責任人
- red teaming紅隊測試
- 發布前主動嘗試攻破模型安全防線的測試方法
- hive mind蜂群思維
- 團隊成員深度共享上下文、如同一個大腦協作的工作狀態
收聽指南
在AI公司做產品、想理解eval如何取代PRD、或好奇前沿實驗室內部研究和labs孵化機制的產品經理與工程師。
0:00開場寒暄,以及8:10、38:04兩處WorkOS、Mercury廣告插播可以跳過。