世界太吵,来原声听播客

Lenny's Podcast

没有Claude Code,Opus 4.5不会有那波爆发

Anthropic产品负责人复盘:模型再强也要靠Claude Code这样的产品载体才能被用户感知到,而PM的核心工作也从写PRD变成了写eval——「eval是新的PRD」。

产品管理AI研究组织EvalsAnthropic文化前沿模型安全token经济
信息密度集中在中段:Opus3/4.5的内部转折、eval如何取代PRD、labs怎么孵化大赌注,都是外部很少听到的一手细节;开场寒暄和两段广告可以跳过。

核心论点 · 点时间戳可跳到原声

5:06

金门大桥克劳德的24小时

Anthropic早期只有5名产品工程师,整个API业务只有1名工程师。团队还在摸索身份——2024年初一篇早期可解释性研究发现,把模型内表示「金门大桥」的特征强行调高后,Claude会在任何回答里都扯到金门大桥(问意大利面菜谱也会提到桥的颜色)。团队在24小时内把这个怪癖直接做成产品上线Claude.ai,虽然只触达了约2000人,但让团队第一次感觉到:他们能做出和OpenAI不一样、真正带有研究气质的产品体验。

— Dianne Penn
10:15

Opus 3训练期建立的信任

Opus 3的训练冲刺发生在公司不到200人的阶段,当时反复被问的问题是「为什么该选Claude」。研发和产品团队跨部门连续几个月在12月冬歇期居家协作,这段共同扛压的经历建立起的信任,后来直接延续成了如今负责强化学习、性格与对齐工作的几位研究负责人和产品团队的合作基础。

— Dianne Penn
13:33

模型和产品互为前提

Opus 4.5被视为又一个转折点,但Dianne强调这不只是模型的胜利:没有Claude Code这样的产品载体,用户根本感受不到模型智能的跃升;反过来Claude Code此前已经磨合了数月,但真正的爆发式采用要等模型智能达到能端到端自主完成任务的门槛才发生。模型和产品缺一个,另一个都不会有那个「时刻」。

— Dianne Penn
20:03

token maxing不是目的,实验才是

针对「愿意花10万美元/年买token就是提前活在2028年」的说法,Dianne把「花token」重新定义为输入,真正的产出是实验本身。她提到早期Anthropic内部有一个几乎全公司都在用的Slack频道,大家公开分享自己怎么用Claude(改文章、写邮件),别人会接着在这个想法上试,往往十几次尝试后就冒出真正有价值的用法——实验不是一个人的运动,是集体发现的过程。

— Dianne Penn
35:58

模型越强,护栏也要跟着进化

Fable/Mythos模型上线时因能力太强被大范围限制、审查,各家公司要先确认它不会威胁自身系统安全。Dianne认为这意味着前沿模型的安全护栏和发布前测试必须随能力同步进化——比如新增了fallback系统,保证用户即使触发限制也能立刻拿到Opus 4.5级别的可用回答。Lenny提出一个未被充分讨论的副作用:这类限制客观上让掌握最新模型的实验室获得了外部拿不到的能力优势;Dianne回应称目标是尽量做到普惠而非制造这种落差。

45:35

eval取代PRD的具体操作

Dianne团队的口号是「eval是新的PRD」:当用户反馈「Claude又胡编了」,这种描述没法直接交给研究员行动。团队要追问到具体是哪句话、模型该调用什么工具却没调用、还是引用了正确文档却读错了事实。早期一个例子是用户抱怨Claude「不听指令」,深挖后发现约80%的情况其实是模型输出不了正确的JSON格式——把这类失败整理成30到40个样例就成了一个可复用的eval集,此后每个新模型都跑一遍这个测试。

— Dianne Penn
52:09

管理者也必须亲自动手

Dianne认为不论职级多高,产品负责人都必须亲自动手、持续用模型交付东西,而不能只靠管理经验判断产品好坏。她给资深PM设计的入职计划和初级PM完全一样,都要读用户原始反馈、亲自和客户对话;她自己也始终保留一到两条工作线亲自跟进模型迭代,以保持对模型能力边界的判断力。

— Dianne Penn
1:16:55

发布节奏爆炸下如何不崩

Anthropic在2024全年总共发布了4个系列模型,而2025年仅第二季度的发布量就超过了2024全年。支撑这种节奏的不是个人英雄主义,而是团队内部所谓的「hive mind」:发布前夜哪怕不是负责人,其他人也会主动帮忙改博客文章、想demo;休假回来不会积压三倍工作,因为团队本身知道该做什么。这被她视为避免长期高压下崩溃的核心机制。

— Dianne Penn

原话 · 已逐字校验

if you're willing to spend $100,000 a year right now in tokens, you are living the way somebody in 2028 is going to live.

如果你现在愿意每年在token上花10万美元,你就是提前活在2028年人们会过的生活方式里。

Lenny20:03

The thesis of labs in many ways is identifying and pulling the thread on the thread of discontinuous large bets that might not be in the core roadmap.

Labs的核心命题很大程度上是找到并顺着那些可能不在核心路线图里的、非连续性的大赌注这条线往下拉。

Dianne Penn23:15

we actually have a saying on the team of evals are the new PRDs, right?

我们团队内部有个说法,eval就是新的PRD。

Dianne Penn41:15

Here, you have to sweat the tokens as much as you sweat the pixels.

现在,你得像抠像素一样抠token。

Dianne Penn42:19

And what I saw was something like 80% of what people meant in the early days for this failure was Claude would not write the right JSON.

我发现的是,早期大概80%用户所说的这种失败,其实是Claude没能写出正确的JSON。

Dianne Penn45:35

So I think there is a, I do feel pretty strongly that like, you know, if you're a manager, you have to be hands-on, you have to spend a portion of your time actually shipping.

所以我确实很坚定地认为——如果你是管理者,你必须亲自动手,必须拿出一部分时间真正去交付产品。

Dianne Penn52:09

what you don't want is, like, an AI that just agrees with you, right?

你不想要的,是一个只会附和你的AI,对吧?

Dianne Penn1:03:34

no matter how far you go, there's always another level.

无论你走了多远,永远还有更高的一层。

Dianne Penn1:27:37

数字与实体

Anthropic年化收入(Lenny转述,未经证实)约500亿美元3:03
Golden Gate Claude触达用户数约2000人6:09
Opus 3训练期公司规模不到200人9:10
早期产品工程师人数5人(另有1人负责整个API业务)4:04
「不遵循指令」反馈中实为JSON格式问题的占比约80%45:35
2024年全年发布模型系列数4个系列1:16:55

术语

token maxingtoken maxing
大量、高频用AI token做实验,提前体验未来更廉价算力下的工作方式
jagged edge参差边缘
模型能力参差不齐,某些任务已超人类、某些仍很弱的现象
evals评测集
用具体样例衡量模型在某类失败场景下表现的测试集,PM用它替代PRD描述需求
DRI直接责任人
Directly Responsible Individual,某个项目或发布的直接责任人
red teaming红队测试
发布前主动尝试攻破模型安全防线的测试方法
hive mind蜂群思维
团队成员深度共享上下文、如同一个大脑协作的工作状态

收听指南

谁该听

在AI公司做产品、想理解eval如何取代PRD、或好奇前沿实验室内部研究和labs孵化机制的产品经理与工程师。

可跳过

0:00开场寒暄,以及8:10、38:04两处WorkOS、Mercury广告插播可以跳过。