世界太吵,来原声听播客

a16z

公开榜单测不出模型真实能力,第三方评测才是刚需

Llama 4 在公开榜单上表现惊人,在 Vals 的私有留出集上却是不达标——自报成绩和真实能力之间的裂缝,正在催生一个独立的评测行业。

AI评测基准测试企业AIAI政策token成本

原视频在 YouTube 上放不出来,用音频听:

信息密度中等,前半段讲评测方法论,后半段关于企业 token 支出与政策分工的部分更值钱。

核心论点 · 点时间戳可跳到原声

3:03

Llama 4 暴露了自报成绩的裂缝

Rayan 给出的具体案例:Meta 发布 Llama 4 时,在 Vals 的私有留出基准上模型实际是不达标的,但在所有主要公开基准上——因为题目和评分标准都是开源的——它展现出惊人的能力。这个落差说明实验室自报的能力和第三方高质量、高信噪比基准测出来的东西之间存在巨大脱节。Rayan 认为实验室自己也明白这一点,他们想要的是一个理性的买方市场:当投入数十亿美元训练新模型时,需要有实质性的证据指向进步,而不是完全靠自己说了算。

— Rayan Krishnan
8:07

评测机构不能同时卖训练数据

Vals 早期做的一个关键决定是永不向实验室出售训练数据。Rayan 说这是他们经常被推的方向——和新实验室合作时对方会提出采购训练数据,这是门赚钱的生意,行业里很多公司已经靠做噱头式基准来卖数据,这成了它们的 go-to-market。他用审计行业类比:如果做审计的同一批人还在给公司做咨询,激励结构就混了,最后变成付费通过审计,在 AI 这里就是付费赢得榜单。Ben 补充说这有点像 MPAA 分级——什么是艺术、什么是色情,界线在哪,定义本身会随时间变化,最终靠的是行业里足够多的人形成共识,而不是「解出这道题你就到这个等级」这种又窄又容易被攻破的规则。

— Rayan Krishnan
14:23

评测正从百万样本走向少量任务

Rayan 描述了一个结构性转变:评测越复杂,样本量越小,但对输出的评判标准越多。早期像 ImageNet 是几百万张图片做基础分类,输入和输出是一对一映射;现在可能是「给我生成 50 个全栈 web 应用」这样数量少得多的任务,但评估产出的机制复杂得多。基础设施层面也随之变化——现在要测模型跑几小时、几天甚至几周的能力,基础设施必须足够稳定,某个请求失败了要能从那个点重试,而不是把整条轨迹重跑一遍。他认为这个趋势会随着更复杂的工作被纳入评测而持续。

— Rayan Krishnan
16:24

token 支出可能超过工资支出

Rayan 讲了一个 Fortune 10 公司的案例:他们给工程师每天约 100 美元的 Claude Code 预算,结果因为额度在下午 4 点重置,最高效的工作时段变成了 4 点到 6 点,下午则出现一段死区,人们去散步喝咖啡。这家公司最近把额度提到了每人 300 美元——几乎相当于一个员工的工资变成了 token。Rayan 的判断是:每一层都在发生对智能的错误定价,工程师不知道怎么把这 100 美元分配到最大生产力上,公司定额度也很随意,而 Anthropic 是在很薄的利润上支撑这一切。当 token 支出开始超过工资支出,企业就必须比过去六个月更认真地论证 ROI。

— Rayan Krishnan
20:30

最贵的模型不一定是最贵的账单

Rayan 指出,今天仍然很难说最好的 OpenAI 模型或最好的 Anthropic 模型就一定最适合你的代码库,很多非直觉的案例必须跑评测才知道。中间层选项变得非常复杂:Anthropic 有 Opus 和 Sonnet,还有 Luna 和 Terra,Luna 在成本上很有竞争力,MewSpark 也很便宜,1.2 能力很强,还有不断增长的开源模型可以自托管。他给了一个具体反例:很多情况下 Sonnet 比 Opus 更贵,因为它太吃 token,如果按「感觉适用就用」的方式操作,可能反而花得更多。

— Rayan Krishnan
22:35

一个月烧掉 15 万美元 token 的实验

ValSmith 这个产品来自 Vals 自己踩的坑。Rayan 做了一次 token maxing 实验,给团队拿到某些编码工具一个月的无限访问权限,事后回看,他们每天消耗 10 亿到 20 亿 token,峰值一天有一个工程师烧掉 60 亿。他算了一下,那个月大约花掉了价值 150 万美元的 token——是免费的,但实际是员工工资的 10 倍,不是五五开。于是他们翻 trace、翻 GitHub repo,做出 ValSmith,发现了一些反直觉的结论:Cognition 的 Devon 工具其实非常省 token,所以被更多采用;有些场景订阅制定价比按 token 计价更划算。这套方法后来变成了他们的运营策略。

— Rayan Krishnan
28:53

政府定规则,第三方判断规则有没有被破

Ben 把政策分工讲得很清楚:政府从大实验室那里收到大量警告——这东西会用于生物黑客、会是网络安全风险——所以政府需要做的是先明确自己害怕什么,然后问两个问题:模型有没有这个能力,以及能不能让人把模型引导去做这件事。Ben 认为政府特别不适合做后一项评估,尤其随着时间推移,这不是一个好的政府职能;但政府很擅长制定规则,因为它能执行规则。所以理想的组合是政府制定并执行规则,由有能力的私营公司来告诉它规则有没有被打破。他还提到一个现象:大实验室开始说模型有这个能力、也能被引导做坏事,所以我们不让任何人用,只自己用并确保自己人不去引导它做坏事——而即便这样也不总是奏效。

— Ben Horowitz
34:09

核军控的「信任但核查」是 AI 的模板

Rayan 说从理想主义视角看,他对主权 AI 上的巨额投入感到意外——上帝视角下,建这么多数据中心、复制数据工程流程、训练这些超大模型是极其低效的,本可以整合。但现实是各国在加大主权 AI 建设,这就需要一个共享语言来沟通评估框架和风险对齐。他引用里根的话「trust but verify」,指出习近平和特朗普下个月将会面,信任的迹象出现了,但核查这一半没有明确办法。核军控里核查靠的是飞越侦察,让一国可以审计另一国的核库存;AI 如果存在社会性或生存性风险,同样需要构建评估的共享语言来完成核查。

— Rayan Krishnan

原话 · 已逐字校验

what we saw is that on our held-out private benchmarks, the model is actually underperforming. But on all of the major public benchmarks where the questions and rubrics are actually open source, it was showing incredible capability.

我们看到的是,在我们的私有留出基准上,这个模型实际上是不达标的。但在所有主要公开基准上——那些题目和评分标准都是开源的——它展现出惊人的能力。

Rayan Krishnan3:03

if you have the same group who's responsible for doing the audit, as well as also consulting and supporting the company, you have a mixed incentive structure. And then it just becomes pay to pass the audit, or in this case, pay to win the benchmark.

如果负责做审计的是同一批人,同时又在给这家公司做咨询和支持,你就有了一个混合的激励结构。然后它就变成了付费通过审计,或者在这个场景里,付费赢得榜单。

Rayan Krishnan8:07

there is a rate limit which resets at 4 p.m. And so the most productive hours of work are actually now 4 to 6 p.m. when the rate limits reset. But then there's this dead period in the afternoon when people go on walks or, you know, get a coffee because they just don't have the rate limits.

有一个下午 4 点重置的速率限制。所以现在最高效的工作时段实际上是 4 点到 6 点,速率限制重置的时候。但下午就出现了一段死区,人们去散步,或者去喝杯咖啡,因为他们就是没有额度了。

Rayan Krishnan16:24

it was actually 10 10x more we were spending in tokens than employee salary for that month. So it's not even like, oh, this is 50-50, it's 10x.

那个月我们在 token 上的花费实际上是员工工资的 10 倍。所以根本不是「哦,这是五五开」,是 10 倍。

Rayan Krishnan22:35

the government sets and enforces the rules, and that a very competent kind of private company then tells them if the rule is broken.

政府制定并执行规则,然后由一家非常有能力的私营公司来告诉它规则有没有被打破。

Ben Horowitz29:59

I think Reagan had this line, trust but verify. And so I think we're starting to see signs of trust in that Xi Jinping and Trump are going to be meeting next month. But there is no clear way to actually do the verification part of this.

里根有一句话,信任但核查。我们开始看到信任的迹象——习近平和特朗普下个月将会面。但核查这一半,实际上没有明确的办法。

Rayan Krishnan34:09

数字与实体

Vals 私有留出基准上 Llama 4 的表现不达标(underperforming)3:03
Fortune 10 公司给工程师的 Claude Code 日预算约 100 美元,后提高到 300 美元16:24
Vals 实验一个月的 token 价值约 150 万美元22:35
该月 token 支出与员工工资之比10 倍22:35

术语

held-out private benchmarks私有留出基准
不公开题目和评分标准的评测集,防止模型针对性刷分。
recursive self-improvement (RSI)递归自我改进
模型参与训练下一代模型,形成能力自我复利的过程。
reward hacking奖励黑客
模型绕过评测目标、用取巧方式拿高分的行为。
token maxingtoken 拉满
不计成本地把 token 用量推到极限,以换取最大产出。
harness运行框架
包裹模型、负责工具调用与任务编排的外层系统。

收听指南

谁该听

正在为企业选型 AI 模型和编码 agent 的工程负责人、需要向董事会论证 AI 投入 ROI 的 CTO,以及关注 AI 政策与评测标准的从业者。

可跳过

开头 0:00-2:03 的引子与介绍可跳过。