世界太吵,来原声听播客

硅谷101

评测公司最大的红线:不能把自己出的题拿去卖数据训模型

很多做benchmark的人会被卖数据的诱惑拉下水——但如果卖的数据污染了自己出的评测,毁掉的不只是自己的榜单,还有所有依赖这个榜单的模型。

数据行业AI创业评测基准强化学习Rubric后训练
两位一线从业者拆解了数据标注到RL环境、评分标准(Rubric)再到benchmark生意的完整链条,信息密度高,行业内幕多,值得完整听完。

核心论点 · 点时间戳可跳到原声

1:01

数据公司估值半年翻十倍

三名20多岁年轻人创立的AfterQuery今年4月A轮估值3亿美元,到9月新一轮融资估值涨到32亿美元,创下YC旗下公司从启动到独角兽的最快纪录。同时Scale AI、Mercor这类老牌数据公司估值也已到百亿美元级别,但外界很难看清这些高估值背后到底在卖什么样的数据、为什么模型公司愿意为此付这么多钱。

10:08

Rubric的本质是弱模型监督强模型

允中解释Rubric的核心逻辑叫weak-to-strong supervision:专家先把自己脑子里的判断标准写成打分规则,之后哪怕是能力较弱的模型,只要照着这份规则去改卷子,也能给出跟专家一致的分数。这解决了历史题、法律题这类没有唯一标准答案的领域也想做强化学习时遇到的问题——标答存在,只是不结构化,没法简单做模式匹配。

— 允中
12:08

ALE想把vibe coding的打法推广到一切

一铀解释ALE的初衷:coding领域因为有大量公开、易验证的benchmark,才推动了vibe coding的爆发式发展;ALE想把这套打法复制到其他能客观打分的专业领域,让智能体解决有真实经济价值、结果可验证的长任务。目前公开任务150多个,覆盖50多个细分行业,目标是下一版本直接放出1000多个任务。

— 一铀
22:14

做评测的人不能把自己出的题拿去卖

允中和一铀都强调,做benchmark和卖数据是两件不能混为一谈的事。一铀直言业内确实有数据公司踩过这条红线,把自己做评测用的数据拿去卖给模型公司训练——这样不仅会毁掉自己这个benchmark的权威性,还会连带毁掉所有依赖这个榜单的其他模型的可信度,是绝对不能碰的底线。

— 允中
34:19

数据生意真正难的是采购,不是加工

允中把数商的工作拆成采购和加工两块,认为真正难、真正值钱的是采购——把某个垂直行业的私域数据、商业软件版权甚至游戏源码买回来。他举例说做芯片设计、AWS模拟这类环境都涉及复杂的版权和定制问题,谁能把某个垂类的采购问题解决好,谁就有巨大优势,这也是两三个人的小数据公司还能拿到高估值的原因。

— 允中
38:20

生物医药类benchmark覆盖率不到10%

ALE团队按照Nature的学科分类,把生物学工作流展开到第三级,梳理出大约3000个细分节点,再核对现有生命科学类benchmark覆盖了多少——结果发现覆盖率大概只有10%,甚至不到5%,市面上连一个覆盖面完整的benchmark都没有,说明专业领域的数据缺口远比想象中大。

— 一铀
48:24

SWE-bench Verified被质疑测试缺陷加污染

今年2月OpenAI宣布停止报告SWE-bench Verified的分数,原因有两类:一是测试脚本本身有缺陷,连正确解法都可能被判错;二是模型在特定提示下能复现题目原本的人类修复代码,说明预训练阶段很可能已经接触过相关内容。一铀提到这个benchmark过去6个月分数只从74%涨到80%,剩下部分很可能都集中在这类问题上,ALE因此没有采用它。

50:24

专家造假数据几个月都查不出来

一铀坦言ALE真实发生过专家造假的问题:因为提交项目能换来论文作者署名,有人为了刷这个奖励,直接用agent合成一堆乱七八糟的数据,一眼就能看出是编的。允中说更难发现的是编造得逼真的数据,比如声称做过化学模拟其实根本没跑过,可能要等到模型能力远超任务本身、批量答案彼此吻合却和真实结果不一致时才会暴露,而重新找专家验证的成本极高。

— 一铀

原话 · 已逐字校验

由三名20多岁的年轻人创办的 AfterQuery 今年4月宣布A轮融资的时候 估值还是3亿美元 到了9月 新一轮融资 就已经把它的估值推到了32亿美元

由三名20多岁的年轻人创办的AfterQuery,今年4月宣布A轮融资时估值还是3亿美元,到了9月新一轮融资,估值已经推到了32亿美元。

就我能不能用弱模型来监督强模型 那它这里成立的条件就是说 我有个专家把他脑海里的知识 给写下来了 这样弱的模型拿着它改卷子就行了

就是我能不能用弱模型来监督强模型,成立的条件是有个专家把他脑海里的知识写下来了,这样弱的模型拿着它改卷子就行了。

允中10:08

我们怎么样把 Vibe coding(氛围编程) 迅速发展的这趋势 推广到vibe everything

我们怎么样把Vibe coding迅速发展的这个趋势,推广到vibe everything。

一铀12:08

当然这个是 大家千万不能碰的一条线 不能让你做的生意 污染你这个benchmark的权威性 不然的话 你不仅毁了你的benchmark 也毁了其他人的模型

这是大家千万不能碰的一条线,不能让你做的生意污染你这个benchmark的权威性,不然你不仅毁了自己的benchmark,也毁了其他人的模型。

允中22:14

就甚至代码领域 其实采购一些私域的代码仓库 谁能把这个问题解决好 其实就是一个巨大的优势

甚至代码领域,采购一些私域的代码仓库,谁能把这个问题解决好,就是一个巨大的优势。

允中34:19

它要价能要到两三百万人民币一条 我觉得哪家数据公司 或者别人做benchmark 都没有这个财力去做这个事情

它要价能要到两三百万人民币一条,我觉得哪家数据公司或者别人做benchmark,都没有这个财力去做这个事情。

一铀36:20

在特定提示下面 模型能够复现部分题目原本的 人类修复代码 也就是说 模型很可能在训练过程当中 就已经接触过相关内容了

在特定提示下,模型能够复现部分题目原本的人类修复代码,也就是说模型很可能在训练过程中就已经接触过相关内容了。

他甚至起了agent 去合成一堆乱七八糟的数据 甚至有些数据交上来 我就肉眼看出来他就是编的

他甚至起了agent去合成一堆乱七八糟的数据,甚至有些数据交上来,我肉眼就能看出来他是编的。

一铀50:24

数字与实体

AfterQuery A轮估值3亿美元1:01
AfterQuery 9月新一轮估值32亿美元1:01
Meta入股Scale AI估值超过290亿美元1:01
Mercor最新一轮估值100亿美元2:02
ALE当前公开任务数150多个,覆盖50多个细分行业4:06
ALE下一版本任务目标1000多个4:06
某小众游戏源码要价两三百万人民币一条36:20
SWE-bench Verified过去6个月分数变化从74%涨到80%48:24
ALE V2生命科学类benchmark覆盖率约10%,甚至不到5%38:20
Mercor制造业工程师时薪一两百美元一小时56:27

术语

Rubric评分细则
专家写下的评分标准,让弱模型也能按规则给强模型的输出打分
RL environment强化学习环境
配好任务、工具和反馈机制,让AI在其中动手操作并根据结果学习
Weak-to-strong supervision弱模型监督强模型
专家把判断标准写成规则后,弱模型也能据此评判强模型的输出
Reward hacking奖励作弊
模型没真正完成任务,却找到漏洞把分数刷高
Bench-maxxing刷榜
针对性优化某个评测榜单的分数,不一定等于真实能力提升
RSI递归自我改进
指AI自己研发自己、迭代自身能力的长程训练任务

收听指南

谁该听

想了解AI数据标注、评测和后训练供应链生意的创业者、投资人,以及关注模型训练数据来源和验证机制的工程师。

可跳过

开场关于线下活动和黑客松的介绍可以跳过,不影响后面正文内容。