评测公司最大的红线:不能把自己出的题拿去卖数据训模型
很多做benchmark的人会被卖数据的诱惑拉下水——但如果卖的数据污染了自己出的评测,毁掉的不只是自己的榜单,还有所有依赖这个榜单的模型。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
数据公司估值半年翻十倍
三名20多岁年轻人创立的AfterQuery今年4月A轮估值3亿美元,到9月新一轮融资估值涨到32亿美元,创下YC旗下公司从启动到独角兽的最快纪录。同时Scale AI、Mercor这类老牌数据公司估值也已到百亿美元级别,但外界很难看清这些高估值背后到底在卖什么样的数据、为什么模型公司愿意为此付这么多钱。
Rubric的本质是弱模型监督强模型
允中解释Rubric的核心逻辑叫weak-to-strong supervision:专家先把自己脑子里的判断标准写成打分规则,之后哪怕是能力较弱的模型,只要照着这份规则去改卷子,也能给出跟专家一致的分数。这解决了历史题、法律题这类没有唯一标准答案的领域也想做强化学习时遇到的问题——标答存在,只是不结构化,没法简单做模式匹配。
— 允中ALE想把vibe coding的打法推广到一切
一铀解释ALE的初衷:coding领域因为有大量公开、易验证的benchmark,才推动了vibe coding的爆发式发展;ALE想把这套打法复制到其他能客观打分的专业领域,让智能体解决有真实经济价值、结果可验证的长任务。目前公开任务150多个,覆盖50多个细分行业,目标是下一版本直接放出1000多个任务。
— 一铀做评测的人不能把自己出的题拿去卖
允中和一铀都强调,做benchmark和卖数据是两件不能混为一谈的事。一铀直言业内确实有数据公司踩过这条红线,把自己做评测用的数据拿去卖给模型公司训练——这样不仅会毁掉自己这个benchmark的权威性,还会连带毁掉所有依赖这个榜单的其他模型的可信度,是绝对不能碰的底线。
— 允中数据生意真正难的是采购,不是加工
允中把数商的工作拆成采购和加工两块,认为真正难、真正值钱的是采购——把某个垂直行业的私域数据、商业软件版权甚至游戏源码买回来。他举例说做芯片设计、AWS模拟这类环境都涉及复杂的版权和定制问题,谁能把某个垂类的采购问题解决好,谁就有巨大优势,这也是两三个人的小数据公司还能拿到高估值的原因。
— 允中生物医药类benchmark覆盖率不到10%
ALE团队按照Nature的学科分类,把生物学工作流展开到第三级,梳理出大约3000个细分节点,再核对现有生命科学类benchmark覆盖了多少——结果发现覆盖率大概只有10%,甚至不到5%,市面上连一个覆盖面完整的benchmark都没有,说明专业领域的数据缺口远比想象中大。
— 一铀SWE-bench Verified被质疑测试缺陷加污染
今年2月OpenAI宣布停止报告SWE-bench Verified的分数,原因有两类:一是测试脚本本身有缺陷,连正确解法都可能被判错;二是模型在特定提示下能复现题目原本的人类修复代码,说明预训练阶段很可能已经接触过相关内容。一铀提到这个benchmark过去6个月分数只从74%涨到80%,剩下部分很可能都集中在这类问题上,ALE因此没有采用它。
专家造假数据几个月都查不出来
一铀坦言ALE真实发生过专家造假的问题:因为提交项目能换来论文作者署名,有人为了刷这个奖励,直接用agent合成一堆乱七八糟的数据,一眼就能看出是编的。允中说更难发现的是编造得逼真的数据,比如声称做过化学模拟其实根本没跑过,可能要等到模型能力远超任务本身、批量答案彼此吻合却和真实结果不一致时才会暴露,而重新找专家验证的成本极高。
— 一铀原话 · 已逐字校验
由三名20多岁的年轻人创办的 AfterQuery 今年4月宣布A轮融资的时候 估值还是3亿美元 到了9月 新一轮融资 就已经把它的估值推到了32亿美元
由三名20多岁的年轻人创办的AfterQuery,今年4月宣布A轮融资时估值还是3亿美元,到了9月新一轮融资,估值已经推到了32亿美元。
就我能不能用弱模型来监督强模型 那它这里成立的条件就是说 我有个专家把他脑海里的知识 给写下来了 这样弱的模型拿着它改卷子就行了
就是我能不能用弱模型来监督强模型,成立的条件是有个专家把他脑海里的知识写下来了,这样弱的模型拿着它改卷子就行了。
允中10:08
我们怎么样把 Vibe coding(氛围编程) 迅速发展的这趋势 推广到vibe everything
我们怎么样把Vibe coding迅速发展的这个趋势,推广到vibe everything。
一铀12:08
当然这个是 大家千万不能碰的一条线 不能让你做的生意 污染你这个benchmark的权威性 不然的话 你不仅毁了你的benchmark 也毁了其他人的模型
这是大家千万不能碰的一条线,不能让你做的生意污染你这个benchmark的权威性,不然你不仅毁了自己的benchmark,也毁了其他人的模型。
允中22:14
就甚至代码领域 其实采购一些私域的代码仓库 谁能把这个问题解决好 其实就是一个巨大的优势
甚至代码领域,采购一些私域的代码仓库,谁能把这个问题解决好,就是一个巨大的优势。
允中34:19
它要价能要到两三百万人民币一条 我觉得哪家数据公司 或者别人做benchmark 都没有这个财力去做这个事情
它要价能要到两三百万人民币一条,我觉得哪家数据公司或者别人做benchmark,都没有这个财力去做这个事情。
一铀36:20
在特定提示下面 模型能够复现部分题目原本的 人类修复代码 也就是说 模型很可能在训练过程当中 就已经接触过相关内容了
在特定提示下,模型能够复现部分题目原本的人类修复代码,也就是说模型很可能在训练过程中就已经接触过相关内容了。
他甚至起了agent 去合成一堆乱七八糟的数据 甚至有些数据交上来 我就肉眼看出来他就是编的
他甚至起了agent去合成一堆乱七八糟的数据,甚至有些数据交上来,我肉眼就能看出来他是编的。
一铀50:24
数字与实体
| AfterQuery A轮估值 | 3亿美元 | 1:01 |
| AfterQuery 9月新一轮估值 | 32亿美元 | 1:01 |
| Meta入股Scale AI估值 | 超过290亿美元 | 1:01 |
| Mercor最新一轮估值 | 100亿美元 | 2:02 |
| ALE当前公开任务数 | 150多个,覆盖50多个细分行业 | 4:06 |
| ALE下一版本任务目标 | 1000多个 | 4:06 |
| 某小众游戏源码要价 | 两三百万人民币一条 | 36:20 |
| SWE-bench Verified过去6个月分数变化 | 从74%涨到80% | 48:24 |
| ALE V2生命科学类benchmark覆盖率 | 约10%,甚至不到5% | 38:20 |
| Mercor制造业工程师时薪 | 一两百美元一小时 | 56:27 |
术语
- Rubric评分细则
- 专家写下的评分标准,让弱模型也能按规则给强模型的输出打分
- RL environment强化学习环境
- 配好任务、工具和反馈机制,让AI在其中动手操作并根据结果学习
- Weak-to-strong supervision弱模型监督强模型
- 专家把判断标准写成规则后,弱模型也能据此评判强模型的输出
- Reward hacking奖励作弊
- 模型没真正完成任务,却找到漏洞把分数刷高
- Bench-maxxing刷榜
- 针对性优化某个评测榜单的分数,不一定等于真实能力提升
- RSI递归自我改进
- 指AI自己研发自己、迭代自身能力的长程训练任务
收听指南
想了解AI数据标注、评测和后训练供应链生意的创业者、投资人,以及关注模型训练数据来源和验证机制的工程师。
开场关于线下活动和黑客松的介绍可以跳过,不影响后面正文内容。