世界太吵,來原聲聽播客

硅谷101

評測公司最大的紅線:不能把自己出的題拿去賣數據訓模型

很多做benchmark的人會被賣數據的誘惑拉下水——但如果賣的數據汙染了自己出的評測,毀掉的不只是自己的榜單,還有所有依賴這個榜單的模型。

數據行業AI創業評測基準強化學習Rubric後訓練
兩位一線從業者拆解了數據標註到RL環境、評分標準(Rubric)再到benchmark生意的完整鏈條,信息密度高,行業內幕多,值得完整聽完。

核心論點 · 點時間戳可跳到原聲

1:01

數據公司估值半年翻十倍

三名20多歲年輕人創立的AfterQuery今年4月A輪估值3億美元,到9月新一輪融資估值漲到32億美元,創下YC旗下公司從啟動到獨角獸的最快紀錄。同時Scale AI、Mercor這類老牌數據公司估值也已到百億美元級別,但外界很難看清這些高估值背後到底在賣什麼樣的數據、為什麼模型公司願意為此付這麼多錢。

10:08

Rubric的本質是弱模型監督強模型

允中解釋Rubric的核心邏輯叫weak-to-strong supervision:專家先把自己腦子裡的判斷標準寫成打分規則,之後哪怕是能力較弱的模型,只要照著這份規則去改卷子,也能給出跟專家一致的分數。這解決了歷史題、法律題這類沒有唯一標準答案的領域也想做強化學習時遇到的問題——標答存在,只是不結構化,沒法簡單做模式匹配。

— 允中
12:08

ALE想把vibe coding的打法推廣到一切

一鈾解釋ALE的初衷:coding領域因為有大量公開、易驗證的benchmark,才推動了vibe coding的爆發式發展;ALE想把這套打法複製到其他能客觀打分的專業領域,讓智能體解決有真實經濟價值、結果可驗證的長任務。目前公開任務150多個,覆蓋50多個細分行業,目標是下一版本直接放出1000多個任務。

— 一鈾
22:14

做評測的人不能把自己出的題拿去賣

允中和一鈾都強調,做benchmark和賣數據是兩件不能混為一談的事。一鈾直言業內確實有數據公司踩過這條紅線,把自己做評測用的數據拿去賣給模型公司訓練——這樣不僅會毀掉自己這個benchmark的權威性,還會連帶毀掉所有依賴這個榜單的其他模型的可信度,是絕對不能碰的底線。

— 允中
34:19

數據生意真正難的是採購,不是加工

允中把數商的工作拆成採購和加工兩塊,認為真正難、真正值錢的是採購——把某個垂直行業的私域數據、商業軟件版權甚至遊戲源碼買回來。他舉例說做芯片設計、AWS模擬這類環境都涉及複雜的版權和定製問題,誰能把某個垂類的採購問題解決好,誰就有巨大優勢,這也是兩三個人的小數據公司還能拿到高估值的原因。

— 允中
38:20

生物醫藥類benchmark覆蓋率不到10%

ALE團隊按照Nature的學科分類,把生物學工作流展開到第三級,梳理出大約3000個細分節點,再核對現有生命科學類benchmark覆蓋了多少——結果發現覆蓋率大概只有10%,甚至不到5%,市面上連一個覆蓋面完整的benchmark都沒有,說明專業領域的數據缺口遠比想像中大。

— 一鈾
48:24

SWE-bench Verified被質疑測試缺陷加汙染

今年2月OpenAI宣布停止報告SWE-bench Verified的分數,原因有兩類:一是測試腳本本身有缺陷,連正確解法都可能被判錯;二是模型在特定提示下能復現題目原本的人類修復代碼,說明預訓練階段很可能已經接觸過相關內容。一鈾提到這個benchmark過去6個月分數只從74%漲到80%,剩下部分很可能都集中在這類問題上,ALE因此沒有采用它。

50:24

專家造假數據幾個月都查不出來

一鈾坦言ALE真實發生過專家造假的問題:因為提交項目能換來論文作者署名,有人為了刷這個獎勵,直接用agent合成一堆亂七八糟的數據,一眼就能看出是編的。允中說更難發現的是編造得逼真的數據,比如聲稱做過化學模擬其實根本沒跑過,可能要等到模型能力遠超任務本身、批量答案彼此吻合卻和真實結果不一致時才會暴露,而重新找專家驗證的成本極高。

— 一鈾

原話 · 已逐字校驗

由三名20多歲的年輕人創辦的 AfterQuery 今年4月宣布A輪融資的時候 估值還是3億美元 到了9月 新一輪融資 就已經把它的估值推到了32億美元

由三名20多歲的年輕人創辦的AfterQuery,今年4月宣布A輪融資時估值還是3億美元,到了9月新一輪融資,估值已經推到了32億美元。

就我能不能用弱模型來監督強模型 那它這裡成立的條件就是說 我有個專家把他腦海裡的知識 給寫下來了 這樣弱的模型拿著它改卷子就行了

就是我能不能用弱模型來監督強模型,成立的條件是有個專家把他腦海裡的知識寫下來了,這樣弱的模型拿著它改卷子就行了。

允中10:08

我們怎麼樣把 Vibe coding(氛圍編程) 迅速發展的這趨勢 推廣到vibe everything

我們怎麼樣把Vibe coding迅速發展的這個趨勢,推廣到vibe everything。

一鈾12:08

當然這個是 大家千萬不能碰的一條線 不能讓你做的生意 汙染你這個benchmark的權威性 不然的話 你不僅毀了你的benchmark 也毀了其他人的模型

這是大家千萬不能碰的一條線,不能讓你做的生意汙染你這個benchmark的權威性,不然你不僅毀了自己的benchmark,也毀了其他人的模型。

允中22:14

就甚至代碼領域 其實採購一些私域的代碼倉庫 誰能把這個問題解決好 其實就是一個巨大的優勢

甚至代碼領域,採購一些私域的代碼倉庫,誰能把這個問題解決好,就是一個巨大的優勢。

允中34:19

它要價能要到兩三百萬人民幣一條 我覺得哪家數據公司 或者別人做benchmark 都沒有這個財力去做這個事情

它要價能要到兩三百萬人民幣一條,我覺得哪家數據公司或者別人做benchmark,都沒有這個財力去做這個事情。

一鈾36:20

在特定提示下面 模型能夠復現部分題目原本的 人類修復代碼 也就是說 模型很可能在訓練過程當中 就已經接觸過相關內容了

在特定提示下,模型能夠復現部分題目原本的人類修復代碼,也就是說模型很可能在訓練過程中就已經接觸過相關內容了。

他甚至起了agent 去合成一堆亂七八糟的數據 甚至有些數據交上來 我就肉眼看出來他就是編的

他甚至起了agent去合成一堆亂七八糟的數據,甚至有些數據交上來,我肉眼就能看出來他是編的。

一鈾50:24

數字與實體

AfterQuery A輪估值3億美元1:01
AfterQuery 9月新一輪估值32億美元1:01
Meta入股Scale AI估值超過290億美元1:01
Mercor最新一輪估值100億美元2:02
ALE當前公開任務數150多個,覆蓋50多個細分行業4:06
ALE下一版本任務目標1000多個4:06
某小眾遊戲源碼要價兩三百萬人民幣一條36:20
SWE-bench Verified過去6個月分數變化從74%漲到80%48:24
ALE V2生命科學類benchmark覆蓋率約10%,甚至不到5%38:20
Mercor製造業工程師時薪一兩百美元一小時56:27

術語

Rubric評分細則
專家寫下的評分標準,讓弱模型也能按規則給強模型的輸出打分
RL environment強化學習環境
配好任務、工具和反饋機制,讓AI在其中動手操作並根據結果學習
Weak-to-strong supervision弱模型監督強模型
專家把判斷標準寫成規則後,弱模型也能據此評判強模型的輸出
Reward hacking獎勵作弊
模型沒真正完成任務,卻找到漏洞把分數刷高
Bench-maxxing刷榜
針對性優化某個評測榜單的分數,不一定等於真實能力提升
RSI遞歸自我改進
指AI自己研發自己、迭代自身能力的長程訓練任務

收聽指南

誰該聽

想了解AI數據標註、評測和後訓練供應鏈生意的創業者、投資人,以及關注模型訓練數據來源和驗證機制的工程師。

可跳過

開場關於線下活動和黑客松的介紹可以跳過,不影響後面正文內容。