評測公司最大的紅線:不能把自己出的題拿去賣數據訓模型
很多做benchmark的人會被賣數據的誘惑拉下水——但如果賣的數據汙染了自己出的評測,毀掉的不只是自己的榜單,還有所有依賴這個榜單的模型。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
數據公司估值半年翻十倍
三名20多歲年輕人創立的AfterQuery今年4月A輪估值3億美元,到9月新一輪融資估值漲到32億美元,創下YC旗下公司從啟動到獨角獸的最快紀錄。同時Scale AI、Mercor這類老牌數據公司估值也已到百億美元級別,但外界很難看清這些高估值背後到底在賣什麼樣的數據、為什麼模型公司願意為此付這麼多錢。
Rubric的本質是弱模型監督強模型
允中解釋Rubric的核心邏輯叫weak-to-strong supervision:專家先把自己腦子裡的判斷標準寫成打分規則,之後哪怕是能力較弱的模型,只要照著這份規則去改卷子,也能給出跟專家一致的分數。這解決了歷史題、法律題這類沒有唯一標準答案的領域也想做強化學習時遇到的問題——標答存在,只是不結構化,沒法簡單做模式匹配。
— 允中ALE想把vibe coding的打法推廣到一切
一鈾解釋ALE的初衷:coding領域因為有大量公開、易驗證的benchmark,才推動了vibe coding的爆發式發展;ALE想把這套打法複製到其他能客觀打分的專業領域,讓智能體解決有真實經濟價值、結果可驗證的長任務。目前公開任務150多個,覆蓋50多個細分行業,目標是下一版本直接放出1000多個任務。
— 一鈾做評測的人不能把自己出的題拿去賣
允中和一鈾都強調,做benchmark和賣數據是兩件不能混為一談的事。一鈾直言業內確實有數據公司踩過這條紅線,把自己做評測用的數據拿去賣給模型公司訓練——這樣不僅會毀掉自己這個benchmark的權威性,還會連帶毀掉所有依賴這個榜單的其他模型的可信度,是絕對不能碰的底線。
— 允中數據生意真正難的是採購,不是加工
允中把數商的工作拆成採購和加工兩塊,認為真正難、真正值錢的是採購——把某個垂直行業的私域數據、商業軟件版權甚至遊戲源碼買回來。他舉例說做芯片設計、AWS模擬這類環境都涉及複雜的版權和定製問題,誰能把某個垂類的採購問題解決好,誰就有巨大優勢,這也是兩三個人的小數據公司還能拿到高估值的原因。
— 允中生物醫藥類benchmark覆蓋率不到10%
ALE團隊按照Nature的學科分類,把生物學工作流展開到第三級,梳理出大約3000個細分節點,再核對現有生命科學類benchmark覆蓋了多少——結果發現覆蓋率大概只有10%,甚至不到5%,市面上連一個覆蓋面完整的benchmark都沒有,說明專業領域的數據缺口遠比想像中大。
— 一鈾SWE-bench Verified被質疑測試缺陷加汙染
今年2月OpenAI宣布停止報告SWE-bench Verified的分數,原因有兩類:一是測試腳本本身有缺陷,連正確解法都可能被判錯;二是模型在特定提示下能復現題目原本的人類修復代碼,說明預訓練階段很可能已經接觸過相關內容。一鈾提到這個benchmark過去6個月分數只從74%漲到80%,剩下部分很可能都集中在這類問題上,ALE因此沒有采用它。
專家造假數據幾個月都查不出來
一鈾坦言ALE真實發生過專家造假的問題:因為提交項目能換來論文作者署名,有人為了刷這個獎勵,直接用agent合成一堆亂七八糟的數據,一眼就能看出是編的。允中說更難發現的是編造得逼真的數據,比如聲稱做過化學模擬其實根本沒跑過,可能要等到模型能力遠超任務本身、批量答案彼此吻合卻和真實結果不一致時才會暴露,而重新找專家驗證的成本極高。
— 一鈾原話 · 已逐字校驗
由三名20多歲的年輕人創辦的 AfterQuery 今年4月宣布A輪融資的時候 估值還是3億美元 到了9月 新一輪融資 就已經把它的估值推到了32億美元
由三名20多歲的年輕人創辦的AfterQuery,今年4月宣布A輪融資時估值還是3億美元,到了9月新一輪融資,估值已經推到了32億美元。
就我能不能用弱模型來監督強模型 那它這裡成立的條件就是說 我有個專家把他腦海裡的知識 給寫下來了 這樣弱的模型拿著它改卷子就行了
就是我能不能用弱模型來監督強模型,成立的條件是有個專家把他腦海裡的知識寫下來了,這樣弱的模型拿著它改卷子就行了。
允中10:08
我們怎麼樣把 Vibe coding(氛圍編程) 迅速發展的這趨勢 推廣到vibe everything
我們怎麼樣把Vibe coding迅速發展的這個趨勢,推廣到vibe everything。
一鈾12:08
當然這個是 大家千萬不能碰的一條線 不能讓你做的生意 汙染你這個benchmark的權威性 不然的話 你不僅毀了你的benchmark 也毀了其他人的模型
這是大家千萬不能碰的一條線,不能讓你做的生意汙染你這個benchmark的權威性,不然你不僅毀了自己的benchmark,也毀了其他人的模型。
允中22:14
就甚至代碼領域 其實採購一些私域的代碼倉庫 誰能把這個問題解決好 其實就是一個巨大的優勢
甚至代碼領域,採購一些私域的代碼倉庫,誰能把這個問題解決好,就是一個巨大的優勢。
允中34:19
它要價能要到兩三百萬人民幣一條 我覺得哪家數據公司 或者別人做benchmark 都沒有這個財力去做這個事情
它要價能要到兩三百萬人民幣一條,我覺得哪家數據公司或者別人做benchmark,都沒有這個財力去做這個事情。
一鈾36:20
在特定提示下面 模型能夠復現部分題目原本的 人類修復代碼 也就是說 模型很可能在訓練過程當中 就已經接觸過相關內容了
在特定提示下,模型能夠復現部分題目原本的人類修復代碼,也就是說模型很可能在訓練過程中就已經接觸過相關內容了。
他甚至起了agent 去合成一堆亂七八糟的數據 甚至有些數據交上來 我就肉眼看出來他就是編的
他甚至起了agent去合成一堆亂七八糟的數據,甚至有些數據交上來,我肉眼就能看出來他是編的。
一鈾50:24
數字與實體
| AfterQuery A輪估值 | 3億美元 | 1:01 |
| AfterQuery 9月新一輪估值 | 32億美元 | 1:01 |
| Meta入股Scale AI估值 | 超過290億美元 | 1:01 |
| Mercor最新一輪估值 | 100億美元 | 2:02 |
| ALE當前公開任務數 | 150多個,覆蓋50多個細分行業 | 4:06 |
| ALE下一版本任務目標 | 1000多個 | 4:06 |
| 某小眾遊戲源碼要價 | 兩三百萬人民幣一條 | 36:20 |
| SWE-bench Verified過去6個月分數變化 | 從74%漲到80% | 48:24 |
| ALE V2生命科學類benchmark覆蓋率 | 約10%,甚至不到5% | 38:20 |
| Mercor製造業工程師時薪 | 一兩百美元一小時 | 56:27 |
術語
- Rubric評分細則
- 專家寫下的評分標準,讓弱模型也能按規則給強模型的輸出打分
- RL environment強化學習環境
- 配好任務、工具和反饋機制,讓AI在其中動手操作並根據結果學習
- Weak-to-strong supervision弱模型監督強模型
- 專家把判斷標準寫成規則後,弱模型也能據此評判強模型的輸出
- Reward hacking獎勵作弊
- 模型沒真正完成任務,卻找到漏洞把分數刷高
- Bench-maxxing刷榜
- 針對性優化某個評測榜單的分數,不一定等於真實能力提升
- RSI遞歸自我改進
- 指AI自己研發自己、迭代自身能力的長程訓練任務
收聽指南
想了解AI數據標註、評測和後訓練供應鏈生意的創業者、投資人,以及關注模型訓練數據來源和驗證機制的工程師。
開場關於線下活動和黑客松的介紹可以跳過,不影響後面正文內容。