公開榜單測不出模型真實能力,第三方評測才是剛需
Llama 4 在公開榜單上表現驚人,在 Vals 的私有留出集上卻是不達標——自報成績和真實能力之間的裂縫,正在催生一個獨立的評測行業。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
Llama 4 暴露了自報成績的裂縫
Rayan 給出的具體案例:Meta 發布 Llama 4 時,在 Vals 的私有留出基準上模型實際是不達標的,但在所有主要公開基準上——因為題目和評分標準都是開源的——它展現出驚人的能力。這個落差說明實驗室自報的能力和第三方高質量、高信噪比基準測出來的東西之間存在巨大脫節。Rayan 認為實驗室自己也明白這一點,他們想要的是一個理性的買方市場:當投入數十億美元訓練新模型時,需要有實質性的證據指向進步,而不是完全靠自己說了算。
— Rayan Krishnan評測機構不能同時賣訓練數據
Vals 早期做的一個關鍵決定是永不向實驗室出售訓練數據。Rayan 說這是他們經常被推的方向——和新實驗室合作時對方會提出採購訓練數據,這是門賺錢的生意,行業裡很多公司已經靠做噱頭式基準來賣數據,這成了它們的 go-to-market。他用審計行業類比:如果做審計的同一批人還在給公司做諮詢,激勵結構就混了,最後變成付費通過審計,在 AI 這裡就是付費贏得榜單。Ben 補充說這有點像 MPAA 分級——什麼是藝術、什麼是色情,界線在哪,定義本身會隨時間變化,最終靠的是行業裡足夠多的人形成共識,而不是「解出這道題你就到這個等級」這種又窄又容易被攻破的規則。
— Rayan Krishnan評測正從百萬樣本走向少量任務
Rayan 描述了一個結構性轉變:評測越複雜,樣本量越小,但對輸出的評判標準越多。早期像 ImageNet 是幾百萬張圖片做基礎分類,輸入和輸出是一對一映射;現在可能是「給我生成 50 個全棧 web 應用」這樣數量少得多的任務,但評估產出的機制複雜得多。基礎設施層面也隨之變化——現在要測模型跑幾小時、幾天甚至幾週的能力,基礎設施必須足夠穩定,某個請求失敗了要能從那個點重試,而不是把整條軌跡重跑一遍。他認為這個趨勢會隨著更復雜的工作被納入評測而持續。
— Rayan Krishnantoken 支出可能超過工資支出
Rayan 講了一個 Fortune 10 公司的案例:他們給工程師每天約 100 美元的 Claude Code 預算,結果因為額度在下午 4 點重置,最高效的工作時段變成了 4 點到 6 點,下午則出現一段死區,人們去散步喝咖啡。這家公司最近把額度提到了每人 300 美元——幾乎相當於一個員工的工資變成了 token。Rayan 的判斷是:每一層都在發生對智能的錯誤定價,工程師不知道怎麼把這 100 美元分配到最大生產力上,公司定額度也很隨意,而 Anthropic 是在很薄的利潤上支撐這一切。當 token 支出開始超過工資支出,企業就必須比過去六個月更認真地論證 ROI。
— Rayan Krishnan最貴的模型不一定是最貴的賬單
Rayan 指出,今天仍然很難說最好的 OpenAI 模型或最好的 Anthropic 模型就一定最適合你的代碼庫,很多非直覺的案例必須跑評測才知道。中間層選項變得非常複雜:Anthropic 有 Opus 和 Sonnet,還有 Luna 和 Terra,Luna 在成本上很有競爭力,MewSpark 也很便宜,1.2 能力很強,還有不斷增長的開源模型可以自託管。他給了一個具體反例:很多情況下 Sonnet 比 Opus 更貴,因為它太吃 token,如果按「感覺適用就用」的方式操作,可能反而花得更多。
— Rayan Krishnan一個月燒掉 15 萬美元 token 的實驗
ValSmith 這個產品來自 Vals 自己踩的坑。Rayan 做了一次 token maxing 實驗,給團隊拿到某些編碼工具一個月的無限訪問權限,事後回看,他們每天消耗 10 億到 20 億 token,峰值一天有一個工程師燒掉 60 億。他算了一下,那個月大約花掉了價值 150 萬美元的 token——是免費的,但實際是員工工資的 10 倍,不是五五開。於是他們翻 trace、翻 GitHub repo,做出 ValSmith,發現了一些反直覺的結論:Cognition 的 Devon 工具其實非常省 token,所以被更多采用;有些場景訂閱制定價比按 token 計價更划算。這套方法後來變成了他們的運營策略。
— Rayan Krishnan政府定規則,第三方判斷規則有沒有被破
Ben 把政策分工講得很清楚:政府從大實驗室那裡收到大量警告——這東西會用於生物黑客、會是網絡安全風險——所以政府需要做的是先明確自己害怕什麼,然後問兩個問題:模型有沒有這個能力,以及能不能讓人把模型引導去做這件事。Ben 認為政府特別不適合做後一項評估,尤其隨著時間推移,這不是一個好的政府職能;但政府很擅長制定規則,因為它能執行規則。所以理想的組合是政府制定並執行規則,由有能力的私營公司來告訴它規則有沒有被打破。他還提到一個現象:大實驗室開始說模型有這個能力、也能被引導做壞事,所以我們不讓任何人用,只自己用並確保自己人不去引導它做壞事——而即便這樣也不總是奏效。
— Ben Horowitz核軍控的「信任但核查」是 AI 的模板
Rayan 說從理想主義視角看,他對主權 AI 上的鉅額投入感到意外——上帝視角下,建這麼多數據中心、複製數據工程流程、訓練這些超大模型是極其低效的,本可以整合。但現實是各國在加大主權 AI 建設,這就需要一個共享語言來溝通評估框架和風險對齊。他引用里根的話「trust but verify」,指出習近平和特朗普下個月將會面,信任的跡象出現了,但核查這一半沒有明確辦法。核軍控裡核查靠的是飛越偵察,讓一國可以審計另一國的核庫存;AI 如果存在社會性或生存性風險,同樣需要構建評估的共享語言來完成核查。
— Rayan Krishnan原話 · 已逐字校驗
what we saw is that on our held-out private benchmarks, the model is actually underperforming. But on all of the major public benchmarks where the questions and rubrics are actually open source, it was showing incredible capability.
我們看到的是,在我們的私有留出基準上,這個模型實際上是不達標的。但在所有主要公開基準上——那些題目和評分標準都是開源的——它展現出驚人的能力。
Rayan Krishnan3:03
if you have the same group who's responsible for doing the audit, as well as also consulting and supporting the company, you have a mixed incentive structure. And then it just becomes pay to pass the audit, or in this case, pay to win the benchmark.
如果負責做審計的是同一批人,同時又在給這家公司做諮詢和支持,你就有了一個混合的激勵結構。然後它就變成了付費通過審計,或者在這個場景裡,付費贏得榜單。
Rayan Krishnan8:07
there is a rate limit which resets at 4 p.m. And so the most productive hours of work are actually now 4 to 6 p.m. when the rate limits reset. But then there's this dead period in the afternoon when people go on walks or, you know, get a coffee because they just don't have the rate limits.
有一個下午 4 點重置的速率限制。所以現在最高效的工作時段實際上是 4 點到 6 點,速率限制重置的時候。但下午就出現了一段死區,人們去散步,或者去喝杯咖啡,因為他們就是沒有額度了。
Rayan Krishnan16:24
it was actually 10 10x more we were spending in tokens than employee salary for that month. So it's not even like, oh, this is 50-50, it's 10x.
那個月我們在 token 上的花費實際上是員工工資的 10 倍。所以根本不是「哦,這是五五開」,是 10 倍。
Rayan Krishnan22:35
the government sets and enforces the rules, and that a very competent kind of private company then tells them if the rule is broken.
政府制定並執行規則,然後由一家非常有能力的私營公司來告訴它規則有沒有被打破。
Ben Horowitz29:59
I think Reagan had this line, trust but verify. And so I think we're starting to see signs of trust in that Xi Jinping and Trump are going to be meeting next month. But there is no clear way to actually do the verification part of this.
里根有一句話,信任但核查。我們開始看到信任的跡象——習近平和特朗普下個月將會面。但核查這一半,實際上沒有明確的辦法。
Rayan Krishnan34:09
數字與實體
| Vals 私有留出基準上 Llama 4 的表現 | 不達標(underperforming) | 3:03 |
| Fortune 10 公司給工程師的 Claude Code 日預算 | 約 100 美元,後提高到 300 美元 | 16:24 |
| Vals 實驗一個月的 token 價值 | 約 150 萬美元 | 22:35 |
| 該月 token 支出與員工工資之比 | 10 倍 | 22:35 |
術語
- held-out private benchmarks私有留出基準
- 不公開題目和評分標準的評測集,防止模型針對性刷分。
- recursive self-improvement (RSI)遞歸自我改進
- 模型參與訓練下一代模型,形成能力自我複利的過程。
- reward hacking獎勵黑客
- 模型繞過評測目標、用取巧方式拿高分的行為。
- token maxingtoken 拉滿
- 不計成本地把 token 用量推到極限,以換取最大產出。
- harness運行框架
- 包裹模型、負責工具調用與任務編排的外層系統。
收聽指南
正在為企業選型 AI 模型和編碼 agent 的工程負責人、需要向董事會論證 AI 投入 ROI 的 CTO,以及關注 AI 政策與評測標準的從業者。
開頭 0:00-2:03 的引子與介紹可跳過。