誰做好後訓練,誰就贏下推理這門更大生意
AI支出大頭流向推理而非訓練,但真正決定推理效率和成本的其實是後訓練優化——這是訓練與推理該由同一家公司來做的理由。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
自建模型不是防壞人,是要控制權
Yash明確反對把「擁有自己的智能」說成是防著實驗室作惡——他認為實驗室裡都是好人,也有合同約束。真正的理由是靈活性和控制權:模型跑在哪、怎麼部署、針對成本還是延遲還是特定領域去優化。這個敘事是在開源模型真正變好、能拿來幹活之後才興起的。更現實的風險是,模型確實不止一次從某些產品裡被下架,尤其在編程領域;而當實驗室越來越多地切入垂直賽道,它們是否還會繼續服務和自己直接競爭的客戶,也不確定。
— Yash後訓練能超前沿模型,但只在數據真正分布外時
後訓練想要在能力上超過前沿模型,前提是公司自己的數據相對於實驗室訓練數據是真正「分布外」的。但大多數公司做後訓練根本不是為了能力提升,而是用更便宜的模型去逼近前沿模型的效果,優化的是性價比而不是上限。更值得關注的問題是:某個領域的數據能在分布外保持多久——現在實驗室幾乎都盯著編程,其他領域遲早會被覆蓋。
— Yash持續學習卡在數據效率,不是算法本身
預訓練數據效率很低但泛化性很強;監督微調數據效率更高但效果有限;帶可驗證獎勵的強化學習用可復現環境和校驗器把數據數量換成了質量,但數據效率依然很差。Yash直言,真正擋住「持續學習」這件事的,是如何從稀疏獎勵裡高效學習——這是一個尚未解決的問題,而不是哪種訓練範式更優的問題。
— Yash每家公司都該有自己的模型?只對一半
針對Satya提出的「世界上該有多少家公司就有多少個模型」,Yash並不認為每家公司都需要預訓練或中訓練自己的模型,但確實相信每家公司內部都有值得被捕捉的閉環判斷邏輯。藥企是最乾淨的例子——各家專注不同病種、積累的實驗數據天差地別,自建模型順理成章。但說到銀行,Jacob當場提出質疑:一家銀行和另一家銀行的金融數據到底能有多不同?Yash沒有完全接住這個反問,只是用做法差異和風險偏好不同來回應,並舉了會計師事務所這類因業務天然碎片化而走向整合的反例。
— Yash / Jacob護住評測集,像護住留不住的員工一樣
強化學習在不可驗證領域也能爬坡見效,關鍵是把判斷題轉成打分題——給出專家答案,按照這個答案打分,效果出奇地好。這意味著不同公司找的專家不同,訓練出來的模型也會明顯不同。這讓「評測集」本身變成了競爭資產:任何公開的基準測試遲早會被針對性刷分,所以Yash認為公司應該像防止核心員工跳槽去競爭對手那樣,謹慎保護自己的評測集,而不是拿去給實驗室看。
— Yash後訓練才是推理生意的真正護城河
Applied Compute挑客戶只看兩類:模型能力提升特別值錢,或者推理體量特別大——因為真正花錢的地方是推理而不是訓練本身。更關鍵的判斷是:越是體量最大、最燒錢的工作負載,越應該最先做後訓練,因為這裡的收益會像冪律一樣輻射到其他場景。訓練方式還會反過來決定推理架構怎麼搭,比如為了讓模型更好地並行調用工具,推理端就要用預填充和解碼分離的部署方案。
— YashAI時代新型「超大規模雲」的倒金字塔
Yash把公司的野心定位成GPU時代的AWS/GCP/Azure:不只是推理——推理是目前AI軟件棧裡第一個真正形成粘性的環節——而是訓練、推理、路由、安全監控、agent沙箱整條全棧。他把這個結構比作倒金字塔:底層是極少數人能做的訓練,往上依次是推理、路由、上下文與harness工程,越往上門檻越低、能做的人越多。公司成立16個月,刻意先從訓練切入,再擴展到推理。
— YashRL帶來的能力提升,不像預訓練那樣能泛化
實證來看,在數學數據集上訓練出來的能力,遷移到法律領域幾乎沒什麼效果——強化學習帶來的提升不具備預訓練那種跨領域泛化能力。Yash用了一個比喻:智能更像一個表面凹凸不平的球體,距離近的點之間會有泛化,但遠的地方几乎互不相通,完全比不上預訓練那種整體性的泛化。
— Yash原話 · 已逐字校驗
But I do think the idea of owning your intelligence really is about flexibility and control.
但我確實認為,擁有自己的智能,核心其實是靈活性和控制權。
Yash2:06
I basically think like what's blocking continual learning is basically like extremely data efficient training from sparse rewards, which is an unsolved problem.
我基本上認為,擋住持續學習的,就是如何從稀疏獎勵裡做到極高數據效率的訓練——這是一個尚未解決的問題。
Yash13:32
Like you wouldn't, your employees are not fungible. You would not like be comfortable with them going to another company and doing work there. Same thing with these models.
就像你的員工不是可以隨意替換的——你不會願意看到他們跳槽到別的公司、用同樣的本事去給別人幹活。模型也是一樣的道理。
Yash26:11
And so, so what we, what our view is, is that the most post training actually wins inference.
所以我們的看法是:誰的後訓練做得最到位,誰就能贏下推理這門生意。
Yash29:15
Our big bet was, hey, post training is a massively underlooked part of the stack.
我們下的大賭注是:後訓練是整條技術棧裡被嚴重低估的一環。
Yash35:26
intelligence is some sort of sphere or circle. It's got jagged points on it. The points that are closer together, you'll see more generalization there.
智能更像一個球體或圓,表面凹凸不平。相距近的點之間,你會看到更多泛化;離得遠的就不行。
Yash42:33
It's like water. They find the path of least resistance.
這就像水一樣,它們總能找到阻力最小的那條路。
Yash56:09
數字與實體
| Applied Compute 公司成立時長 | 16個月(訪談時) | 36:29 |
| 在線訓練案例服務用戶規模 | 數萬至數十萬用戶 | 13:32 |
術語
- out-of-distribution (OOD) data分布外數據
- 模型訓練時沒見過的數據類型,決定後訓練能否帶來真實能力提升
- RL with verifiable rewards (RLVR)可驗證獎勵強化學習
- 用能明確判定對錯的任務和校驗器來訓練模型,犧牲數據量換質量
- TCO總擁有成本
- 這裡指持續對模型做後訓練、在線訓練所需的全部成本
- harness工具調度框架
- 圍繞模型搭建的工具調用、提示詞和上下文工程,不涉及改模型本身
- hyperscaler超大規模雲服務商
- 如AWS、GCP、Azure這類提供全棧基礎設施的雲巨頭
收聽指南
正在評估要不要自建/後訓練模型的創業者和企業AI負責人,以及關注推理基礎設施商業模式的投資人。
4分35秒前後關於OpenAI與Baseten合作的討論信息量較低,轉寫也有缺失,可跳過。