世界太吵,來原聲聽播客

Latent Space

小模型死磕8周,能打破基礎模型寡頭壟斷嗎

Poolside用總參1180億、激活80億的小模型證明,持久性和驗證行為比單純堆參數量更能提升編程能力,這讓他們相信開源小模型能打破巨頭壟斷的未來。

開源模型模型訓練強化學習AI基礎設施AGI算力

原視頻在 YouTube 上放不出來,用音頻聽:

關心模型訓練工程細節、RL瓶頸和開源生態邏輯的人值得聽完;純八卦向聽眾可跳過中段技術段落。

核心論點 · 點時間戳可跳到原聲

1:05

一篇博客,四年後燒光1200萬美元

2015年Karpathy那篇講RNN的博客讓他連夜把公司方向轉向用神經網絡寫代碼,此後四五年裡團隊把RNN、LSTM、Transformer都試了一遍,方向是對的,卻沒意識到唯一要做的其實是繼續擴大規模。團隊燒掉1200萬美元投資人的錢,他稱之為職業生涯最大的失敗,之後兩年他基本沒再碰語言模型,直到ChatGPT發布,他才等來某種遲到的平反。

— Eiso Kant
6:21

寧要100家基礎模型公司,不要5家

Poolside創立之初和大多數實驗室一樣,不打算做開源。轉折發生在今年年初:他們意識到世界正走向一個只有三四家公司決定所有智能未來的劇本,這在他看來更像反烏托邦小說而非科幻理想。因為自己還沒跑到前沿,做這個決定的代價還不算高——他坦言真到了前沿位置,恐怕已經無法回頭。於是他們選擇開放研究和權重,理由很直接:寧可活在有100家基礎模型公司的世界,也不要只剩5家,哪怕自己就是那5家之一。

— Eiso Kant
18:18

模型工廠:8周訓完一個模型

Poolside把模型訓練當工業流程設計:三年前行業標配是先打包數據集、拷貝到訓練集群再分發,一改數據就要重新打包,極費時間。他們轉為把數據流式喂進訓練,數據層保持不可變,每個token都能溯源到具體代碼版本,兩年前的實驗仍可完全復現。團隊不到70名研究員、35名工程師,月跑1萬到2萬次實驗:Laguna XS2從開訓到發布5周,Laguna S用8周,S一完成就當天開始訓練更大的Medium。他現在看到的多是agent在寫代碼、跑實驗、評估結果——遞歸自我改進的早期苗頭。

— Eiso Kant
35:46

小模型靠死磕,不靠更聰明

應用研究負責人Peng Ming告訴Eiso,Laguna S的進步更多來自行為變化而非更強的智能:更多驗證、不輕易過早宣稱成功、更持久地死磕問題。這款1180億總參數、80億激活參數、能塞進一臺DGX Spark的小模型,獨立解出了Erdős 397問題,也能在沒有網絡的情況下靠反覆摸索底層API寫出一個Wi-Fi掃描器。這讓Eiso開始懷疑:知識工作(佔全球經濟約25%、合25萬億美元)所需模型規模的性價比拐點,可能遠比他此前設想的要低——但他強調這不是反對繼續做大模型,只是小模型裡還有很多沒被榨乾的空間。

— Eiso Kant
44:39

懷疑堆RL環境是不是走偏了

Eiso認為強化學習會越來越早地介入訓練過程,而不只是訓練完成後的後處理階段——他把DeepSeek的R1-Zero論文視為業界最早的公開信號,即模型剛學會用語言時就能被誘導出推理行為。他直言當下整個行業有兩種正在上癮的「毒品」:一個是蒸餾,一個是不斷堆砌更多RL環境,兩者都讓模型變好、讓人感覺良好,但他坦承並不確定這是不是通往AGI的正確道路,也不確定網頁數據裡的信息是否已經被next-token predict充分榨取。

— Eiso Kant
1:09:28

MCP和工具調用是「蠢」的設計

Eiso兩年來一直堅持一個不太受歡迎的觀點:MCP和傳統工具調用其實很蠢。他的邏輯是,複雜長程任務本質上是在和數據源與系統打交道,與其在模型和系統之間插入MCP或工具調用層,不如直接給模型一個裝好各種庫、文檔和API密鑰的代碼倉庫,讓它自己寫代碼、用if和for循環完成任務——RL訓練出來的模型本能上就想這麼幹。他預測12個月內不會再有系統提示詞裡塞著二三十個工具的做法,但Poolside目前仍支持工具調用和並行工具調用,因為業界普遍還沒轉過來。

— Eiso Kant
1:31:53

限制開放模型,可能造就新的寡頭

Eiso反對任何一家公司單方面決定誰能用自己的模型去開發基礎模型——他認為這類限制應該交給民主決策,而不是少數公司自己拍板。他舉例說,禁止香菸廣告本身是對的,但客觀上造就了菸草行業的寡頭壟斷,因為新進入者再也無法靠打廣告建立品牌。他擔心類似的鎖定效應會發生在AI上:一旦以現在的模型能力水平就開始限制開放模型,等於提前替未來判了死刑,而他認為當下的模型能力還遠沒有危險到需要這麼做的地步。

— Eiso Kant
1:36:25

RL的瓶頸不是GPU數量,是批大小

預訓練可以用整個互聯網當數據,batch size幾乎可以無限擴大;但RL訓練受限於任務/環境數量有限,batch size沒法這樣放大,這讓RL訓練時間成了真正的瓶頸,而不是GPU數量本身。Eiso因此很期待把推理裡prefill/decode分離、用專用硬件處理不同階段的思路搬進RL訓練,也提到幾天前剛看到一篇用比Poolside現有FP8更低精度做RL訓練的博客。他反覆強調:這是一場以日曆時間而非GPU數量計算的比賽,縮短RL訓練的牆鍾時間可能是當下最能給全行業提速的槓桿。

— Eiso Kant

原話 · 已逐字校驗

I had built a completely unreasonable belief, that neural nets should be able to generalize to anything and everything, and that language should be able to generalize, to a lot of things that are intelligent and the ability to write code.

我當時形成了一個完全沒道理的信念:神經網絡應該能泛化到任何事情上,而語言應該能泛化出很多智能的東西,包括寫代碼的能力。

Eiso Kant1:05

I rather live in a world that has 100 foundation model companies than a world that has five, even if I was one of the five.

比起只有5家基礎模型公司的世界,我寧願活在有100家的世界裡,哪怕我自己就是那5家之一。

Eiso Kant6:21

The model that we’re gonna talk about today was eight weeks from start of training, to launch. We started the next model literally yesterday because we now finished the post-training required for the model we’re launching, next week or by the time this comes out today.

我們今天要談的這個模型,從開始訓練到發布只用了8周。下一個模型我們昨天就已經開始訓練了,因為我們剛完成這次要發布的模型所需的後訓練——就是下週,或者這期節目上線的時候。

Eiso Kant18:18

I have the feeling that a lot of the gains in Laguna S come not from more intelligence, but more from different behavior, more verification, less taking things for granted, not declaring victory early, and being way more persistent.

我感覺Laguna S的很多進步並非來自更強的智能,而是來自不同的行為方式——更多驗證、更少想當然、不過早宣布勝利,以及更加持久地堅持。

Eiso Kant35:46

we’ve got some drugs in the industry. One of the drugs is distillation. Another drug is, more environments. Like, and they’re great, and they make us feel good, and they make the models better, and like we’re all addicted to them, and we’ll use them, right?

我們這個行業現在有幾種「毒品」:一種是蒸餾,另一種是不斷堆砌更多環境。它們確實很好用,讓我們感覺良好,也確實能讓模型變強,我們都對它們上癮,也都會繼續用。

Eiso Kant44:39

I think MCP and tools are stupid.

我覺得MCP和工具調用都很蠢。

Eiso Kant1:09:28

I always think back about when we banned advertising on cigarettes. Good thing. I’m not saying I’m against that. But it effectively established an oligopoly of cigarette companies because no one else could ever compete.

我總會想起當年我們禁止香菸打廣告這件事。那是件好事,我不是說反對它。但它實際上造就了菸草公司的寡頭壟斷,因為再也沒有別人能和它們競爭了。

Eiso Kant1:31:53

The race is measured not in how many GPUs, but the race is measured on calendar time, and that’s probably one of the biggest impacts we can have right now to speed up our industry.

這場競賽衡量的不是你有多少塊GPU,而是日曆時間,而這可能是我們現在能為整個行業提速所做的最大貢獻之一。

Eiso Kant1:36:25

數字與實體

Sourced失敗燒掉的投資1200萬美元2:29
Poolside研究員/工程師人數不到70名研究員,另有35名工程師18:18
Laguna XS2訓練週期開訓到發布共5周18:18
Laguna S訓練週期開訓到發布共8周18:18
Laguna S參數規模總參數1180億,激活參數80億54:34
知識工作佔全球經濟比例約25%,合25萬億美元38:05
新一代Laguna Medium訓練週期39天1:18:19
Poolside融資規模5億美元1:23:09

術語

RSI遞歸式自我改進
AI系統自己改進AI研發流程的能力,被視為逼近AGI的信號
MCP模型上下文協議
讓模型調用外部工具/數據源的標準協議,Eiso認為不如讓模型直接寫代碼
FP8/NVFP48位/4位低精度訓練
用更低數值精度訓練模型以省算力,是Poolside押注的方向之一
DGX Spark英偉達桌面級AI計算設備
可在單臺設備上跑百億參數模型的小型算力盒子
prefill/decode disaggregation預填充/解碼分離
推理中把處理提示詞和生成回答拆到不同硬件,Eiso想搬進RL訓練

收聽指南

誰該聽

基礎模型公司的研究/工程負責人,以及關注開源模型生態和RL訓練瓶頸的投資人。

可跳過

1:20:40附近Poolside名字由來和融資趣聞偏軼事,信息量較低,可跳過。