世界太吵,來原聲聽播客

No Priors

頂級閉源模型黑了一家公司,靠開源模型才自救成功

Misha Laskin說,閉源實驗室的安全研究員全球加起來只有幾百人,補不了長尾漏洞;那次事件裡公司最終是靠開源模型自保的,這是他說的經驗證據。

開源模型算力強化學習AI安全中美科技競爭商業化
Reflection AI創始人首次公開Beam的訓練算力細節和開源商業模式,並正面回應『開源更危險』的指控,信息密度高。

核心論點 · 點時間戳可跳到原聲

6:24

中國開源模型逼得公司轉向自建

Reflection最初的打算是站在別人訓練好的開源基座模型上做強化學習研究,但大約一年後發現,當時所有好用的開源模型都來自中國,西方沒有像樣的開源基座可用。同時他們在研究中發現一個關鍵事實:要讓強化學習在大規模上真正好用,你其實需要自己預訓練模型——兩件事耦合得太緊,分不開做。這兩個原因加上企業和地緣政治層面的考量,促使他們決定端到端自己做一個開放模型。

— Misha Laskin
11:44

強化學習吃掉的算力比預訓練還多

Beam是5000億參數的模型,230億是激活參數。預訓練用了6000張GB300跑了幾週(基礎設施優化後現在能壓到12天左右);但強化學習階段用了略超1萬張GB300,跑了整整4周——花在RL上的浮點運算實際上比預訓練還多。原因是RL階段既要做大規模推理,又要維護各種agent用的沙盒環境,複雜度更高。

— Misha Laskin
20:12

Beam比同級模型快3到4倍

Misha強調模型建設裡一個常被忽視的維度:不只是能力高低,而是agent多快把事情做完,這直接決定了客戶的成本和等待時間。Beam在同等能力級別下比同類模型快3到4倍,面對更大的模型時效率優勢能拉到10倍左右。他把這歸功於強大的預訓練推理基礎,疊加了他認為是開源領域目前規模最大的一次強化學習訓練。

— Misha Laskin
25:33

開源token份額半年內反超閉源

從OpenRouter、Vercel這類網關的數據看,大約6個月前token消耗是70%閉源、30%開源,現在幾乎正好反過來,變成70%開源、30%閉源。Misha預計這個趨勢還會加速,世界會越來越像操作系統市場——Linux跑在95%以上的服務器上,但微軟和蘋果依然是價值極高的公司。他的判斷是:多數token會流向開源,但頂尖的閉源模型公司和開源生態周邊的發行商也都會活得很好。

— Misha Laskin
41:01

開源模型是基礎設施的特洛伊木馬

Misha的類比是:開源模型本身用處有限,真正被鎖定的是圍繞它的整套軟件和基建生態,就像當年5G光纖布局和一帶一路——誰給別的國家提供了便宜好用的技術,誰就獲得了商業和地緣政治槓桿,這跟稀土資源的邏輯類似。他預判中國公司比如華為很快會提供全棧方案,讓使用國鎖進其供應鏈;放在算力和數據中心是新時代『鐵路』這個框架裡看,沒有自己鐵路的國家都得依附某一方。

— Misha Laskin
47:34

閉源模型黑了別家公司,靠開源自救

面對『開源不安全』的指控,Misha的反駁是網絡攻防很難真正分開——拿掉進攻性能力的同時也拿掉了防禦能力。他舉的具體案例是:一次事件裡,某家公司遭到一個強大閉源模型的攻擊,而它自己想用現有最先進的閉源模型來防禦時,卻因為那些模型被加上了護欄而用不了,最後只能依靠開源模型完成自我修復。他把這稱為『我們所處世界的經驗證據』。

— Misha Laskin
56:40

拿自己博士論文測模型測了三年

Misha過去幾年反覆用同一個提示詞測試語言模型:把他自己的物理學博士論文題目交給模型。兩年前模型只能聊天,什麼也做不了;一年前它能答到本科生作業的水平;六個月前它已經能給出真正的博士水平答案並且做對;現在再試,模型甚至會給出一些他當時都沒想到的新信息。他由此推論,原本要花幾年才能走完的提問—求解過程,理論上可以被壓縮到一週。

— Misha Laskin
1:04:59

大項目需要的研究員數量沒怎麼變

被問到『今年用100人,明年是不是只要20人就能做出同樣的東西』時,Misha的回答是:對同一個目標來說確實會更少人力,但雄心會不斷擴張,所以團隊總是感覺人手不夠而不是過剩。不過他也承認存在一個研究員與算力的配比上限——3000名研究員並不會比幾百人更有幫助,真正有用的量級大概是一兩百人,剩下的增長空間在把模型能力部署到具體行業場景的『應用研究』崗位上。

— Misha Laskin

原話 · 已逐字校驗

When you remove cyber offensive capabilities, you also remove cyber defensive capabilities.

當你拿掉網絡攻擊能力時,你也拿掉了網絡防禦能力。

Misha Laskin0:00

You actually have to get 30 things right. And that's why everything is hard because you have to get 30 things right.

你其實得把30件事都做對。這就是為什麼一切都很難,因為你得把30件事都做對。

Misha Laskin3:05

this reinforcement learning system never stopped learning. If you look at our plots, they just keep going up.

這套強化學習系統從沒停止學習。你去看我們的曲線圖,它們一直在往上走。

Misha Laskin13:47

Beam tends to be three to four times more efficient than models of the same capability class. Much more efficient when it comes to models that are larger out there, where the efficiency gains then end up being something like 10x.

Beam通常比同等能力級別的模型效率高三到四倍。面對更大的模型時效率優勢更明顯,能達到10倍左右。

Misha Laskin20:12

So, you know, one way I kind of think about it is that open models are Trojan horses for the infrastructure that they bring with them.

所以,我傾向於這樣想:開源模型是它所攜帶的那整套基礎設施的特洛伊木馬。

Misha Laskin41:01

a very powerful closed model had unintended consequences where it went and like hacked into another company. And the only way that company could remediate itself was by using open models to protect itself.

一個非常強大的閉源模型產生了意料之外的後果——它跑去黑了另一家公司。而那家公司唯一能自我修復的辦法,就是用開源模型來保護自己。

Misha Laskin47:34

A couple of years ago, well, it was just chat, so it couldn't do anything. Then a year ago, it started answering things, I would say, at an undergraduate level.

兩年前,它就只是個聊天工具,什麼也做不了。一年前,它開始能回答問題了,大概是本科生水平。

Misha Laskin56:40

數字與實體

Reflection AI團隊規模從約30人(一年前)增長到約300人1:00
Beam預訓練算力6000張GB300,約數週(基礎設施優化後約12天)11:44
預訓練計算效率年增速人工研究約7倍/年,當前強化學習輔助下最高約30倍10:40
Beam推理效率優勢同能力級別模型快3-4倍,比更大模型快約10倍20:12
開源token份額變化(網關口徑)約6個月內從30%升至約70%25:33

術語

jagged鋸齒狀智能
模型跨任務泛化很強,但不同任務/評測間能力參差不齊
Linus' Law林納斯法則
足夠多雙眼睛關注,所有bug(含安全漏洞)都會變得容易發現
intelligence density智能密度
單位算力能產出多少有效智能,是Misha競爭力公式的核心變量

收聽指南

誰該聽

想理解開源大模型商業模式、算力成本結構,或關注中美開源模型地緣博弈的創業者、投資人和工程師。

可跳過

22分鐘附近『租房vs買房』的商業化類比可以快進,後面會重複同一個意思。