世界太吵,來原聲聽播客

張小珺·商業訪談錄

預訓練才是主峰:智能本身就是最大的應用

模型公司是煉油廠,值錢的是化工廠和汽車公司;但今天最大的紅利是承接研究溢出的智能,而不是做產品拉動的應用。

預訓練AgentCoding模型競爭AGI
廣密給出AGI原教旨主義的完整路線圖:預訓練決定上限,Coding是模型的手,Agent是新物種。信息密度高,適合從業者。

核心論點 · 點時間戳可跳到原聲

4:06

預訓練結束是最大共識,也是最大非共識

廣密認為今天最大的共識是「Pretraining結束了」,但最大的非共識恰恰是「Pretraining空間還非常大,甚至剛開始」。他的判斷是:只有Pretraining才能湧現新能力,Post Training和RL只是激發或加強能力,決定模型內在上限。他用一個比喻:在很差的Base Model上做強化學習,就像小學生刷題,很容易飽和見頂;只有Pretraining才能把小學生本質上變成初中生。他判斷下一代SOTA模型還是能顯著Beat今天的SOTA。

— 廣密
6:11

OpenAI不重視預訓練,是組織問題不是戰略問題

外界看OpenAI好像沒那麼重視Pretraining了。廣密給了兩個原因:一是戰略選擇,O系列在Benchmark上走得快,兩個月刷分收益可能比Pretraining一兩年還快,ChatGPT增速也很恐怖,佔了管理層很大精力;二是組織問題,OpenAI的Pretraining核心團隊一直動盪,最早Anthropic的Daryl帶走一批,Elia離開,CTO Mira又帶走核心Post Training的人,原來的Pretraining的人不斷被調到Post Training。所以不是top down不重視,而是組織調整顯得不那麼重視。

— 廣密
11:15

Coding是模型的手,也是AGI最好的環境

廣密說想明白一件事:Coding可能是實現AGI最好的環境。Coding的意義不在編程本身,而在於現實世界絕大部分任務都可以通過code來表達。他把Coding類比成AlphaGo的棋盤、百度的通用搜索、淘寶的商品搜索環境。Coding是模型的一個手——模型通過生成執行代碼,實現對外部環境的採集、處理、反饋。他判斷兩年以內,Agent能操作電腦和手機這種數字環境,能力絕對超過99%的人,操作人類正常操作99%的行為,而且比人操作得好。

— 廣密
19:19

OpenAI和Anthropic同宗同源,但戰略已經分化

廣密認為OpenAI和Anthropic最開始路線一樣,但走著走著核心戰略Bet已經發生很大變化。OpenAI核心Bet是兩個:一是希望通過O系列或Resoning Model實現AGI,二是希望ChatGPT做成十多億活躍用戶的K-Lab去先翻Google。Anthropic核心Bet是專注做Pretraining,繼續Bet on Pretraining,有一個很強的Base Model,繼續Bet on Coding、Bet on Agentic。OpenAI更重視C端市場,Anthropic更重視B端市場;OpenAI是自下而上創新的組織文化,Anthropic是自上而下創新的組織文化。

— 廣密
30:31

智能提升是唯一主線,智能本身就是最大應用

廣密把AGI探索比作爬一座科學的高山,最後誰能到珠穆朗瑪峰。他反覆講一句話:智能提升是唯一的主線,智能本身就是最大的應用。ChatGPT走到3.5有了通用泛化性,解鎖了對話能力;Claude走到3.5 Sonnet解鎖了Coding能力,跑出了Cursor;今天大家都在解鎖Agent、Agentic。他畫出的登山路線圖是:ChatGPT只是山腳第一站,後面還有Coding、Coding Agent、General Agent、AI for Science、Robotics。他認為AI for Science科學探索才是那個珠穆朗瑪峰——真的攻克癌症,或治療人類幾乎所有疾病。

— 廣密
36:34

機器人數據採集太低效,所以排在Science後面

廣密對Robotics態度有變化。從第一性原理看,今天做Robotics的Foundation Model或Research Lab,做法上不夠本質。數據上,GPT語言模型有Scaling Law,因為有Common Crawl數據集持續抓互聯網數據;但機器人數據採集太低效,人操作幾十臺設備,每小時成本可能幾十上百塊,要採集一億個小時有效數據,可能要幾億美金成本,Scaling Law驗證成本很高。算法結構上,今天大家還沒達成一致,底層算法到底是哪一個沒有共識,還沒找到有通用泛化性的架構。他認為未來語言模型的多模態能力強了,從2D世界走向3D世界是比較自然的過程。

— 廣密
55:52

Online Learning可能是下一個範式級路線

廣密認為如果未來還有範式級路線,Online Learning可能算一個。核心不是online real time,而是讓模型自主地在線探索和學習,很像人類的生存方式——在生存和激勵的基礎上,有充分的好奇心,一切探索,然後把好的workflow抽象、自動化,形成自己的workflow。目前範式下能想像到的Online Learning,是讓模型通過和用戶的交互,實時更新更小的參數。但什麼情況下更新記憶、更新什麼,今天也沒有一個reward,模型要達到什麼樣的目標也沒有很好的定義。他說伊利亞在memory和multi agent上研究比較好。

— 廣密
1:13:07

利潤池劃分不合理:英偉達拿走80%以上

廣密認為今天價值鏈的利潤池劃分很不合理。從NVIDIA到AWS到Anthropic到Cursor,NVIDIA幾乎拿走了利潤的80%以上,AWS拿走了30%,Anthropic是虧的,Cursor也是負毛利的。他判斷長期會往後移:AWS的利潤起來,然後模型和應用的利潤也會起來。他對模型公司的長期價值信心越來越強。他還提到模型訓練的經濟性:OpenAI幾百億美金的投入,是給全人類提供了一個巨大的技術槓桿,幾千個人槓桿了幾億人的生產力,是給今天通脹的世界提供了巨大的通縮力量。

— 廣密

原話 · 已逐字校驗

我覺得coding可能就是模型的一個手吧 你看Manus也給agent搭了個虛擬的電腦環境 agent來操作電腦的工具 就是我覺得兩年以內 agent能操作電腦和手機這種數字環境 它的能力是絕對超過99%的人的

Coding可能就是模型的一個手。Manus也給Agent搭了個虛擬的電腦環境,Agent來操作電腦的工具。我覺得兩年以內,Agent能操作電腦和手機這種數字環境,它的能力絕對超過99%的人。

廣密11:15

我最近腦子裡反覆講的就是一句話 就是叫智能提升是唯一的主線 智能本身就是最大的應用 所以我們還是要圍繞智能本身去投入和思考

我最近腦子裡反覆講的就是一句話:智能提升是唯一的主線,智能本身就是最大的應用。所以我們還是要圍繞智能本身去投入和思考。

廣密30:31

我覺得組織和文化的競爭力 是僅次於算力的核心競爭力

組織和文化的競爭力,是僅次於算力的核心競爭力。

廣密1:42:38

我覺得科技投資不是混 能混出來的 很多VC Investor 其實喜歡混圈子 我覺得其實混圈子 沒有意義 我覺得天花板是很低的 我覺得還是得靠創造

科技投資不是靠混能混出來的。很多VC Investor喜歡混圈子,混圈子沒有意義,天花板很低。還是得靠創造。

廣密1:55:52

數字與實體

Cursor 的 AR 命令數超過 150 個,年底可能 4 到 500 個16:19
Manus 平均一個任務消耗 Token七八十萬個46:40
Anthropic 最新估值615 億美金1:39:34
Mira 新公司估值100 億1:39:34
Elia 公司估值310 億1:39:34
OpenAI 融資額400 億美金1:23:15

術語

Pretraining預訓練
決定模型內在上限、能湧現新能力的訓練階段。
Post Training後訓練
在預訓練之後對模型進行加強和激發的訓練階段。
RL強化學習
通過獎勵信號加強模型能力,但不湧現新能力。
Tool Use工具調用
模型調用外部工具完成任務的能力,Agent 的關鍵能力之一。
Long Context長上下文
模型一次能處理很長的序列信息,Agent 多步驟任務的關鍵。
Online Learning在線學習
讓模型自主在線探索和學習,可能是下一個範式級路線。

收聽指南

誰該聽

關注全球大模型格局的創業者、投資人和工程師;想理解預訓練與 Agent 路線分歧、以及模型公司競爭判斷的人。

可跳過

1:54:32 之後的中美格局與全球化討論,信息密度較低。