企業最終八成 token 走開源模型,但只花兩成預算
開源模型和閉源前沿模型不是替代關係:絕大多數 token 會走開源,最難的活留給前沿實驗室,中間靠路由和編排把兩者接起來。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
開源模型的驅動力不是省錢,是控制權
Jeff 說成本是開源模型能立刻解決的最大痛點,但企業的北極星是「更好地控制 AI 併為自己定製」。成本只是短期可解的那一環,解開之後才輪到按自己的用例定製模型。這個順序很重要:如果只把開源當成降本手段,就會誤判它為什麼在 Fortune 500 裡擴散得這麼快。AT&T 已經把 40% 的 token 消耗遷到開源模型上,目前主要走美國和歐洲的模型,同時也在評估中國模型。
— Jeffrey Morgan兩個拐點:編碼 agent,然後是 OpenClaw
Ollama 雲端的人均 token 用量曲線有兩個明顯拐點。第一個在年初,由編碼 agent 驅動——Kimi、GLM、MiniMax 相繼發布,開源模型第一次能撐起編碼 agent。第二個在四月,由 OpenClaw 帶來,用戶從開發者擴展到非開發者:財務、客服、市場、銷售都能把一個難題丟給開源模型讓它自己跑完,過程中要挑工具、取數據,token 消耗極大。上下文窗口從 128K 漲到一百萬以上,是這波爆發的技術前提。
— Jeffrey Morgan模型發布日是一場 24 小時的消防演習
Ollama 是模型廠商發布前的協調渠道,但 Jeff 說真正能提前幾週拿到模型就算幸運,大部分工作擠在發布前最後 24 小時完成。要同時搞定三件事:推理引擎支持(常常是數週的工作,要保證快、準、與參考實現一致)、配套的 harness(Codex、OpenCode 這類開源 harness 現在很多)、以及硬件與推理提供方的容量——發布日通常是增長最大的一天。他把這比作操作系統:驅動、推理層、應用運行時全都要粘起來,是個組合爆炸的問題。
— Jeffrey Morgantoken 之上才是新的稀缺
Jeff 引用 Anthropic 平臺團隊的三個方向:knowledge(把公司數據和上下文接進模型)、coordination(一次請求會派生出一堆子 agent,有的在雲上有的在本地,需要調度)、execution(沙箱和算力)。他的判斷是:token 已經過剩,幾十家開源模型提供方都能供,稀缺的是 token 之上怎麼把 agent 從 A 編排到 B。參照雲計算的路徑,開發者最終偏好每一層都有最好的獨立產品,而不是打包在一起的 Heroku 或 Google App Engine。
— Jeffrey Morgan有狀態的東西不會沉進模型層
被問到 harness 會不會被模型吸收,Jeff 的判斷是:核心循環和 hook 會下沉到模型裡,但有幾類東西出不來。一是狀態問題——模型訓練是按月跑的,永遠追不上最新數據,所以存儲是個巨大的獨立問題空間。二是憑據管理和安全。開源模型不像閉源提供方那樣自帶一整套安全工具,而這對企業採用至關重要。這解釋了為什麼模型越強,中間層反而越多。
— Jeffrey Morgan八成 token 走開源,但只花兩成預算
Jeff 給出的穩態判斷:企業內部絕大多數 token——他給的數字是 80% 到 90%——會走開源模型,但這不代表 80% 到 90% 的預算流向開源。開源社區在把成本壓到極低,所以可能只有 10% 到 20% 的花費落在開源上。最難的活留給前沿實驗室,因為最好的研究者在那裡;中間一大片是開源和閉源組合起來做。他用律所打比方:合夥人把活分給一堆 associate。
— Jeffrey Morgan本地和雲端的模型構成完全不是一回事
本地模型上,美國和中國的模型基本並駕齊驅;雲端託管模型上,幾乎清一色是中國模型。Jeff 說本地是美、歐、中三方混合,雲端編碼 agent 則以中國模型為主。用例分工也清楚:編碼 agent 寫代碼、寫測試,難題多,主要靠雲端大模型;文檔處理這類端到端難度低的工作流在本地跑得很好。所以是混合執行模型——簡單任務本地跑,加一個路由決定什麼時候該上大模型。
— Jeffrey MorganFlash 這一檔模型才是無限 token 的前提
Jeff 說年初開源模型剛追到智能前沿,和閉源前沿的差距不到 3 個月,下一個要解決的問題是極致效率。DeepSeek Flash 這類模型的關鍵指標不只是每 token 成本低,而是每任務成本低。這類模型對 80% 的任務夠用、快、極便宜,會成為幹粗活的 workhorse。他回憶 ChatGPT 時代大家不用想 token 用量,最終會回到那種狀態,但需要模型架構專門為高 token 量定製訓練。Ollama 雲上增長最快的正是 DeepSeek 這一支,主要由 Flash 的採用推動。
— Jeffrey Morgan兩年找不到問題,比沒有熱度更可怕
Jeff 說 2021 年進 YC 時寫的方向是「Kubernetes 的 Kitematic」或「Kubernetes 的 Docker Desktop」,做 Kubernetes 的 SSO 這類安全產品。公司 2021 年進 YC,Ollama 直到 2023 年 7 月才發布,中間隔了兩年多。他說最嚇人的不是有沒有熱度,而是「你甚至看不到北極星」——客戶通常是好的北極星,看不到它更可怕。團隊當時超過 10 人,他特別感謝這批人陪著走過了幾次轉型。
— Jeffrey Morgan兩週做出第一版,Llama 2 恰好發布
轉型的觸發點是在多倫多的一次全員討論:如果今天從零開始會做什麼。他們看到兩個問題——一是做一個訪問任意模型的網關(當時類比成 LLM 領域的 Segment,也就是後來的 router 思路),二是他們這批前 VMware、前 Docker 的人擅長讓東西跑起來,那就讓開源模型跑起來。他們給自己兩週做第一版,Llama 2 正好在兩週結束時發布,於是直接上線。Jeff 說這是 bias to action,兩週內從想法到發布,用戶量超過之前所有產品。
— Jeffrey Morgan免費和隨處可跑,讓愛好者的工具直接進了財富 500
Jeff 說最讓他們意外的是從愛好者到 Fortune 500 的速度。原因有兩個:開源模型免費起步,而且可以在任何地方跑——這對 Fortune 500 的 IT 開發者團隊極其關鍵,因為他們不需要申請許可就能用。對愛好者好的東西,直接翻譯成了企業內開發者的好東西。他拿數據庫類比:MongoDB 也是從開發者走向企業,但 LLM 是無狀態的,這個過渡比數據庫還容易。
— Jeffrey Morgan基礎設施時代的規則在 AI 裡失效了
Jeff 舉了兩個必須打破的舊肌肉記憶。一是「做在別人之上的層很危險」——這在基礎設施時代成立,在 AI 時代不成立,往棧上走反而可能更好,因為離客戶更近。二是系統世界裡要求一切按設計精確運行、經過測試和驗證,而 LLM 按定義就不是這樣,這是特性不是 bug。他還提到團隊規模:有些問題現在不需要那麼多人,比如客服管線、交付雲服務的方式,以及「沒有哪個工程師知道全部代碼怎麼工作」這件事本身。
— Jeffrey Morgan原話 · 已逐字校驗
I think the biggest thing we're seeing is a shift to open models, especially in enterprise and that's from a mix of US and and Chinese origin models and it's predominantly driven by coding agents and also AI assistants more co-work cases like openclaw and Hermes
我們看到的最大變化是企業向開源模型的遷移,來源是美國和中國模型的混合,主要由編碼 agent 驅動,也有 OpenClaw 和 Hermes 這類協作型 AI 助手。
Jeffrey Morgan1:03
Cost is by far the largest pain point that open models can jump in and solve but you know every business has a vision of getting better control over AI and customizing it for their business and that's really their north star.
成本顯然是開源模型能立刻切入並解決的最大痛點,但每家企業都有一個願景:更好地控制 AI,併為自己的業務定製它,那才是他們真正的北極星。
Jeffrey Morgan2:04
The new scarcity the problems now are what's above the tokens right? You know how do you orchestrate an agent from you know A to B.
新的稀缺、現在的問題,是 token 之上的東西,對吧?就是你怎麼把一個 agent 從 A 編排到 B。
Jeffrey Morgan15:12
The super majority of tokens and this is our take it will be open models within a business. Call it 80 90%.
我們的判斷是,企業內部絕大多數 token 會走開源模型,就說 80% 到 90% 吧。
Jeffrey Morgan18:15
It's also low cost per task which is a really important metric and that class of models in my mind will be the first ones that come down to this idea of like unlimited tokens.
它的每任務成本也很低,這是個非常重要的指標,在我看來這一類模型會最先落到「無限 token」這個想法上。
Jeffrey Morgan29:25
being lost in the wilderness like what's your north star that customers are generally a great north star, but not seeing the north star is even scarier, right?
迷失在荒野裡,你的北極星是什麼?客戶通常是很好的北極星,但看不到北極星更可怕,對吧?
Jeffrey Morgan41:30
there's this concept that if you're a layer on top of something else that you're in kind of a vulnerable position as a startup which is absolutely not true in the eye world and in fact going up the stack can sometimes be even better because you're closer to the customer.
有一種觀念認為,如果你做在別的東西之上的一層,作為創業公司就很脆弱——這在 AI 世界裡絕對不成立,事實上往棧上走有時反而更好,因為你離客戶更近。
Jeffrey Morgan53:38
數字與實體
| Ollama 開發者數 | 900 萬 | 1:03 |
| Ollama GitHub stars | 178,000 | 1:03 |
| Fortune 500 中使用 Ollama 的比例 | 85% | 1:03 |
| AT&T 已遷移到開源模型的 token 消耗佔比 | 40% | 2:04 |
| 開源模型與閉源前沿模型的差距 | 不到 3 個月 | 29:25 |
| Ollama 雲端 token 用量自年初增長 | 150 倍 | 4:05 |
| DGX Spark 統一內存 | 128 GB | 25:22 |
| 本地可運行的模型參數區間 | 200 億到 400 億,部分到 1280 億 | 21:18 |
| 企業內部走開源模型的 token 佔比預期 | 80% 到 90% | 18:15 |
術語
- harness執行框架
- 把模型能力接到具體任務上的外層代碼,負責工具調用和循環。
- open weights開放權重
- 模型參數可下載自部署,與只提供 API 的閉源模型相對。
- router路由
- 在多個模型間按任務難度和成本分派請求的中間層。
- MLX蘋果機器學習框架
- Apple 的本地推理技術棧,用於在 Mac 上跑大模型。
- DGX Spark英偉達桌面 AI 工作站
- 可放在桌上、能跑 200 億到 1200 億參數模型的設備。
收聽指南
做 AI 應用和 agent 的創業者、負責企業 AI 採購與架構的工程師,以及想判斷開源模型商業化路徑的投資人。
開頭一分鐘的節目介紹和結尾的 YC 招募口播可跳過。