企业最终八成 token 走开源模型,但只花两成预算
开源模型和闭源前沿模型不是替代关系:绝大多数 token 会走开源,最难的活留给前沿实验室,中间靠路由和编排把两者接起来。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
开源模型的驱动力不是省钱,是控制权
Jeff 说成本是开源模型能立刻解决的最大痛点,但企业的北极星是「更好地控制 AI 并为自己定制」。成本只是短期可解的那一环,解开之后才轮到按自己的用例定制模型。这个顺序很重要:如果只把开源当成降本手段,就会误判它为什么在 Fortune 500 里扩散得这么快。AT&T 已经把 40% 的 token 消耗迁到开源模型上,目前主要走美国和欧洲的模型,同时也在评估中国模型。
— Jeffrey Morgan两个拐点:编码 agent,然后是 OpenClaw
Ollama 云端的人均 token 用量曲线有两个明显拐点。第一个在年初,由编码 agent 驱动——Kimi、GLM、MiniMax 相继发布,开源模型第一次能撑起编码 agent。第二个在四月,由 OpenClaw 带来,用户从开发者扩展到非开发者:财务、客服、市场、销售都能把一个难题丢给开源模型让它自己跑完,过程中要挑工具、取数据,token 消耗极大。上下文窗口从 128K 涨到一百万以上,是这波爆发的技术前提。
— Jeffrey Morgan模型发布日是一场 24 小时的消防演习
Ollama 是模型厂商发布前的协调渠道,但 Jeff 说真正能提前几周拿到模型就算幸运,大部分工作挤在发布前最后 24 小时完成。要同时搞定三件事:推理引擎支持(常常是数周的工作,要保证快、准、与参考实现一致)、配套的 harness(Codex、OpenCode 这类开源 harness 现在很多)、以及硬件与推理提供方的容量——发布日通常是增长最大的一天。他把这比作操作系统:驱动、推理层、应用运行时全都要粘起来,是个组合爆炸的问题。
— Jeffrey Morgantoken 之上才是新的稀缺
Jeff 引用 Anthropic 平台团队的三个方向:knowledge(把公司数据和上下文接进模型)、coordination(一次请求会派生出一堆子 agent,有的在云上有的在本地,需要调度)、execution(沙箱和算力)。他的判断是:token 已经过剩,几十家开源模型提供方都能供,稀缺的是 token 之上怎么把 agent 从 A 编排到 B。参照云计算的路径,开发者最终偏好每一层都有最好的独立产品,而不是打包在一起的 Heroku 或 Google App Engine。
— Jeffrey Morgan有状态的东西不会沉进模型层
被问到 harness 会不会被模型吸收,Jeff 的判断是:核心循环和 hook 会下沉到模型里,但有几类东西出不来。一是状态问题——模型训练是按月跑的,永远追不上最新数据,所以存储是个巨大的独立问题空间。二是凭据管理和安全。开源模型不像闭源提供方那样自带一整套安全工具,而这对企业采用至关重要。这解释了为什么模型越强,中间层反而越多。
— Jeffrey Morgan八成 token 走开源,但只花两成预算
Jeff 给出的稳态判断:企业内部绝大多数 token——他给的数字是 80% 到 90%——会走开源模型,但这不代表 80% 到 90% 的预算流向开源。开源社区在把成本压到极低,所以可能只有 10% 到 20% 的花费落在开源上。最难的活留给前沿实验室,因为最好的研究者在那里;中间一大片是开源和闭源组合起来做。他用律所打比方:合伙人把活分给一堆 associate。
— Jeffrey Morgan本地和云端的模型构成完全不是一回事
本地模型上,美国和中国的模型基本并驾齐驱;云端托管模型上,几乎清一色是中国模型。Jeff 说本地是美、欧、中三方混合,云端编码 agent 则以中国模型为主。用例分工也清楚:编码 agent 写代码、写测试,难题多,主要靠云端大模型;文档处理这类端到端难度低的工作流在本地跑得很好。所以是混合执行模型——简单任务本地跑,加一个路由决定什么时候该上大模型。
— Jeffrey MorganFlash 这一档模型才是无限 token 的前提
Jeff 说年初开源模型刚追到智能前沿,和闭源前沿的差距不到 3 个月,下一个要解决的问题是极致效率。DeepSeek Flash 这类模型的关键指标不只是每 token 成本低,而是每任务成本低。这类模型对 80% 的任务够用、快、极便宜,会成为干粗活的 workhorse。他回忆 ChatGPT 时代大家不用想 token 用量,最终会回到那种状态,但需要模型架构专门为高 token 量定制训练。Ollama 云上增长最快的正是 DeepSeek 这一支,主要由 Flash 的采用推动。
— Jeffrey Morgan两年找不到问题,比没有热度更可怕
Jeff 说 2021 年进 YC 时写的方向是「Kubernetes 的 Kitematic」或「Kubernetes 的 Docker Desktop」,做 Kubernetes 的 SSO 这类安全产品。公司 2021 年进 YC,Ollama 直到 2023 年 7 月才发布,中间隔了两年多。他说最吓人的不是有没有热度,而是「你甚至看不到北极星」——客户通常是好的北极星,看不到它更可怕。团队当时超过 10 人,他特别感谢这批人陪着走过了几次转型。
— Jeffrey Morgan两周做出第一版,Llama 2 恰好发布
转型的触发点是在多伦多的一次全员讨论:如果今天从零开始会做什么。他们看到两个问题——一是做一个访问任意模型的网关(当时类比成 LLM 领域的 Segment,也就是后来的 router 思路),二是他们这批前 VMware、前 Docker 的人擅长让东西跑起来,那就让开源模型跑起来。他们给自己两周做第一版,Llama 2 正好在两周结束时发布,于是直接上线。Jeff 说这是 bias to action,两周内从想法到发布,用户量超过之前所有产品。
— Jeffrey Morgan免费和随处可跑,让爱好者的工具直接进了财富 500
Jeff 说最让他们意外的是从爱好者到 Fortune 500 的速度。原因有两个:开源模型免费起步,而且可以在任何地方跑——这对 Fortune 500 的 IT 开发者团队极其关键,因为他们不需要申请许可就能用。对爱好者好的东西,直接翻译成了企业内开发者的好东西。他拿数据库类比:MongoDB 也是从开发者走向企业,但 LLM 是无状态的,这个过渡比数据库还容易。
— Jeffrey Morgan基础设施时代的规则在 AI 里失效了
Jeff 举了两个必须打破的旧肌肉记忆。一是「做在别人之上的层很危险」——这在基础设施时代成立,在 AI 时代不成立,往栈上走反而可能更好,因为离客户更近。二是系统世界里要求一切按设计精确运行、经过测试和验证,而 LLM 按定义就不是这样,这是特性不是 bug。他还提到团队规模:有些问题现在不需要那么多人,比如客服管线、交付云服务的方式,以及「没有哪个工程师知道全部代码怎么工作」这件事本身。
— Jeffrey Morgan原话 · 已逐字校验
I think the biggest thing we're seeing is a shift to open models, especially in enterprise and that's from a mix of US and and Chinese origin models and it's predominantly driven by coding agents and also AI assistants more co-work cases like openclaw and Hermes
我们看到的最大变化是企业向开源模型的迁移,来源是美国和中国模型的混合,主要由编码 agent 驱动,也有 OpenClaw 和 Hermes 这类协作型 AI 助手。
Jeffrey Morgan1:03
Cost is by far the largest pain point that open models can jump in and solve but you know every business has a vision of getting better control over AI and customizing it for their business and that's really their north star.
成本显然是开源模型能立刻切入并解决的最大痛点,但每家企业都有一个愿景:更好地控制 AI,并为自己的业务定制它,那才是他们真正的北极星。
Jeffrey Morgan2:04
The new scarcity the problems now are what's above the tokens right? You know how do you orchestrate an agent from you know A to B.
新的稀缺、现在的问题,是 token 之上的东西,对吧?就是你怎么把一个 agent 从 A 编排到 B。
Jeffrey Morgan15:12
The super majority of tokens and this is our take it will be open models within a business. Call it 80 90%.
我们的判断是,企业内部绝大多数 token 会走开源模型,就说 80% 到 90% 吧。
Jeffrey Morgan18:15
It's also low cost per task which is a really important metric and that class of models in my mind will be the first ones that come down to this idea of like unlimited tokens.
它的每任务成本也很低,这是个非常重要的指标,在我看来这一类模型会最先落到「无限 token」这个想法上。
Jeffrey Morgan29:25
being lost in the wilderness like what's your north star that customers are generally a great north star, but not seeing the north star is even scarier, right?
迷失在荒野里,你的北极星是什么?客户通常是很好的北极星,但看不到北极星更可怕,对吧?
Jeffrey Morgan41:30
there's this concept that if you're a layer on top of something else that you're in kind of a vulnerable position as a startup which is absolutely not true in the eye world and in fact going up the stack can sometimes be even better because you're closer to the customer.
有一种观念认为,如果你做在别的东西之上的一层,作为创业公司就很脆弱——这在 AI 世界里绝对不成立,事实上往栈上走有时反而更好,因为你离客户更近。
Jeffrey Morgan53:38
数字与实体
| Ollama 开发者数 | 900 万 | 1:03 |
| Ollama GitHub stars | 178,000 | 1:03 |
| Fortune 500 中使用 Ollama 的比例 | 85% | 1:03 |
| AT&T 已迁移到开源模型的 token 消耗占比 | 40% | 2:04 |
| 开源模型与闭源前沿模型的差距 | 不到 3 个月 | 29:25 |
| Ollama 云端 token 用量自年初增长 | 150 倍 | 4:05 |
| DGX Spark 统一内存 | 128 GB | 25:22 |
| 本地可运行的模型参数区间 | 200 亿到 400 亿,部分到 1280 亿 | 21:18 |
| 企业内部走开源模型的 token 占比预期 | 80% 到 90% | 18:15 |
术语
- harness执行框架
- 把模型能力接到具体任务上的外层代码,负责工具调用和循环。
- open weights开放权重
- 模型参数可下载自部署,与只提供 API 的闭源模型相对。
- router路由
- 在多个模型间按任务难度和成本分派请求的中间层。
- MLX苹果机器学习框架
- Apple 的本地推理技术栈,用于在 Mac 上跑大模型。
- DGX Spark英伟达桌面 AI 工作站
- 可放在桌上、能跑 200 亿到 1200 亿参数模型的设备。
收听指南
做 AI 应用和 agent 的创业者、负责企业 AI 采购与架构的工程师,以及想判断开源模型商业化路径的投资人。
开头一分钟的节目介绍和结尾的 YC 招募口播可跳过。