开源模型会赢,vLLM 是 AI 推理的 Linux
vLLM 已是 GitHub 最活跃的开源项目,但游凯超真正的判断是:模型能力无法长期隐藏,开源模型终将胜出,而推理引擎是下一个 Linux——护城河是快速迭代,不是模型本身。
核心论点 · 点时间戳可跳到原声
从算法转向系统的三个原因
游凯超离开算法研究有三个递进原因:一是学术会议投稿量几何级增长,审稿质量下降,投稿像抽彩票;二是发现算法成果高度依赖机器学习系统,何恺明的 ResNet 背后是大规模实验,而实验室小数据只能「螺丝壳里做道场」;三是工业界朋友反馈,旷视工程师最头疼的是硬件多级缓存,而非调参。三者共同推动他从算法转向系统。
— 游凯超不成立公司项目会凉
导师认为 vLLM 没有公司支撑一定会凉,就像 Linux 没有 Red Hat、Ubuntu 没有 Google、PyTorch 没有 Meta 的支持走不到今天。开源社区不是法律实体:签 NDA 找不到签字人,大公司捐赠算力只能给一台机器,集群级优化只能四处乞讨且随时被收回。游凯超在 24 年底就决定创业,为此接了博士后 offer 等待两年,并不断内部呼吁「要是有一家公司多好」。
— 游凯超仁慈独裁与删掉 beam search
vLLM 采用分级治理:几个「仁慈的独裁者」最终拍板,十来个核心维护者负责关键模块,几十个 committer 写代码。游凯超做过的强硬决策是删掉 beam search 功能,尽管推荐系统用户持续抱怨,但他判断主流 AI 推理已不依赖束搜索,继续维护只会增加不可维护的复杂度。这种取舍能力是开源项目定优先级的关键。
— 游凯超GitHub 最活跃项目被垃圾 PR 污染
2025 年 GitHub 按贡献者活跃度排序,vLLM 是最活跃的项目。这带来「幸福的烦恼」:培训机构通过提交垃圾 PR 包装学员简历,10 分钟提交 20 个 PR 的机器人账号出现,打破了「社区用户都是善意的」假设。维护者不得不引入认证机制、拉黑机器人。随着 coding agent 发展,代码变得廉价,维护者看 PR 不如自己重写,社区正变成维护者加用户的两层结构。
— 游凯超模型与系统的协同设计
他用水力发电类比:硬件是自然资源,模型是发电机,推理引擎是电力系统。同样的水流,发电机设计不同效率天差地别,这就是 co-design。他指出「hardware lottery」现象:摩尔定律失效后,算力提升来自专用芯片,模型结构若不适配硬件就吃不到红利。Transformer 抽中 GPU 彩票,RoPE 因为不修改 attention kernel 而成为最佳搭档。DeepSeek 的强项正是算法同学懂系统,比如 MOE 的粗粒度到细粒度探索都靠自家推理引擎先实现。
— 游凯超Token 带着模型的烙印
电是通用商品,可以调制电压频率统一标准;token 却不同,你不能把 DeepSeek 的 token 转成 Kimi 的 token,它带着模型的烙印。所以模型结构五花八门,推理引擎必须支持两三百种结构,同时不断删减不必要的复杂度。这也解释了为什么开源模型会赢:模型一旦大规模使用,用户数据就能训练新模型,模型能力无法长期隐藏。
— 游凯超hot take:百万级上下文够了
游凯超给出两个预测:一是与人打交道的模型上下文需求基本停在百万级,生物化学等特殊领域才需要千万级甚至亿级,长任务可交给外部工具;二是开源模型最后会赢,因为模型不像核武器可以藏着威慑,它需要大规模使用,而使用就会积累数据,复制出新的模型。因此护城河不是模型能力,而是快速迭代。
— 游凯超原话 · 已逐字校验
你如果不跟我们一起创业。 你赚到了很多钱,但是十年之后,为我们项目失败了,你是开心还是还是不开心啊
你如果不跟我们一起创业,你赚到了很多钱,但十年之后,如果 vLLM 项目失败了,你是开心还是不开心?
游凯超1:15:25
我们想为接下来的这个智能时代。 打好这个基础设施。
我们想为接下来的智能时代打好基础设施。
游凯超1:16:25
token它是没有办法去做调制的。 就是你没有办法说把一个D模型的token转化为一个kimi的 token,这个token它是带着模型的烙印的。
token 是没有办法调制的。你没有办法把 DeepSeek 模型的 token 转化为 Kimi 的 token,这个 token 带着模型的烙印。
游凯超2:17:56
数字与实体
| 公司种子轮融资 | 1.5 亿美元 | 0:00 |
| 高考超出清华录取线 | 2 分 | 6:16 |
| 本科 4.0 成绩的课程数 | 36 门 | 7:17 |
| vLLM 开源时间 | 2023 年 6 月左右 | 38:18 |
| GitHub 贡献者活跃度排名 | 第 1 | 1:24:55 |
| 公司当前人数 | 30 多人,接近 40 | 1:50:11 |
术语
- PagedAttention分页注意力
- 把 KV cache 分成固定大小的块来管理,减少显存碎片,是 vLLM 的核心算法。
- KV Cache键值缓存
- 自回归生成中缓存历史 token 的键和值,避免重复计算。
- Speculative Decoding投机解码
- 先并行猜测多个 token,再一次性验证,加速自回归解码。
- MOE混合专家
- 每个 token 只激活少量专家,以更少计算量扩展模型参数。
- BYOC带上自己的云
- 客户提供机器,公司提供软件和推理服务,按 token 计费的模式。
收听指南
适合关注开源治理、AI Infra 创业、模型与系统协同设计的创业者、投资人和工程师。
前半小时求学经历可略听,37 分钟后开源与 Co-design 干货更密。