世界太吵,来原声听播客

张小珺·商业访谈录

开源模型会赢,vLLM 是 AI 推理的 Linux

vLLM 已是 GitHub 最活跃的开源项目,但游凯超真正的判断是:模型能力无法长期隐藏,开源模型终将胜出,而推理引擎是下一个 Linux——护城河是快速迭代,不是模型本身。

开源AI InfravLLM模型推理创业Co-design
信息密度高,尤其后半段对开源治理、模型与系统协同设计的判断值得创业者细读;节奏偏长,但无口水话。

核心论点 · 点时间戳可跳到原声

8:20

从算法转向系统的三个原因

游凯超离开算法研究有三个递进原因:一是学术会议投稿量几何级增长,审稿质量下降,投稿像抽彩票;二是发现算法成果高度依赖机器学习系统,何恺明的 ResNet 背后是大规模实验,而实验室小数据只能「螺丝壳里做道场」;三是工业界朋友反馈,旷视工程师最头疼的是硬件多级缓存,而非调参。三者共同推动他从算法转向系统。

— 游凯超
1:07:12

不成立公司项目会凉

导师认为 vLLM 没有公司支撑一定会凉,就像 Linux 没有 Red Hat、Ubuntu 没有 Google、PyTorch 没有 Meta 的支持走不到今天。开源社区不是法律实体:签 NDA 找不到签字人,大公司捐赠算力只能给一台机器,集群级优化只能四处乞讨且随时被收回。游凯超在 24 年底就决定创业,为此接了博士后 offer 等待两年,并不断内部呼吁「要是有一家公司多好」。

— 游凯超
1:20:36

仁慈独裁与删掉 beam search

vLLM 采用分级治理:几个「仁慈的独裁者」最终拍板,十来个核心维护者负责关键模块,几十个 committer 写代码。游凯超做过的强硬决策是删掉 beam search 功能,尽管推荐系统用户持续抱怨,但他判断主流 AI 推理已不依赖束搜索,继续维护只会增加不可维护的复杂度。这种取舍能力是开源项目定优先级的关键。

— 游凯超
1:24:55

GitHub 最活跃项目被垃圾 PR 污染

2025 年 GitHub 按贡献者活跃度排序,vLLM 是最活跃的项目。这带来「幸福的烦恼」:培训机构通过提交垃圾 PR 包装学员简历,10 分钟提交 20 个 PR 的机器人账号出现,打破了「社区用户都是善意的」假设。维护者不得不引入认证机制、拉黑机器人。随着 coding agent 发展,代码变得廉价,维护者看 PR 不如自己重写,社区正变成维护者加用户的两层结构。

— 游凯超
1:53:27

模型与系统的协同设计

他用水力发电类比:硬件是自然资源,模型是发电机,推理引擎是电力系统。同样的水流,发电机设计不同效率天差地别,这就是 co-design。他指出「hardware lottery」现象:摩尔定律失效后,算力提升来自专用芯片,模型结构若不适配硬件就吃不到红利。Transformer 抽中 GPU 彩票,RoPE 因为不修改 attention kernel 而成为最佳搭档。DeepSeek 的强项正是算法同学懂系统,比如 MOE 的粗粒度到细粒度探索都靠自家推理引擎先实现。

— 游凯超
2:17:56

Token 带着模型的烙印

电是通用商品,可以调制电压频率统一标准;token 却不同,你不能把 DeepSeek 的 token 转成 Kimi 的 token,它带着模型的烙印。所以模型结构五花八门,推理引擎必须支持两三百种结构,同时不断删减不必要的复杂度。这也解释了为什么开源模型会赢:模型一旦大规模使用,用户数据就能训练新模型,模型能力无法长期隐藏。

— 游凯超
2:36:07

hot take:百万级上下文够了

游凯超给出两个预测:一是与人打交道的模型上下文需求基本停在百万级,生物化学等特殊领域才需要千万级甚至亿级,长任务可交给外部工具;二是开源模型最后会赢,因为模型不像核武器可以藏着威慑,它需要大规模使用,而使用就会积累数据,复制出新的模型。因此护城河不是模型能力,而是快速迭代。

— 游凯超

原话 · 已逐字校验

你如果不跟我们一起创业。 你赚到了很多钱,但是十年之后,为我们项目失败了,你是开心还是还是不开心啊

你如果不跟我们一起创业,你赚到了很多钱,但十年之后,如果 vLLM 项目失败了,你是开心还是不开心?

游凯超1:15:25

我们想为接下来的这个智能时代。 打好这个基础设施。

我们想为接下来的智能时代打好基础设施。

游凯超1:16:25

token它是没有办法去做调制的。 就是你没有办法说把一个D模型的token转化为一个kimi的 token,这个token它是带着模型的烙印的。

token 是没有办法调制的。你没有办法把 DeepSeek 模型的 token 转化为 Kimi 的 token,这个 token 带着模型的烙印。

游凯超2:17:56

数字与实体

公司种子轮融资1.5 亿美元0:00
高考超出清华录取线2 分6:16
本科 4.0 成绩的课程数36 门7:17
vLLM 开源时间2023 年 6 月左右38:18
GitHub 贡献者活跃度排名第 11:24:55
公司当前人数30 多人,接近 401:50:11

术语

PagedAttention分页注意力
把 KV cache 分成固定大小的块来管理,减少显存碎片,是 vLLM 的核心算法。
KV Cache键值缓存
自回归生成中缓存历史 token 的键和值,避免重复计算。
Speculative Decoding投机解码
先并行猜测多个 token,再一次性验证,加速自回归解码。
MOE混合专家
每个 token 只激活少量专家,以更少计算量扩展模型参数。
BYOC带上自己的云
客户提供机器,公司提供软件和推理服务,按 token 计费的模式。

收听指南

谁该听

适合关注开源治理、AI Infra 创业、模型与系统协同设计的创业者、投资人和工程师。

可跳过

前半小时求学经历可略听,37 分钟后开源与 Co-design 干货更密。