開源模型會贏,vLLM 是 AI 推理的 Linux
vLLM 已是 GitHub 最活躍的開源項目,但遊凱超真正的判斷是:模型能力無法長期隱藏,開源模型終將勝出,而推理引擎是下一個 Linux——護城河是快速迭代,不是模型本身。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
從算法轉向系統的三個原因
遊凱超離開算法研究有三個遞進原因:一是學術會議投稿量幾何級增長,審稿質量下降,投稿像抽彩票;二是發現算法成果高度依賴機器學習系統,何愷明的 ResNet 背後是大規模實驗,而實驗室小數據只能「螺絲殼裡做道場」;三是工業界朋友反饋,曠視工程師最頭疼的是硬件多級緩存,而非調參。三者共同推動他從算法轉向系統。
— 遊凱超不成立公司項目會涼
導師認為 vLLM 沒有公司支撐一定會涼,就像 Linux 沒有 Red Hat、Ubuntu 沒有 Google、PyTorch 沒有 Meta 的支持走不到今天。開源社區不是法律實體:籤 NDA 找不到簽字人,大公司捐贈算力只能給一臺機器,集群級優化只能四處乞討且隨時被收回。遊凱超在 24 年底就決定創業,為此接了博士後 offer 等待兩年,並不斷內部呼籲「要是有一家公司多好」。
— 遊凱超仁慈獨裁與刪掉 beam search
vLLM 採用分級治理:幾個「仁慈的獨裁者」最終拍板,十來個核心維護者負責關鍵模塊,幾十個 committer 寫代碼。遊凱超做過的強硬決策是刪掉 beam search 功能,儘管推薦系統用戶持續抱怨,但他判斷主流 AI 推理已不依賴束搜索,繼續維護只會增加不可維護的複雜度。這種取捨能力是開源項目定優先級的關鍵。
— 遊凱超GitHub 最活躍項目被垃圾 PR 汙染
2025 年 GitHub 按貢獻者活躍度排序,vLLM 是最活躍的項目。這帶來「幸福的煩惱」:培訓機構通過提交垃圾 PR 包裝學員簡歷,10 分鐘提交 20 個 PR 的機器人賬號出現,打破了「社區用戶都是善意的」假設。維護者不得不引入認證機制、拉黑機器人。隨著 coding agent 發展,代碼變得廉價,維護者看 PR 不如自己重寫,社區正變成維護者加用戶的兩層結構。
— 遊凱超模型與系統的協同設計
他用水力發電類比:硬件是自然資源,模型是發電機,推理引擎是電力系統。同樣的水流,發電機設計不同效率天差地別,這就是 co-design。他指出「hardware lottery」現象:摩爾定律失效後,算力提升來自專用芯片,模型結構若不適配硬件就吃不到紅利。Transformer 抽中 GPU 彩票,RoPE 因為不修改 attention kernel 而成為最佳搭檔。DeepSeek 的強項正是算法同學懂系統,比如 MOE 的粗粒度到細粒度探索都靠自家推理引擎先實現。
— 遊凱超Token 帶著模型的烙印
電是通用商品,可以調製電壓頻率統一標準;token 卻不同,你不能把 DeepSeek 的 token 轉成 Kimi 的 token,它帶著模型的烙印。所以模型結構五花八門,推理引擎必須支持兩三百種結構,同時不斷刪減不必要的複雜度。這也解釋了為什麼開源模型會贏:模型一旦大規模使用,用戶數據就能訓練新模型,模型能力無法長期隱藏。
— 遊凱超hot take:百萬級上下文夠了
遊凱超給出兩個預測:一是與人打交道的模型上下文需求基本停在百萬級,生物化學等特殊領域才需要千萬級甚至億級,長任務可交給外部工具;二是開源模型最後會贏,因為模型不像核武器可以藏著威懾,它需要大規模使用,而使用就會積累數據,複製出新的模型。因此護城河不是模型能力,而是快速迭代。
— 遊凱超原話 · 已逐字校驗
你如果不跟我們一起創業。 你賺到了很多錢,但是十年之後,為我們項目失敗了,你是開心還是還是不開心啊
你如果不跟我們一起創業,你賺到了很多錢,但十年之後,如果 vLLM 項目失敗了,你是開心還是不開心?
遊凱超1:15:25
我們想為接下來的這個智能時代。 打好這個基礎設施。
我們想為接下來的智能時代打好基礎設施。
遊凱超1:16:25
token它是沒有辦法去做調製的。 就是你沒有辦法說把一個D模型的token轉化為一個kimi的 token,這個token它是帶著模型的烙印的。
token 是沒有辦法調製的。你沒有辦法把 DeepSeek 模型的 token 轉化為 Kimi 的 token,這個 token 帶著模型的烙印。
遊凱超2:17:56
數字與實體
| 公司種子輪融資 | 1.5 億美元 | 0:00 |
| 高考超出清華錄取線 | 2 分 | 6:16 |
| 本科 4.0 成績的課程數 | 36 門 | 7:17 |
| vLLM 開源時間 | 2023 年 6 月左右 | 38:18 |
| GitHub 貢獻者活躍度排名 | 第 1 | 1:24:55 |
| 公司當前人數 | 30 多人,接近 40 | 1:50:11 |
術語
- PagedAttention分頁注意力
- 把 KV cache 分成固定大小的塊來管理,減少顯存碎片,是 vLLM 的核心算法。
- KV Cache鍵值緩存
- 自迴歸生成中緩存歷史 token 的鍵和值,避免重複計算。
- Speculative Decoding投機解碼
- 先並行猜測多個 token,再一次性驗證,加速自迴歸解碼。
- MOE混合專家
- 每個 token 只激活少量專家,以更少計算量擴展模型參數。
- BYOC帶上自己的雲
- 客戶提供機器,公司提供軟件和推理服務,按 token 計費的模式。
收聽指南
適合關注開源治理、AI Infra 創業、模型與系統協同設計的創業者、投資人和工程師。
前半小時求學經歷可略聽,37 分鐘後開源與 Co-design 乾貨更密。