世界太吵,來原聲聽播客

張小珺·商業訪談錄

開源模型會贏,vLLM 是 AI 推理的 Linux

vLLM 已是 GitHub 最活躍的開源項目,但遊凱超真正的判斷是:模型能力無法長期隱藏,開源模型終將勝出,而推理引擎是下一個 Linux——護城河是快速迭代,不是模型本身。

開源AI InfravLLM模型推理創業Co-design

原視頻在 YouTube 上放不出來,用音頻聽:

信息密度高,尤其後半段對開源治理、模型與系統協同設計的判斷值得創業者細讀;節奏偏長,但無口水話。

核心論點 · 點時間戳可跳到原聲

8:20

從算法轉向系統的三個原因

遊凱超離開算法研究有三個遞進原因:一是學術會議投稿量幾何級增長,審稿質量下降,投稿像抽彩票;二是發現算法成果高度依賴機器學習系統,何愷明的 ResNet 背後是大規模實驗,而實驗室小數據只能「螺絲殼裡做道場」;三是工業界朋友反饋,曠視工程師最頭疼的是硬件多級緩存,而非調參。三者共同推動他從算法轉向系統。

— 遊凱超
1:07:12

不成立公司項目會涼

導師認為 vLLM 沒有公司支撐一定會涼,就像 Linux 沒有 Red Hat、Ubuntu 沒有 Google、PyTorch 沒有 Meta 的支持走不到今天。開源社區不是法律實體:籤 NDA 找不到簽字人,大公司捐贈算力只能給一臺機器,集群級優化只能四處乞討且隨時被收回。遊凱超在 24 年底就決定創業,為此接了博士後 offer 等待兩年,並不斷內部呼籲「要是有一家公司多好」。

— 遊凱超
1:20:36

仁慈獨裁與刪掉 beam search

vLLM 採用分級治理:幾個「仁慈的獨裁者」最終拍板,十來個核心維護者負責關鍵模塊,幾十個 committer 寫代碼。遊凱超做過的強硬決策是刪掉 beam search 功能,儘管推薦系統用戶持續抱怨,但他判斷主流 AI 推理已不依賴束搜索,繼續維護只會增加不可維護的複雜度。這種取捨能力是開源項目定優先級的關鍵。

— 遊凱超
1:24:55

GitHub 最活躍項目被垃圾 PR 汙染

2025 年 GitHub 按貢獻者活躍度排序,vLLM 是最活躍的項目。這帶來「幸福的煩惱」:培訓機構通過提交垃圾 PR 包裝學員簡歷,10 分鐘提交 20 個 PR 的機器人賬號出現,打破了「社區用戶都是善意的」假設。維護者不得不引入認證機制、拉黑機器人。隨著 coding agent 發展,代碼變得廉價,維護者看 PR 不如自己重寫,社區正變成維護者加用戶的兩層結構。

— 遊凱超
1:53:27

模型與系統的協同設計

他用水力發電類比:硬件是自然資源,模型是發電機,推理引擎是電力系統。同樣的水流,發電機設計不同效率天差地別,這就是 co-design。他指出「hardware lottery」現象:摩爾定律失效後,算力提升來自專用芯片,模型結構若不適配硬件就吃不到紅利。Transformer 抽中 GPU 彩票,RoPE 因為不修改 attention kernel 而成為最佳搭檔。DeepSeek 的強項正是算法同學懂系統,比如 MOE 的粗粒度到細粒度探索都靠自家推理引擎先實現。

— 遊凱超
2:17:56

Token 帶著模型的烙印

電是通用商品,可以調製電壓頻率統一標準;token 卻不同,你不能把 DeepSeek 的 token 轉成 Kimi 的 token,它帶著模型的烙印。所以模型結構五花八門,推理引擎必須支持兩三百種結構,同時不斷刪減不必要的複雜度。這也解釋了為什麼開源模型會贏:模型一旦大規模使用,用戶數據就能訓練新模型,模型能力無法長期隱藏。

— 遊凱超
2:36:07

hot take:百萬級上下文夠了

遊凱超給出兩個預測:一是與人打交道的模型上下文需求基本停在百萬級,生物化學等特殊領域才需要千萬級甚至億級,長任務可交給外部工具;二是開源模型最後會贏,因為模型不像核武器可以藏著威懾,它需要大規模使用,而使用就會積累數據,複製出新的模型。因此護城河不是模型能力,而是快速迭代。

— 遊凱超

原話 · 已逐字校驗

你如果不跟我們一起創業。 你賺到了很多錢,但是十年之後,為我們項目失敗了,你是開心還是還是不開心啊

你如果不跟我們一起創業,你賺到了很多錢,但十年之後,如果 vLLM 項目失敗了,你是開心還是不開心?

遊凱超1:15:25

我們想為接下來的這個智能時代。 打好這個基礎設施。

我們想為接下來的智能時代打好基礎設施。

遊凱超1:16:25

token它是沒有辦法去做調製的。 就是你沒有辦法說把一個D模型的token轉化為一個kimi的 token,這個token它是帶著模型的烙印的。

token 是沒有辦法調製的。你沒有辦法把 DeepSeek 模型的 token 轉化為 Kimi 的 token,這個 token 帶著模型的烙印。

遊凱超2:17:56

數字與實體

公司種子輪融資1.5 億美元0:00
高考超出清華錄取線2 分6:16
本科 4.0 成績的課程數36 門7:17
vLLM 開源時間2023 年 6 月左右38:18
GitHub 貢獻者活躍度排名第 11:24:55
公司當前人數30 多人,接近 401:50:11

術語

PagedAttention分頁注意力
把 KV cache 分成固定大小的塊來管理,減少顯存碎片,是 vLLM 的核心算法。
KV Cache鍵值緩存
自迴歸生成中緩存歷史 token 的鍵和值,避免重複計算。
Speculative Decoding投機解碼
先並行猜測多個 token,再一次性驗證,加速自迴歸解碼。
MOE混合專家
每個 token 只激活少量專家,以更少計算量擴展模型參數。
BYOC帶上自己的雲
客戶提供機器,公司提供軟件和推理服務,按 token 計費的模式。

收聽指南

誰該聽

適合關注開源治理、AI Infra 創業、模型與系統協同設計的創業者、投資人和工程師。

可跳過

前半小時求學經歷可略聽,37 分鐘後開源與 Co-design 乾貨更密。