世界太吵,来原声听播客

Latent Space

量化更多层反而更准,因为误差会互相抵消

选对层之后,量化更多反而更保真——误差会互相抵消;同理 10 倍加速不是单点突破,而是量化、speculator、PD 分离各翻一倍叠出来的。

推理优化量化投机解码GPU 硬件视频生成开源模型
两位工程师把「支持一个新模型」拆到卡数、层号和竞态条件的粒度,几乎没有市场话术;代价是 100 分钟里夹了不少互相打断的闲聊。

核心论点 · 点时间戳可跳到原声

1:00

20 万 token 的真实路径

一个 20 万 token 的请求进来,第一个问题不是算力,而是「你之前发过这段吗」。系统先做 cache-aware routing,挑一个既有空闲 prefill worker、又已经缓存了部分前缀的副本,尽量跳过 prefill;部分模型上 prefill 和 decode 已经拆到两组 GPU,前者产出 KV cache 和首 token,后者做逐 token 解码。关键在于挡在前面的 speculator 是按流量训的——它假设你在写代码,所以草稿 token 接受率高;如果你实际是让它总结哈利波特全集,同一套系统就会变慢。延迟不是模型的固有属性,而是流量画像和 speculator 对不对得上的函数。

— Philip
13:16

上线新模型要重做三件事

「支持某个新模型」有两个完全不同的含义:能出 token,和有一个生产可用的 API。前者不难,vLLM/SGLang 的维护者常常提前拿到权重、模型方自己提 PR。后者要在私有栈上重做一遍:把权重量化到 NVFP4 以吃满 Blackwell,并校准量化确认没有智力回退;用真实权重跑推理取 hidden states,重新训 speculator;再为新架构补运行时支持(GLM-5.2 的 DSA 稀疏注意力就是从 DeepSeek 借来的)。因为 model API 侧是零数据留存,他们不知道具体流量,只能用公开数据集近似「编码和 agent 是主流」来训通用 speculator。即便 K2.5 到 K2.6 只是继续后训练,这套流程也躲不掉。

— Philip
17:25

给 GLM 装上 Kimi 的眼睛

开源模型可以做器官移植。团队里的 Haley 把 Kimi 的视觉 encoder 接到 GLM-5.2 上:encoder 和主干权重都冻结,只训中间那个几百万参数的 projector——动主干权重的代价是模型可能在别的能力上变笨。第一版只用「描述这张图」的数据训,没学明白;改成每张图配一组判别式问题(图里有没有鸟、有没有科学家)之后出现了 grokking。结果是 MMLU Pro 56%,不算前沿,但没有图片输入时直接跳过 encoder,原本的 GLM-5.2 质量一分不损。于是你得到一个 Kimi 的眼睛、GLM 的权重、DeepSeek 的注意力拼起来的模型。

— Philip
22:21

复读 S 是集群问题

GLM-5.2 和 DSV 4 上出现过反复输出同一个 token(最常见的是 S)的模式崩溃,即使温度 0.9 也会发生。他们的判断是:这不是权重问题。同一份权重换一个推理引擎(SGLang 换 vLLM),或者把 NVIDIA 新版 TensorRT-LLM 镜像的改动合上来,问题就消失。更极端的一次是同一模型在一个集群会崩、另一个不会,原因是前者节点间 KV cache 传输走的互联更慢,把 kernel 里缺同步屏障的竞态暴露了出来——最后的处理办法是换集群托管。线上还有一层兜底:同一 token 连续出现四次以上就掐掉重跑,但要排除表格分隔线那类特殊字符。

— Ali
30:28

多量化反而更保真

行业默认「量化越多、损失越大」,他们的结论是不一定。量化是有损压缩,功夫全在选层(图像模型里 modulation 层和 out projection 不量化)。研究实习生 Joshua 的论文给出的做法是:预测哪些层的量化误差会互相抵消——一层偏右、一层偏左——然后专挑这些层量化。评价标准也换掉了:不看 benchmark 分数,而看量化模型与全精度模型 logits 分布之间的 KL divergence,分布越接近,行为就越可能贴合原模型。结果是比 NVIDIA 的量化多量化 20%(因此多约 20% 吞吐),同时保真度更好。注意这不是让模型变强,只是抵消损失。

— Ali
35:38

10x 从叠乘里来

10 倍的拆解很具体:一个万亿参数模型跑在没做优化的现成引擎上,大约 30-50 tokens/秒(这里说的是延迟意义上的 tokens per second,行业本该叫 ITL)。做到 300-400 要同时满足:最好的硬件、训好的 speculator、量化做完、较高的缓存命中率、以及为延迟而非吞吐调过的小 batch 与并行配置。分项收益是 BF16→FP8 约 30-40%、FP8→FP4 再 30-40%、speculator 约 2x、PD 分离约 2x,再加运行时和新 kernel 的两位数百分比。但如果固定同样硬件同样卡数,纯推理优化只有 2-4x——差额是硬件换来的,10x 更多出现在 OpenRouter 上最差与最好供应商之间。

— Philip
1:03:22

看空 mega kernel

Ali 看空 mega kernel:融合 kernel 省掉启动开销听起来很美,但 tensor parallelism 下半个矩阵在另一张卡上,做 softmax 这类非线性仍然必须通信,融合救不了;而且他接触过做融合 mega kernel 的公司,生产里最终跑的还是 TensorRT-LLM 和 modular 的 kernel。NVIDIA 揭幕 Rubin 的帖子里,这颗 GPU 的设计干脆让 mega kernel 变得不必要。顺着这个趋势他反问:GPU 每代都在加专用 tensor core、TMA,你越来越只是在编排 tile 而不是控制线程,Rubin 相对 T4 已近似 ASIC,那为什么还看多 AI ASIC 公司?Swyx 的反驳是:垂直整合的模型厂自研芯片合理——按 Martin Casado 的算法,五千亿训练预算里拿五百亿做 ASIC,换到 10% 以上效率就值;而 ASIC 公司真正在做的是互联与内存分配,那才是 10x 到 1000x 的瓶颈。

— Ali
1:15:25

视频的平方墙

视频这边的经济学和 LLM 相反。LLM 的开源闭源差距已经接近消失,视频上是天壤之别——Ali 的例子是:哪怕他把一部三小时电影的生成成本压到 10 美元、比闭源便宜 100 倍,客户面对的仍是 1000 美元的绝对值,于是照样全片用 Veo 和 Kling。需求少→创新少→开源 checkpoint 更少,Wan 2.7 已经不开源了。技术瓶颈是注意力的平方项:16 帧/秒的 480p 视频,5 秒钟压到 latent 之后仍是 35000 个 token,而这是 O(n²),时长翻倍代价就是四倍。于是只有两条路:上稀疏注意力(每个 token 只 attend 前 12.5%,画质明显掉),或者走自回归——但今天所有自回归视频模型质量都很差,而靠拼接 5-7 秒片段会逐段漂移,二十几秒后画面暗成黑屏。

— Ali

原话 · 已逐字校验

It is possible that the model in which I quantized more information is going to perform better because the quantization errors have canceled out.

完全有可能,我量化了更多信息的那个模型表现更好,因为量化误差互相抵消掉了。

When we publish optimizations, it’s 20%, it’s 100% it’s 200%. So there’s still probably like a lot further to go, honestly. Like you’ll, you’ll know that inference is pretty much solved when researchers start publishing about how they got 1% faster at something.

我们发布的优化是 20%、100%、200%。所以老实说,这条路大概还很长。等到研究者开始发论文说自己把某件事快了 1%,你就知道推理这件事基本被解决了。

Philip31:57

With local AI, it’s how do I fit this model onto my hardware and then make it less dumb? And with data center influence, it’s how do I load this model and then make it less slow?

本地 AI 的问题是:怎么把这个模型塞进我的硬件,然后让它别那么笨?数据中心推理的问题是:怎么把模型加载起来,然后让它别那么慢?

Philip46:17

The downsides is every single autoregressive video model is s**t. It’s just terrible quality.

缺点是,每一个自回归视频模型都很烂。质量差得离谱。

So that’s the fundamental problem with trying to change a fact in an MLP within the weight. KV cache compaction fixes that.

这就是试图在权重里的 MLP 中改一条事实的根本问题所在。KV cache 压缩能解决它。

数字与实体

改造视觉后的 GLM-5.2 得分MMLU Pro 56%17:25
Baseten 量化相对 NVIDIA 的增量多量化 20%,吞吐高约 20%29:27
万亿参数模型无优化基线速度30-50 tokens/秒34:31
全量优化后目标速度300-400 tokens/秒35:38
精度下降的分项收益BF16→FP8 约 30-40%,FP8→FP4 再 30-40%38:23
5 秒 480p 视频的注意力 token 数约 35000 个 token1:15:25

术语

speculative decoding (spec dec)投机解码
小草稿模型先连猜几个 token,大模型一次前向验证并接受或否决。
PD disaggregationprefill/decode 分离
把处理输入产出 KV cache 与逐 token 生成拆到两组 GPU 上。
NVFP4NVFP4 四位浮点
Blackwell 原生支持的 4 比特格式,每个参数只占半字节。
mega kernel巨型融合核
把多个 GPU kernel 融成一个,省掉启动开销和中间数据搬运。
expert parallelism专家并行
MoE 模型里把整个 expert 放进单卡,卡间通信量远小于张量并行。
KV cache compactionKV 缓存压缩
压缩已有 KV 而不改权重,Ali 认为这是持续学习的可行路径。

收听指南

谁该听

自己租 GPU 托管开源模型的基础设施工程师、在自建与 API 之间做决策的技术负责人、以及做视频生成的团队。

可跳过

0:00–1:00 的实习生玩笑;1:21 之后音乐扩散那段基本没结论。