反数据中心几乎全是中国的心理战
美国左右两派同时反对建数据中心,Thomas Sohmers 认为这几乎全是中国的心理战——中国自己在大建特建,却让西方在监管里自我拖慢。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
训练是算力受限,推理是内存受限
Thomas 把训练和推理的根本差异讲得很清楚:训练时你已经有全部语料,可以把 token 输入大规模并行,本质是算力受限问题,所以出口管制框架也主要盯 FLOPS。但推理是生成式的,你不知道五个词之后的 token 是什么,必须一个一个按顺序生成,每生成一个 token 都要把权重读一遍,于是变成极度内存受限的问题,没法像训练那样并行。这个差异决定了推理硬件的设计逻辑和训练芯片完全不同。
— Thomas Sohmers算力涨了 120 倍,内存带宽只涨了 17 倍
2014 到 2024 这十年,单块 NVIDIA GPU 的 FLOPS 提升了约 120 倍,但内存带宽只提升了 17 倍。Thomas 说这就是 memory wall 的真正体现:算力和内存带宽的比率出现了巨大分化,越到后面,内存受限的问题越严重。原因之一是 SRAM 单元在过去十五年的微缩速度远慢于普通晶体管,架构上三四十年没怎么变。另一个原因是动机问题——2010 年代的 CNN 时代模型本质是算力受限,扔更多 FLOPS 就行,没人有动力去解决内存带宽。
— Thomas Sohmers卖缓存 token 的利润率是「离谱」的
Thomas 说,处理一个缓存 token 的成本大约是重新计算生成那个 token 的千分之一,所以卖缓存 token 的利润率高得离谱。几乎所有提供商都按比普通输入 token 更高的费率收缓存费,读的时候再收一个更低的费率,用户觉得便宜,但提供商在缓存读取上赚的是「obscene margin」。他提到 Anthropic 的 API 业务被报道有 80 个点的毛利率,他并不惊讶——在任何行业拿到 80 个点都很难。他认为这些利润率会随着竞争压缩,而且如果 OpenAI、Anthropic 停止训练,它们一夜之间就会大幅盈利。
— Thomas Sohmers反数据中心几乎全是中国的心理战
Thomas 说,现在左右两派几乎在反数据中心这件事上达成共识,这是他眼中政治上最可怕的事,他认为这几乎完全是中国的心理战。他反驳了水电消耗的说法:一个 in-and-out 汉堡用的水比美国最大的数据中心还多,高尔夫球场更是高出几个数量级,而且这些数据中心是闭环液冷系统,很多情况下根本不想用水。他的论点是:中国自己在大建特建、增加数吉瓦的发电容量、为了训练容量推平民居和拉闸限电,而西方却在基于虚假信息自我拖慢。
— Thomas Sohmers数据中心不会抢走居民的电
Thomas 说,电力公司必须提供一种能源可用性的报价,这个报价已经烘焙进所有人的成本和能力里,所以数据中心不可能从已经分配给居民的电里抽电,这是不可能的。而且现在在建的数据中心都自带覆盖自身使用甚至更多的发电容量,只是不被允许接入电网——如果接进去,反而会降低所有人的电价。他还指出,电力公司那边在游说反对新增发电容量,因为市场力量会让更多容量压低价格,这对消费者是好事,但对电力公司不是。
— Thomas SohmersKV cache 把二次方成本变成线性存储
Thomas 解释了 KV cache 的机制:Transformer 最初对每个生成的 token 都要重算之前所有 token 的计算,后来发现不需要重做已经处理过的部分,于是把 K 和 V 两个矩阵存下来。关键在于,attention 机制下每个 token 的计算量随序列长度二次方增长,而存储 K 和 V 只是线性增长。所以 KV cache 是用存储换掉了快速变贵的计算。但存储本身也是复杂度:每个用户都有独特的 KV cache,要决定保留多久、怎么在大系统里管理。
— Thomas Sohmers96% 的 agentic coding token 都是缓存命中
Thomas 提到 SemiAnalysis 的 agent X benchmark,基于大量 cloud code 会话,有几十到几百轮,还有子 agent。他们发现,在这些真实追踪的代码生成、agentic coding 会话中,大约 96% 的 token 都是缓存命中。这意味着如果知道工作负载有极高的缓存率,缓存检索的重要性会急剧上升,因为这些缓存会变得非常大。他举例:GPT-4 被泄露为 1.8 万亿参数模型,量化后约 900 GB 模型权重;如果 Claude 是 10 万亿参数,约 5 TB 权重。但在长上下文下,单个用户会话可能达到 100 GB 量级,50 个用户的上下文就超过模型权重本身。
— Thomas Sohmers中国实验室用算法绕开了内存出口管制
Thomas 说,上下文长度从今天的百万 token 往 10 倍甚至更多走,在二次方内存成本下非常难。过去一年算法上的进展很有意思,能进一步降低上下文所需的存储和计算,而中国模型实验室在这方面创新很多。他举了 DeepSeek V3 的例子:因为出口管制限制了最高内存容量和 FLOPS 的芯片,他们创新出不需要那些芯片的方法,用 multi-head latent attention 大幅减小 KV cache 尺寸,代价是花更多 FLOPS。他说美国主要实验室据他所知都没用 MLA,但这种情况未来会变。
— Thomas Sohmers原话 · 已逐字校验
You make all of your money on selling cashed input and output tokens.
你所有的钱都是靠卖缓存过的输入和输出 token 赚的。
Thomas Sohmers11:16
Like if they stop training, they'd be massively profitable overnight.
如果他们停止训练,一夜之间就会大幅盈利。
Thomas Sohmers12:17
The scariest thing to me on the political spectrum and the way all of this being treated is that it's now become a almost unifying issue on left and right about being anti-data centers. I think that is almost entirely a Chinese psyop.
政治上最让我害怕的是,现在左右两派几乎在反数据中心这件事上达成共识。我认为这几乎完全是中国的心理战。
Thomas Sohmers21:45
Like, you know, a single in and out uses, you know, more more water than, you know, the largest data centers in the United States.
一个 in-and-out 汉堡用的水比美国最大的数据中心还多。
Thomas Sohmers22:49
about 96% of all the tokens that go through these entire sessions are cached.
整个会话中大约 96% 的 token 都是缓存命中。
Thomas Sohmers39:37
the value per unit of intelligence is probably closer to 1,000 fold, not just the 60 fold you're talking about.
单位智能的价值可能接近 1000 倍,而不只是你说的 60 倍。
Thomas Sohmers1:02:26
数字与实体
| Positron Series C 融资额 | 8.75 亿美元 | 0:00 |
| Positron 估值 | 50 亿美元 | 0:00 |
| 2014-2024 单块 NVIDIA GPU FLOPS 提升 | 约 120 倍 | 7:08 |
| 2014-2024 内存带宽提升 | 17 倍 | 7:08 |
| Anthropic API 业务毛利率 | 80 个点 | 11:16 |
| agentic coding 会话缓存命中率 | 约 96% | 38:31 |
| GPT-4 泄露参数量 | 1.8 万亿 | 38:31 |
| GPT-6 Astra 在 Ruler 长上下文基准上的准确率 | 超过 95% | 59:19 |
| GPT 5.6 在 Ruler 长上下文基准上的准确率 | 约 70% | 59:19 |
术语
- KV cache键值缓存
- 存储 attention 中 K 和 V 矩阵,避免重复计算已处理 token。
- memory wall内存墙
- 算力提升远快于内存带宽,导致内存受限问题加剧。
- MLA多头潜在注意力
- DeepSeek 提出的压缩 KV cache 的注意力机制,用更多 FLOPS 换更小缓存。
- quantization量化
- 降低数值精度(如 FP16 到 FP4)以压缩模型和缓存,可能损失精度。
- RulerRuler 基准
- 测试模型在长上下文中找回随机插入信息的能力。
收听指南
关注 AI 基础设施、推理经济学和地缘政治的创业者和投资人,尤其是做芯片、云服务或 agent 产品的团队。
开头 4 分钟的主持人介绍和广告可跳过。