世界太吵,来原声听播客

No Priors

自研芯片是场豪赌:架构一变,九个月内就可能被对手甩开

一旦对手摸到只在自家芯片上生效的新架构,押注自研芯片的实验室可能在几个月内就被清出赛场——这正是前沿玩家不敢把身家全压在一款专属芯片上的原因。

推理芯片内存带宽芯片架构半导体创业AI基础设施市场格局

原视频在 YouTube 上放不出来,用音频听:

创始人罕见地讲透内存带宽、SRAM/DRAM取舍与芯片市场博弈逻辑,干货密度高,全程值得听。

核心论点 · 点时间戳可跳到原声

1:01

押注推理速度而非训练规模

Fractile 2022年夏天成立,当时行业还在被「教育」什么是推理。Walter 的判断是押注部署时代而非训练时代:模型会像AlphaGo一样,通过在测试时投入更多算力变得超越人类水平。这个判断比同行早很多——他提到一家最近上市的推理芯片公司,直到18个月前做的其实还是训练芯片,说明「押对方向」本身就是稀缺能力,而不是事后看起来那么显而易见。

— Walter Goodwin
3:02

芯片市场看似多元实则同质

Walter 指出,今天的AI芯片市场表面上有一个极其丰富的选项「动物园」,但谷歌TPU、Meta MTIA、微软Maya、OpenAI Jalapeno这些自研芯片,最终都要交给Broadcom这类市值2万亿美元的代工交付商完成从架构到流片的落地。它们用的都是同一种HBM内存、同一种张量核心做矩阵乘法、同一套台积电先进封装——真正打通架构层到物理设计层全栈的团队极少,这是一个结构性的行业特征。

— Walter Goodwin
11:24

放弃SRAM转投高带宽DRAM

公司前两年像Grok、Cerebrus一样押注SRAM芯片——计算单元和权重/KV缓存同片,带宽极高,能把语言模型推到每秒数千token。但2023年底到2024年,Walter开始担心这条路线的可扩展性:AI领域同时在增长的不只是参数量,还有正变得越来越重要的上下文长度,而SRAM容量天然有限。于是团队转向和内存厂商、代工厂联合研发DRAM的超高带宽方案,这套平台将在明年下半年量产爬坡。

— Walter Goodwin
12:25

更快聊天机器人是更快的马

Walter 用福特的类比反驳「推理加速=更丝滑的聊天体验」这个浅层叙事:亨利·福特问人们想要什么,得到的回答是更快的马,而不是汽车。同理,「更快的聊天机器人」只是快推理领域的「更快的马」。他认为速度真正撬动能力的地方,是把万亿参数模型跑到每秒数千token,从而让长时间运行的智能体被彻底提速——这才是快推理芯片真正该瞄准的场景,而不是对话延迟。

— Walter Goodwin
22:12

护城河是提前三到六个月下注

Walter 把芯片竞争类比成前沿模型竞赛:没人能永远拥有精准匹配当下工作负载的芯片,六个月后需求又会变。真正的优势来自于保持一个「随时可触发量产」的技术路线储备——如果能在架构判断上结构性地领先竞争对手三到六个月,就足以拿下这段时间里所有的新部署。这也是为什么Fractile要自己掌握从架构设计到流片的全栈能力,而不是依赖外部合作方的节奏。

— Walter Goodwin
28:28

带宽增长远落后于算力增长

Fractile内部在探索「带宽的scaling law」:过去20年算力提升了约一百万倍,而内存带宽只提升了约40倍。这个失衡留出了空间——如果芯片带宽足够高,MOE模型可以做得更稀疏(比如从1/16稀疏度提到1/128、1/256)来换取同等智能水平下更低的计算量,但现有HBM芯片在超高稀疏度下会严重带宽瓶颈,利用率很低。Fractile押注的25倍带宽优势,本质是想反过来牵引模型架构往更稀疏的方向走。

— Walter Goodwin
31:35

自研芯片主要用来压价英伟达

行业有个段子:大厂自研芯片的主要作用是压低付给英伟达的价格,而不是实现英伟达做不到的能力,因为这些自研芯片在架构上和主流方案高度相似。Walter认为今天几乎所有大规模部署方都在尽量多接入不同芯片平台,原因之一就是算力这件事变得过于关乎生死,必须保有供应多样性,而不是单纯相信某一条技术路线能笑到最后。

— Walter Goodwin
33:36

全押自研芯片是危险赌注

Walter认为前沿实验室不会把身家全押在自研芯片上,深层原因是一场不对称博弈——如果某个实验室押注了专属芯片,而对手发现了只在他们所选芯片上才生效的新突破,能带来数倍的计算效率提升,自己可能在还没来得及部署足够多专属芯片之前就被淘汰出局。所以这些前沿玩家反而需要彼此部署相同的平台,因为他们是在模型层面竞争,而不是在芯片层面押生死注。这正是第三方前沿芯片公司长期存在的理由。

— Walter Goodwin

原话 · 已逐字校验

Right now we're trying to build a single chip. If you crack open an NVIDIA system, it has anywhere between kind of six and nine custom chips, all built by NVIDIA, to come together to build something that is really, really potent. So there's already a gap there.

我们现在还在努力造出一颗芯片。而如果你拆开一套英伟达系统,会发现里面有六到九颗由英伟达自己打造的定制芯片组合在一起,才造就了这么强悍的东西。差距已经摆在这里了。

Walter Goodwin0:00

we need to find a way to pour more compute into these models at test time

我们需要找到办法,在测试时给这些模型注入更多算力。

Walter Goodwin1:01

one of the things that I think is very striking is there's a lot of relatively identikit chips out there.

我觉得很惊人的一点是,市面上有大量彼此高度相似、几乎像复制粘贴出来的芯片。

Walter Goodwin3:02

when Henry Ford sort of asked the rhetorical question of what people would have said they wanted and, you know, faster horses rather than a car. The snappier chatbot is kind of the faster horses of kind of fast inference.

就像亨利·福特那个反问:如果问人们想要什么,他们会说想要更快的马,而不是汽车。更丝滑的聊天机器人,就是快推理领域的「更快的马」。

Walter Goodwin12:25

if you can just find a way to structurally carve out a three to six months advantage, you will be winning all of those deployments.

只要你能找到办法,结构性地建立起三到六个月的领先优势,你就会赢下这段时间里所有的部署。

Walter Goodwin22:12

We've scaled flops like a million fold in the last 20 years. Memory bandwidth has gone up about 40x in the same time frame.

过去20年里,我们把算力(flops)提升了大约一百万倍,而同一时期内存带宽只提升了大约40倍。

Walter Goodwin30:32

I could die in the nine months before I get to deploy enough of that chip that I've also now gained that kind of 5x in computational efficiency.

我可能在还没来得及部署足够多那种芯片、从而获得那五倍计算效率提升之前,就已经死在了那九个月里。

Walter Goodwin34:36

数字与实体

NVIDIA系统内定制芯片数量6到9颗21:09
Broadcom市值2万亿美元3:02
Fractile员工规模约150人8:19
芯片流片周期3到5个月18:42
芯片摊销回本周期3到5年18:42
Fractile芯片带宽优势比HBM芯片高25倍28:28
20年来内存带宽增长倍数约40倍30:32

术语

HBM高带宽内存
与GPU/TPU等芯片同封装的高速DRAM,是当前主流AI芯片的标配内存
ASIC house芯片代工交付商
如Broadcom,帮大厂把芯片架构设计落地为可流片版图的后端合作方
GDS2版图文件格式
芯片设计最终提交给晶圆厂的文件,记录每个晶体管和金属层的物理位置
DRC/LVS clean设计规则/版图一致性签核
版图通过晶圆厂规则检查且与电路图一致,是流片前的最终签核标准
MFU模型算力利用率
芯片实际有效算力占理论峰值算力的比例
RSI递归自我改进
AI利用自身能力迭代改进研发流程的概念,此处类比芯片设计自动化

收听指南

谁该听

关注AI推理芯片技术路线、算力采购与半导体创业格局的工程师和投资人。