模型越大,28纳米存算芯片反而越强
知存科技把28纳米Flash做成存算一体芯片,靠阵列越大能效越高的物理特性,让效率随模型变大反而提升,Transformer对它是纯粹利好。
核心论点 · 点时间戳可跳到原声
创业前,行业没人相信存算一体
王绍迪读博期间就想做存算一体芯片,2016年博士毕业前找过中美四五家头部芯片公司,没人听说过这项技术,不可能让公司为一个应届博士开辟新方向;转向高校也碰壁——北大老师直接问经费从哪来,当时全国给芯片的经费能超百万的都很少,连流片都流不起。两条路都走不通,最后只能自己创业。
— 王绍迪模型越大,读取反而越快
传统冯诺依曼架构做矩阵乘法要把存储单元里的数据一个个读出来送到运算器里算,存储阵列越大,读出数据反而越慢,这是物理规律决定的。存算一体则是把每个存储单元本身变成矩阵乘法里的一个计算节点,一次开启就能完成一整个矩阵的计算,不需要逐行逐列读取。这意味着算法规模从几行变成一万行,也只需要开启一次,等效带宽和算力反而随模型变大而变大,跟冯诺依曼架构的规律正好相反。
— 王绍迪欧姆定律就是黑魔法的原理
存算一体的核心是用欧姆定律里电压乘以电导等于电流的物理关系直接实现乘法:给存储器的行方向输入电压,每个存储单元本身就是一个电导值,列方向自然流出的电流就是电压乘电导的乘积;同一列里多行的电流汇聚在一起,物理上就完成了加法。整个矩阵乘法在一次读取里就算完了,完全不需要数字芯片里的加法器、乘法器电路,本质是拿初中物理里最基本的电学关系去做AI计算。
— 王绍迪为什么押注最普通的Flash存储器
面对SRAM、非易失性Flash、学术界热议的RRAM等多种存储介质,知存选了看起来最不起眼的NOR Flash,原因是Flash做模拟乘法所需的计算电流是所有存储器里最低的,而存算一体需要同时开启的存储单元越多、能并行处理的规模越大,电流越低意味着能开的阵列越大、等效算力越强;Flash也是最成熟的存储工艺,流片调试速度最快。代价是精度攻坚,公司几百人花了七八年时间才把精度做到满足应用需求。
— 王绍迪Transformer对存算一体是纯利好
从深度学习转向Transformer后,存算一体反而获得两重红利:一是深度学习常一次读参数要算上万次,存储带宽压力不大;Transformer每个参数读一次只算一次,读取计算比天生1比1,而GPU这类架构通常是64比1到128比1,差的能到1000比1,正好完美匹配存算一体存储计算比也是1比1的特性。二是Transformer的矩阵规模比深度学习大了1000到1万倍,存算一体是整个矩阵一次算完,矩阵越大计算效率也跟着提升1000到1万倍。此外大模型只需INT4的4比特精度,远低于深度学习时代要求的12到16比特,落地门槛因此大幅降低。
— 王绍迪四年六次流片,点亮才是噩梦开始
存算一体没有现成的EDA工具,每次流片回来的芯片可能藏着几十个问题,比如设计目标8比特精度实际只做到3比特,团队要一个个去定位——花一个多月把芯片切开反复做实验才定位出一个问题,修复后发现精度几乎没提升,因为还有其他几十个问题在拖后腿,只能重新设计实验、再切芯片再找下一个问题。对普通芯片,点亮意味着任务完成;对存算一体,点亮才是debug的开始。这样的循环持续了四年、经历六次重大失败,公司迄今前后流片已接近三十次。
— 王绍迪安克耳机:从耳机到吉尼斯世界纪录
2023年ChatGPT带火生成式模型后,安克算法团队找到知存,想在耳机里跑生成式音频算法做通话降噪,但这需要算力强、容量大、功耗低同时体积小成本可控的芯片,用冯诺依曼架构几乎不可能实现。知存用28纳米NOR Flash存算一体芯片承接了一个几百万参数的Transformer模型(此前耳机芯片能装下的参数一般不到50万),耗时近三年攻克,最终拿到通话降噪人声还原度最高的吉尼斯世界纪录,且大幅领先第二名,被王绍迪称为对传统耳机音频芯片的降维打击。
— 王绍迪中国不需要EUV,但存算一体需要中国速度
王绍迪认为存算一体的长期优势在中国的制造和迭代速度:中国消费电子和新能源汽车产业链能把材料、零部件到产品的整个链条压缩到很短周期内快速迭代,这是海外做不到的,而存算一体恰恰需要材料设备、代工、设计公司到产品应用之间最短距离的交互反馈。他判断存算一体未来有机会从耳机等细分场景的协处理器,成长为统一端侧各种专用算法的通用存储器——就像这项技术在被真正做出来之前,市场根本不存在一样。
— 王绍迪原话 · 已逐字校验
跟美国和中国的 头部的芯片公司 我们聊过四五家 大家都没听过这个东西
我们跟中美的头部芯片公司聊过四五家,大家都没听说过存算一体这个东西。
王绍迪4:00
不是说我们一两个人做 是我们公司几百个人做了七八年的时间 把它做到满足应用的需求
不是我们一两个人做,是公司几百个人花了七八年时间,才把它做到满足应用需求。
王绍迪13:02
因为每个存储单元里面只能装下1000到2000个电子 相当我用1000到2000个电子 才去实现一个线性的256等分 这个难度是很大的
因为每个存储单元里只能装下1000到2000个电子,相当于要用这1000到2000个电子去实现一个线性的256等分,这个难度非常大。
王绍迪14:02
现在的GPU可能是64比1 128比1 做得很好的是32比1 做得差的可能是1000比1 但是存存一体天生就是1比1
现在GPU的读取计算比可能是64比1、128比1,做得好的是32比1,做得差的可能到1000比1,但存算一体天生就是1比1。
王绍迪16:04
纯研一体前期投片失败 我觉得是一个必经的事情 我们其实前前后到现在 可能有三十次投片都是有了
存算一体前期流片失败,我觉得是一个必经的过程。我们前前后后到现在,大概已经有三十次流片了。
王绍迪21:05
对于很多芯片 点亮是认为已经任务完成了 我们的点亮是灾难的开始
对很多芯片来说,点亮就意味着任务完成了;对我们来说,点亮才是灾难的开始。
王绍迪25:06
这个芯片在安克兰机上 获得了通话降噪 是人生还原度最高的吉尼斯世界纪录 而且远高于第二名
这颗芯片在Anker耳机上,拿到了通话降噪人声还原度最高的吉尼斯世界纪录,而且远高于第二名。
王绍迪32:10
数字与实体
| 早期流片失败 | 4年6次重大失败,累计约30次流片 | 21:05 |
| 存算一体读取计算比 | 天生1:1(GPU约64:1至128:1,差的达1000:1) | 16:04 |
| Flash单元计算电流 | 10纳安到100纳安(其他存储器几百纳安到几十微安) | 12:02 |
| Flash精度攻坚耗时 | 公司几百人做了七八年 | 13:02 |
| 未来能效提升空间 | 未来三年每年3-5倍,叠加制造端改进最多可能到几千倍 | 20:05 |
| 公司研发团队规模 | 500多名研发人员,近100位博士 | 27:07 |
| 耳机芯片参数量与工艺 | 400万到600万参数的Transformer模型,28纳米NOR Flash工艺 | 33:11 |
术语
- Von Neumann architecture冯·诺依曼架构
- 存储与计算分离、需要来回搬运数据的传统芯片架构
- NOR FlashNOR闪存
- 知存选用的非易失性存储介质,计算电流远低于其他存储器
- NAND FlashNAND闪存
- 三维堆叠的高密度闪存,读写较慢但容量极大,适合存大模型
- EDA电子设计自动化工具
- 芯片设计验证用的软件工具链,存算一体领域目前几乎空白
- INT44比特整数精度
- 大模型推理常用的低精度格式,对存算一体的门槛远低于早期深度学习
- Universal Memory通用存储器
- 容量大、速度快、能同时兼顾多场景的理想存储器概念
收听指南
关心AI芯片底层架构的工程师、半导体投资人,以及想理解算力瓶颈本质的创业者
开头北大求学经历的闲聊可以跳过,不影响理解后面技术内容