理想判断算力将成为整车最贵部件,这是它自研芯片的核心赌注
理想测算单车算力成本已超2000美元且还在往4000、8000、1万美元涨,一旦AI算力变成汽车最核心能力,这部分成本和能力就必须握在车企自己手里。
核心论点 · 点时间戳可跳到原声
算力成本直逼电池,逼出自研决定
谢炎说理想判断一辆车光算力成本就要2000美元以上,而且会持续上涨,变成4000、8000甚至1万美元,未来有可能跟电池一样成为整车成本最高的部分。更第一性的理由是:如果AI能力是巨身智能汽车最核心的部分,那这个能力的底层就必须由车企自己掌握,就像燃油车时代领先车企不会把发动机、底盘完全交给供应商一样,否则跟其他车企就没有区别。
— 谢炎把芯片架构写成论文发出来还不怕被抄
理想把M100的可编排数据流架构写成论文投到ISCA顶会,公司内部其实有人质疑机密的东西为什么要公开。谢炎的理由是:从论文到真正把芯片做出来、把大模型高效跑起来、把编译器和算子做好,中间的gap巨大,别人很难照抄;而且技术本身在进步,藏起来也挡不住别人追上来,唯一的办法就是自己跑得更快,同时公开也能换来同行的反馈和更多人一起把这条路走通。
— 谢炎去掉所有缓存,把复杂度甩给编译器
M100的NPU里没有传统的多级Cache,片上存储全部是由软件逻辑控制的SRAM,没有硬件自动管理。好处是省掉了CPU里占30%到40%晶体管的调度、缓存同步等控制逻辑,硬件变得精简、效率更高;代价是编译器要承担原本由硬件做的工作,变得非常难写。谢炎把这概括为:数据流架构把冯诺依曼架构里硬件的复杂性,移到了软件和编译器里,在静态编译阶段就把问题解决掉。
— 谢炎数据流芯片没有状态机,像薛定谔的芯片
谢炎解释数据流架构和图灵机式的冯诺依曼架构的根本区别:后者每个cycle都有确定状态,可以随时停下来观察;而数据流芯片由数据到达触发计算,不是时间或cycle触发,某一时刻切一刀下去,整个系统处于什么状态是不确定的,他形容这有点像薛定谔的芯片。这带来的直接后果是debug比传统架构困难得多,但最终计算结果的精度要求和其他架构是一样的。
— 谢炎450亿晶体管的芯片一次流片就成功
M100是5纳米、400平方毫米的大芯片,内含450亿个晶体管,采用完全创新的架构,结果一次流片就成功点亮,从流片回来到把Linux跑起来只花了不到12小时,团队半夜都守在实验室不肯走。谢炎说这件事能一次成功他觉得很了不起,因为这不是一次小修小补的迭代,而是架构、编译器、操作系统、模型团队从一开始就绑在一起协同设计的结果。
— 谢炎模型思想会趋同,壁垒最终落在硬件
谢炎判断从长期看,模型算法层面的思想会越来越趋同,因为一个想法别人也能想到,人员流动也会让大家很快朝同一个方向走,软件模型层面能构建的壁垒最多是训练成本的壁垒,而不是思想的壁垒。他认为未来真正的差异化壁垒来自硬件、或者基于硬件和硬件一体设计的软件,这种壁垒有点像苹果:大家都知道苹果好,但因为它有自己的芯片、操作系统和应用体系,整套很难被复制,就算拿到芯片也做不出iPhone。
— 谢炎芯片把端到端反应时间压到0.28秒
谢炎说M100上车后支持马赫VLA原生多模态模型,端到端的反应速度缩短到0.28秒。他把这类比成人从光子进入视网膜到做出动作的反应速度:反应越快越安全,同时因为处理粒度足够细、反应间隔足够小,刹车、转向这类动作可以做得更细腻,不会顿挫,舒适感和安全性都和反应速度直接相关。
— 谢炎团队规模越小,反而协作效率越高
谈到软硬件团队协同开发时,谢炎提出一个和直觉相反的做法:团队规模要小。团队一旦人多了就会想自成体系、不愿意跟别人合作,因为自己力量已经足够;如果一个任务理论上需要10个人,最佳配置反而是8个人甚至更少,这样每个人能激发出的效率更高,而配置到15、20人反而会在内部长出很多细分组织,协作变得更困难。他把这种自发聚拢资源解决问题的方式比作点亮一团篝火。
— 谢炎原话 · 已逐字校验
其实在数据的架构里面 你切一刀的话 在某一个时刻切下去 它的状态是不固定的 有点像是薛定谔的芯片
在数据流架构里,你在某一个时刻切一刀下去,它的状态是不固定的,有点像薛定谔的芯片。
谢炎1:01
比如说当时可能一辆车光算力的成本 就要花掉2000美元以上 而且我们觉得是会越来越多 就是不是2000美元 不是一个只是个开始 它可能会变成4000 可能会变成8000 1万
比如说当时可能一辆车光算力的成本就要花掉2000美元以上,而且我们觉得会越来越多,不是2000美元就是个开始,它可能会变成4000,可能会变成8000、1万。
谢炎6:04
我们何德何德能做芯片 而且是一开始我们就提出来非常高的指标 不是说做一个芯片 只是克隆一下复制一下 而是我们当然提的目标 就是一个好几倍的性能 比外购更低的成本 做到这种领先的程度 其实大部分人心里是不确定的
我们凭什么能做芯片,而且一开始就提出非常高的指标,不是克隆复制一个芯片,而是要做到好几倍的性能、比外购更低的成本,这种领先程度其实大部分人心里是不确定的。
谢炎9:08
我是一直觉得技术就是在进步 并不会因为我们把一些东西藏起来 别人就不会追上来 所以唯一的方法就是我们跑得更快
我一直觉得技术本来就在进步,并不会因为我们把一些东西藏起来,别人就追不上来,所以唯一的方法就是我们跑得更快。
谢炎14:22
你从第一心上想明白的一件事情 如果它可以被做到 它就必将被做到
你从第一性上想明白的一件事情,如果它可以被做到,它就必将被做到。
谢炎37:36
这种壁垒有点像苹果 大家都知道苹果好 但是你要复制给苹果很难 因为苹果有自己芯片 自己操作系统 自己的应用体系 你要把整套都复制了 非常难
这种壁垒有点像苹果,大家都知道苹果好,但你要复制苹果很难,因为苹果有自己的芯片、自己的操作系统、自己的应用体系,要把整套都复制非常难。
谢炎50:44
方法是 我觉得团队规模要小 团队规模大了之后 他就希望自成体系 然后不希望跟别人合作 因为我有足够的力量
方法是,我觉得团队规模要小,团队规模大了之后就会希望自成体系、不愿意跟别人合作,因为自己已经有足够的力量。
谢炎1:10:02
数字与实体
| M100峰值算力 | 1280 TOPS | 15:23 |
| M100实际运行效率 | 约82% | 48:42 |
| NPU计算单元数量 | 56个完全同构的计算单元 | 15:23 |
| 通用CPU核心数量 | 24个A78 CPU核 | 15:23 |
| 内存带宽 | LPDDR5X子系统,273GB每秒 | 15:23 |
| 端到端反应延迟 | 0.28秒 | 54:47 |
术语
- dataflow architecture数据流架构
- 计算由数据到达驱动而非由指令顺序驱动的芯片架构
- test time training (TTT)测试时训练
- 模型在推理运行阶段仍持续训练或更新参数的技术
- just in time compiler即时编译器
- 在程序运行时动态完成编译,而非提前一次性编译完成
- software hardware co-design软硬件协同设计
- 芯片硬件和上层软件从一开始就同步设计、共同迭代
收听指南
车企技术高管、芯片架构师,以及关注具身智能和自动驾驶硬件路线的投资人。
29分钟左右关于维度高低的类比有点绕,可以跳过,不影响核心论点。