理想判斷算力將成為整車最貴部件,這是它自研芯片的核心賭注
理想測算單車算力成本已超2000美元且還在往4000、8000、1萬美元漲,一旦AI算力變成汽車最核心能力,這部分成本和能力就必須握在車企自己手裡。
核心論點 · 點時間戳可跳到原聲
算力成本直逼電池,逼出自研決定
謝炎說理想判斷一輛車光算力成本就要2000美元以上,而且會持續上漲,變成4000、8000甚至1萬美元,未來有可能跟電池一樣成為整車成本最高的部分。更第一性的理由是:如果AI能力是巨身智能汽車最核心的部分,那這個能力的底層就必須由車企自己掌握,就像燃油車時代領先車企不會把發動機、底盤完全交給供應商一樣,否則跟其他車企就沒有區別。
— 謝炎把芯片架構寫成論文發出來還不怕被抄
理想把M100的可編排數據流架構寫成論文投到ISCA頂會,公司內部其實有人質疑機密的東西為什麼要公開。謝炎的理由是:從論文到真正把芯片做出來、把大模型高效跑起來、把編譯器和算子做好,中間的gap巨大,別人很難照抄;而且技術本身在進步,藏起來也擋不住別人追上來,唯一的辦法就是自己跑得更快,同時公開也能換來同行的反饋和更多人一起把這條路走通。
— 謝炎去掉所有緩存,把複雜度甩給編譯器
M100的NPU裡沒有傳統的多級Cache,片上存儲全部是由軟件邏輯控制的SRAM,沒有硬件自動管理。好處是省掉了CPU裡佔30%到40%晶體管的調度、緩存同步等控制邏輯,硬件變得精簡、效率更高;代價是編譯器要承擔原本由硬件做的工作,變得非常難寫。謝炎把這概括為:數據流架構把馮諾依曼架構裡硬件的複雜性,移到了軟件和編譯器裡,在靜態編譯階段就把問題解決掉。
— 謝炎數據流芯片沒有狀態機,像薛定諤的芯片
謝炎解釋數據流架構和圖靈機式的馮諾依曼架構的根本區別:後者每個cycle都有確定狀態,可以隨時停下來觀察;而數據流芯片由數據到達觸發計算,不是時間或cycle觸發,某一時刻切一刀下去,整個系統處於什麼狀態是不確定的,他形容這有點像薛定諤的芯片。這帶來的直接後果是debug比傳統架構困難得多,但最終計算結果的精度要求和其他架構是一樣的。
— 謝炎450億晶體管的芯片一次流片就成功
M100是5納米、400平方毫米的大芯片,內含450億個晶體管,採用完全創新的架構,結果一次流片就成功點亮,從流片回來到把Linux跑起來只花了不到12小時,團隊半夜都守在實驗室不肯走。謝炎說這件事能一次成功他覺得很了不起,因為這不是一次小修小補的迭代,而是架構、編譯器、操作系統、模型團隊從一開始就綁在一起協同設計的結果。
— 謝炎模型思想會趨同,壁壘最終落在硬件
謝炎判斷從長期看,模型算法層面的思想會越來越趨同,因為一個想法別人也能想到,人員流動也會讓大家很快朝同一個方向走,軟件模型層面能構建的壁壘最多是訓練成本的壁壘,而不是思想的壁壘。他認為未來真正的差異化壁壘來自硬件、或者基於硬件和硬件一體設計的軟件,這種壁壘有點像蘋果:大家都知道蘋果好,但因為它有自己的芯片、操作系統和應用體系,整套很難被複制,就算拿到芯片也做不出iPhone。
— 謝炎芯片把端到端反應時間壓到0.28秒
謝炎說M100上車後支持馬赫VLA原生多模態模型,端到端的反應速度縮短到0.28秒。他把這類比成人從光子進入視網膜到做出動作的反應速度:反應越快越安全,同時因為處理粒度足夠細、反應間隔足夠小,剎車、轉向這類動作可以做得更細膩,不會頓挫,舒適感和安全性都和反應速度直接相關。
— 謝炎團隊規模越小,反而協作效率越高
談到軟硬件團隊協同開發時,謝炎提出一個和直覺相反的做法:團隊規模要小。團隊一旦人多了就會想自成體系、不願意跟別人合作,因為自己力量已經足夠;如果一個任務理論上需要10個人,最佳配置反而是8個人甚至更少,這樣每個人能激發出的效率更高,而配置到15、20人反而會在內部長出很多細分組織,協作變得更困難。他把這種自發聚攏資源解決問題的方式比作點亮一團篝火。
— 謝炎原話 · 已逐字校驗
其實在數據的架構裡面 你切一刀的話 在某一個時刻切下去 它的狀態是不固定的 有點像是薛定諤的芯片
在數據流架構裡,你在某一個時刻切一刀下去,它的狀態是不固定的,有點像薛定諤的芯片。
謝炎1:01
比如說當時可能一輛車光算力的成本 就要花掉2000美元以上 而且我們覺得是會越來越多 就是不是2000美元 不是一個只是個開始 它可能會變成4000 可能會變成8000 1萬
比如說當時可能一輛車光算力的成本就要花掉2000美元以上,而且我們覺得會越來越多,不是2000美元就是個開始,它可能會變成4000,可能會變成8000、1萬。
謝炎6:04
我們何德何德能做芯片 而且是一開始我們就提出來非常高的指標 不是說做一個芯片 只是克隆一下複製一下 而是我們當然提的目標 就是一個好幾倍的性能 比外購更低的成本 做到這種領先的程度 其實大部分人心裡是不確定的
我們憑什麼能做芯片,而且一開始就提出非常高的指標,不是克隆複製一個芯片,而是要做到好幾倍的性能、比外購更低的成本,這種領先程度其實大部分人心裡是不確定的。
謝炎9:08
我是一直覺得技術就是在進步 並不會因為我們把一些東西藏起來 別人就不會追上來 所以唯一的方法就是我們跑得更快
我一直覺得技術本來就在進步,並不會因為我們把一些東西藏起來,別人就追不上來,所以唯一的方法就是我們跑得更快。
謝炎14:22
你從第一心上想明白的一件事情 如果它可以被做到 它就必將被做到
你從第一性上想明白的一件事情,如果它可以被做到,它就必將被做到。
謝炎37:36
這種壁壘有點像蘋果 大家都知道蘋果好 但是你要複製給蘋果很難 因為蘋果有自己芯片 自己操作系統 自己的應用體系 你要把整套都複製了 非常難
這種壁壘有點像蘋果,大家都知道蘋果好,但你要複製蘋果很難,因為蘋果有自己的芯片、自己的操作系統、自己的應用體系,要把整套都複製非常難。
謝炎50:44
方法是 我覺得團隊規模要小 團隊規模大了之後 他就希望自成體系 然後不希望跟別人合作 因為我有足夠的力量
方法是,我覺得團隊規模要小,團隊規模大了之後就會希望自成體系、不願意跟別人合作,因為自己已經有足夠的力量。
謝炎1:10:02
數字與實體
| M100峰值算力 | 1280 TOPS | 15:23 |
| M100實際運行效率 | 約82% | 48:42 |
| NPU計算單元數量 | 56個完全同構的計算單元 | 15:23 |
| 通用CPU核心數量 | 24個A78 CPU核 | 15:23 |
| 內存帶寬 | LPDDR5X子系統,273GB每秒 | 15:23 |
| 端到端反應延遲 | 0.28秒 | 54:47 |
術語
- dataflow architecture數據流架構
- 計算由數據到達驅動而非由指令順序驅動的芯片架構
- test time training (TTT)測試時訓練
- 模型在推理運行階段仍持續訓練或更新參數的技術
- just in time compiler即時編譯器
- 在程序運行時動態完成編譯,而非提前一次性編譯完成
- software hardware co-design軟硬件協同設計
- 芯片硬件和上層軟件從一開始就同步設計、共同迭代
收聽指南
車企技術高管、芯片架構師,以及關注具身智能和自動駕駛硬件路線的投資人。
29分鐘左右關於維度高低的類比有點繞,可以跳過,不影響核心論點。