世界太吵,來原聲聽播客

老石談芯

理想判斷算力將成為整車最貴部件,這是它自研芯片的核心賭注

理想測算單車算力成本已超2000美元且還在往4000、8000、1萬美元漲,一旦AI算力變成汽車最核心能力,這部分成本和能力就必須握在車企自己手裡。

自研芯片數據流架構具身智能車規芯片組織管理
想看車企自研芯片的真實算賬:成本曲線、架構取捨和組織機制都講得很具體,不只是喊口號。

核心論點 · 點時間戳可跳到原聲

6:04

算力成本直逼電池,逼出自研決定

謝炎說理想判斷一輛車光算力成本就要2000美元以上,而且會持續上漲,變成4000、8000甚至1萬美元,未來有可能跟電池一樣成為整車成本最高的部分。更第一性的理由是:如果AI能力是巨身智能汽車最核心的部分,那這個能力的底層就必須由車企自己掌握,就像燃油車時代領先車企不會把發動機、底盤完全交給供應商一樣,否則跟其他車企就沒有區別。

— 謝炎
14:22

把芯片架構寫成論文發出來還不怕被抄

理想把M100的可編排數據流架構寫成論文投到ISCA頂會,公司內部其實有人質疑機密的東西為什麼要公開。謝炎的理由是:從論文到真正把芯片做出來、把大模型高效跑起來、把編譯器和算子做好,中間的gap巨大,別人很難照抄;而且技術本身在進步,藏起來也擋不住別人追上來,唯一的辦法就是自己跑得更快,同時公開也能換來同行的反饋和更多人一起把這條路走通。

— 謝炎
18:26

去掉所有緩存,把複雜度甩給編譯器

M100的NPU裡沒有傳統的多級Cache,片上存儲全部是由軟件邏輯控制的SRAM,沒有硬件自動管理。好處是省掉了CPU裡佔30%到40%晶體管的調度、緩存同步等控制邏輯,硬件變得精簡、效率更高;代價是編譯器要承擔原本由硬件做的工作,變得非常難寫。謝炎把這概括為:數據流架構把馮諾依曼架構裡硬件的複雜性,移到了軟件和編譯器裡,在靜態編譯階段就把問題解決掉。

— 謝炎
29:31

數據流芯片沒有狀態機,像薛定諤的芯片

謝炎解釋數據流架構和圖靈機式的馮諾依曼架構的根本區別:後者每個cycle都有確定狀態,可以隨時停下來觀察;而數據流芯片由數據到達觸發計算,不是時間或cycle觸發,某一時刻切一刀下去,整個系統處於什麼狀態是不確定的,他形容這有點像薛定諤的芯片。這帶來的直接後果是debug比傳統架構困難得多,但最終計算結果的精度要求和其他架構是一樣的。

— 謝炎
47:42

450億晶體管的芯片一次流片就成功

M100是5納米、400平方毫米的大芯片,內含450億個晶體管,採用完全創新的架構,結果一次流片就成功點亮,從流片回來到把Linux跑起來只花了不到12小時,團隊半夜都守在實驗室不肯走。謝炎說這件事能一次成功他覺得很了不起,因為這不是一次小修小補的迭代,而是架構、編譯器、操作系統、模型團隊從一開始就綁在一起協同設計的結果。

— 謝炎
50:44

模型思想會趨同,壁壘最終落在硬件

謝炎判斷從長期看,模型算法層面的思想會越來越趨同,因為一個想法別人也能想到,人員流動也會讓大家很快朝同一個方向走,軟件模型層面能構建的壁壘最多是訓練成本的壁壘,而不是思想的壁壘。他認為未來真正的差異化壁壘來自硬件、或者基於硬件和硬件一體設計的軟件,這種壁壘有點像蘋果:大家都知道蘋果好,但因為它有自己的芯片、操作系統和應用體系,整套很難被複制,就算拿到芯片也做不出iPhone。

— 謝炎
54:47

芯片把端到端反應時間壓到0.28秒

謝炎說M100上車後支持馬赫VLA原生多模態模型,端到端的反應速度縮短到0.28秒。他把這類比成人從光子進入視網膜到做出動作的反應速度:反應越快越安全,同時因為處理粒度足夠細、反應間隔足夠小,剎車、轉向這類動作可以做得更細膩,不會頓挫,舒適感和安全性都和反應速度直接相關。

— 謝炎
1:10:02

團隊規模越小,反而協作效率越高

談到軟硬件團隊協同開發時,謝炎提出一個和直覺相反的做法:團隊規模要小。團隊一旦人多了就會想自成體系、不願意跟別人合作,因為自己力量已經足夠;如果一個任務理論上需要10個人,最佳配置反而是8個人甚至更少,這樣每個人能激發出的效率更高,而配置到15、20人反而會在內部長出很多細分組織,協作變得更困難。他把這種自發聚攏資源解決問題的方式比作點亮一團篝火。

— 謝炎

原話 · 已逐字校驗

其實在數據的架構裡面 你切一刀的話 在某一個時刻切下去 它的狀態是不固定的 有點像是薛定諤的芯片

在數據流架構裡,你在某一個時刻切一刀下去,它的狀態是不固定的,有點像薛定諤的芯片。

謝炎1:01

比如說當時可能一輛車光算力的成本 就要花掉2000美元以上 而且我們覺得是會越來越多 就是不是2000美元 不是一個只是個開始 它可能會變成4000 可能會變成8000 1萬

比如說當時可能一輛車光算力的成本就要花掉2000美元以上,而且我們覺得會越來越多,不是2000美元就是個開始,它可能會變成4000,可能會變成8000、1萬。

謝炎6:04

我們何德何德能做芯片 而且是一開始我們就提出來非常高的指標 不是說做一個芯片 只是克隆一下複製一下 而是我們當然提的目標 就是一個好幾倍的性能 比外購更低的成本 做到這種領先的程度 其實大部分人心裡是不確定的

我們憑什麼能做芯片,而且一開始就提出非常高的指標,不是克隆複製一個芯片,而是要做到好幾倍的性能、比外購更低的成本,這種領先程度其實大部分人心裡是不確定的。

謝炎9:08

我是一直覺得技術就是在進步 並不會因為我們把一些東西藏起來 別人就不會追上來 所以唯一的方法就是我們跑得更快

我一直覺得技術本來就在進步,並不會因為我們把一些東西藏起來,別人就追不上來,所以唯一的方法就是我們跑得更快。

謝炎14:22

你從第一心上想明白的一件事情 如果它可以被做到 它就必將被做到

你從第一性上想明白的一件事情,如果它可以被做到,它就必將被做到。

謝炎37:36

這種壁壘有點像蘋果 大家都知道蘋果好 但是你要複製給蘋果很難 因為蘋果有自己芯片 自己操作系統 自己的應用體系 你要把整套都複製了 非常難

這種壁壘有點像蘋果,大家都知道蘋果好,但你要複製蘋果很難,因為蘋果有自己的芯片、自己的操作系統、自己的應用體系,要把整套都複製非常難。

謝炎50:44

方法是 我覺得團隊規模要小 團隊規模大了之後 他就希望自成體系 然後不希望跟別人合作 因為我有足夠的力量

方法是,我覺得團隊規模要小,團隊規模大了之後就會希望自成體系、不願意跟別人合作,因為自己已經有足夠的力量。

謝炎1:10:02

數字與實體

M100峰值算力1280 TOPS15:23
M100實際運行效率約82%48:42
NPU計算單元數量56個完全同構的計算單元15:23
通用CPU核心數量24個A78 CPU核15:23
內存帶寬LPDDR5X子系統,273GB每秒15:23
端到端反應延遲0.28秒54:47

術語

dataflow architecture數據流架構
計算由數據到達驅動而非由指令順序驅動的芯片架構
test time training (TTT)測試時訓練
模型在推理運行階段仍持續訓練或更新參數的技術
just in time compiler即時編譯器
在程序運行時動態完成編譯,而非提前一次性編譯完成
software hardware co-design軟硬件協同設計
芯片硬件和上層軟件從一開始就同步設計、共同迭代

收聽指南

誰該聽

車企技術高管、芯片架構師,以及關注具身智能和自動駕駛硬件路線的投資人。

可跳過

29分鐘左右關於維度高低的類比有點繞,可以跳過,不影響核心論點。