28納米芯片反超1000倍:不用EUV的存算一體黑魔法
知存科技把28納米Flash做成存算一體芯片,靠陣列越大能效越高的物理特性,讓效率隨模型變大反而提升,Transformer對它是純粹利好。
核心論點 · 點時間戳可跳到原聲
創業前,行業沒人相信存算一體
王紹迪讀博期間就想做存算一體芯片,2016年博士畢業前找過中美四五家頭部芯片公司,沒人聽說過這項技術,不可能讓公司為一個應屆博士開闢新方向;轉向高校也碰壁——北大老師直接問經費從哪來,當時全國給芯片的經費能超百萬的都很少,連流片都流不起。兩條路都走不通,最後只能自己創業。
— 王紹迪模型越大,讀取反而越快
傳統馮諾依曼架構做矩陣乘法要把存儲單元裡的數據一個個讀出來送到運算器裡算,存儲陣列越大,讀出數據反而越慢,這是物理規律決定的。存算一體則是把每個存儲單元本身變成矩陣乘法裡的一個計算節點,一次開啟就能完成一整個矩陣的計算,不需要逐行逐列讀取。這意味著算法規模從幾行變成一萬行,也只需要開啟一次,等效帶寬和算力反而隨模型變大而變大,跟馮諾依曼架構的規律正好相反。
— 王紹迪歐姆定律就是黑魔法的原理
存算一體的核心是用歐姆定律裡電壓乘以電導等於電流的物理關係直接實現乘法:給存儲器的行方向輸入電壓,每個存儲單元本身就是一個電導值,列方向自然流出的電流就是電壓乘電導的乘積;同一列裡多行的電流匯聚在一起,物理上就完成了加法。整個矩陣乘法在一次讀取裡就算完了,完全不需要數字芯片裡的加法器、乘法器電路,本質是拿初中物理裡最基本的電學關係去做AI計算。
— 王紹迪為什麼押注最普通的Flash存儲器
面對SRAM、非易失性Flash、學術界熱議的RRAM等多種存儲介質,知存選了看起來最不起眼的NOR Flash,原因是Flash做模擬乘法所需的計算電流是所有存儲器裡最低的,而存算一體需要同時開啟的存儲單元越多、能並行處理的規模越大,電流越低意味著能開的陣列越大、等效算力越強;Flash也是最成熟的存儲工藝,流片調試速度最快。代價是精度攻堅,公司幾百人花了七八年時間才把精度做到滿足應用需求。
— 王紹迪Transformer對存算一體是純利好
從深度學習轉向Transformer後,存算一體反而獲得兩重紅利:一是深度學習常一次讀參數要算上萬次,存儲帶寬壓力不大;Transformer每個參數讀一次只算一次,讀取計算比天生1比1,而GPU這類架構通常是64比1到128比1,差的能到1000比1,正好完美匹配存算一體存儲計算比也是1比1的特性。二是Transformer的矩陣規模比深度學習大了1000到1萬倍,存算一體是整個矩陣一次算完,矩陣越大計算效率也跟著提升1000到1萬倍。此外大模型只需INT4的4比特精度,遠低於深度學習時代要求的12到16比特,落地門檻因此大幅降低。
— 王紹迪四年六次流片,點亮才是噩夢開始
存算一體沒有現成的EDA工具,每次流片回來的芯片可能藏著幾十個問題,比如設計目標8比特精度實際只做到3比特,團隊要一個個去定位——花一個多月把芯片切開反覆做實驗才定位出一個問題,修復後發現精度幾乎沒提升,因為還有其他幾十個問題在拖後腿,只能重新設計實驗、再切芯片再找下一個問題。對普通芯片,點亮意味著任務完成;對存算一體,點亮才是debug的開始。這樣的循環持續了四年、經歷六次重大失敗,公司迄今前後流片已接近三十次。
— 王紹迪安克耳機:從耳機到吉尼斯世界紀錄
2023年ChatGPT帶火生成式模型後,安克算法團隊找到知存,想在耳機裡跑生成式音頻算法做通話降噪,但這需要算力強、容量大、功耗低同時體積小成本可控的芯片,用馮諾依曼架構幾乎不可能實現。知存用28納米NOR Flash存算一體芯片承接了一個幾百萬參數的Transformer模型(此前耳機芯片能裝下的參數一般不到50萬),耗時近三年攻克,最終拿到通話降噪人聲還原度最高的吉尼斯世界紀錄,且大幅領先第二名,被王紹迪稱為對傳統耳機音頻芯片的降維打擊。
— 王紹迪中國不需要EUV,但存算一體需要中國速度
王紹迪認為存算一體的長期優勢在中國的製造和迭代速度:中國消費電子和新能源汽車產業鏈能把材料、零部件到產品的整個鏈條壓縮到很短週期內快速迭代,這是海外做不到的,而存算一體恰恰需要材料設備、代工、設計公司到產品應用之間最短距離的交互反饋。他判斷存算一體未來有機會從耳機等細分場景的協處理器,成長為統一端側各種專用算法的通用存儲器——就像這項技術在被真正做出來之前,市場根本不存在一樣。
— 王紹迪原話 · 已逐字校驗
跟美國和中國的 頭部的芯片公司 我們聊過四五家 大家都沒聽過這個東西
我們跟中美的頭部芯片公司聊過四五家,大家都沒聽說過存算一體這個東西。
王紹迪4:00
不是說我們一兩個人做 是我們公司幾百個人做了七八年的時間 把它做到滿足應用的需求
不是我們一兩個人做,是公司幾百個人花了七八年時間,才把它做到滿足應用需求。
王紹迪13:02
因為每個存儲單元裡面只能裝下1000到2000個電子 相當我用1000到2000個電子 才去實現一個線性的256等分 這個難度是很大的
因為每個存儲單元裡只能裝下1000到2000個電子,相當於要用這1000到2000個電子去實現一個線性的256等分,這個難度非常大。
王紹迪14:02
現在的GPU可能是64比1 128比1 做得很好的是32比1 做得差的可能是1000比1 但是存存一體天生就是1比1
現在GPU的讀取計算比可能是64比1、128比1,做得好的是32比1,做得差的可能到1000比1,但存算一體天生就是1比1。
王紹迪16:04
純研一體前期投片失敗 我覺得是一個必經的事情 我們其實前前後到現在 可能有三十次投片都是有了
存算一體前期流片失敗,我覺得是一個必經的過程。我們前前後後到現在,大概已經有三十次流片了。
王紹迪21:05
對於很多芯片 點亮是認為已經任務完成了 我們的點亮是災難的開始
對很多芯片來說,點亮就意味著任務完成了;對我們來說,點亮才是災難的開始。
王紹迪25:06
這個芯片在安克蘭機上 獲得了通話降噪 是人生還原度最高的吉尼斯世界紀錄 而且遠高於第二名
這顆芯片在Anker耳機上,拿到了通話降噪人聲還原度最高的吉尼斯世界紀錄,而且遠高於第二名。
王紹迪32:10
數字與實體
| 早期流片失敗 | 4年6次重大失敗,累計約30次流片 | 21:05 |
| 存算一體讀取計算比 | 天生1:1(GPU約64:1至128:1,差的達1000:1) | 16:04 |
| Flash單元計算電流 | 10納安到100納安(其他存儲器幾百納安到幾十微安) | 12:02 |
| Flash精度攻堅耗時 | 公司幾百人做了七八年 | 13:02 |
| 未來能效提升空間 | 未來三年每年3-5倍,疊加製造端改進最多可能到幾千倍 | 20:05 |
| 公司研發團隊規模 | 500多名研發人員,近100位博士 | 27:07 |
| 耳機芯片參數量與工藝 | 400萬到600萬參數的Transformer模型,28納米NOR Flash工藝 | 33:11 |
術語
- Von Neumann architecture馮·諾依曼架構
- 存儲與計算分離、需要來回搬運數據的傳統芯片架構
- NOR FlashNOR閃存
- 知存選用的非易失性存儲介質,計算電流遠低於其他存儲器
- NAND FlashNAND閃存
- 三維堆疊的高密度閃存,讀寫較慢但容量極大,適合存大模型
- EDA電子設計自動化工具
- 芯片設計驗證用的軟件工具鏈,存算一體領域目前幾乎空白
- INT44比特整數精度
- 大模型推理常用的低精度格式,對存算一體的門檻遠低於早期深度學習
- Universal Memory通用存儲器
- 容量大、速度快、能同時兼顧多場景的理想存儲器概念
收聽指南
關心AI芯片底層架構的工程師、半導體投資人,以及想理解算力瓶頸本質的創業者
開頭北大求學經歷的閒聊可以跳過,不影響理解後面技術內容