世界太吵,來原聲聽播客

張小珺·商業訪談錄

AI 只是剛離地的萊特飛機,我們還不會控制它

深度學習奠基人謝諾夫斯基說,大模型缺的不是語言而是基底核——沒有價值函數、沒有長期記憶、沒有情緒,而這些腦區都能補上;真正的風險不是規模,而是沒人知道它會長出什麼。

深度學習大模型認知科學AI 監管腦科學
前半段是深度學習史的一手回憶(玻爾茲曼機、明斯基、喬姆斯基),後半段是對大模型缺什麼的機制判斷,信息密度高但需要一點耐心。

核心論點 · 點時間戳可跳到原聲

5:10

玻爾茲曼機是明斯基錯了的存在性證明

明斯基和 Papert 在感知機那本書裡證明了單層感知機的侷限,並在結尾斷言沒人能把學習規則推廣到多層。謝諾夫斯基和 Hinton 的做法是把單元從確定性的 0/1 改成概率性、會波動的單元,於是玻爾茲曼機成了「明斯基和 Papert 錯了」的存在性證明。它和反向傳播的關鍵差別是全部局部:不需要回傳誤差,只要在輸入存在和輸入撤走兩種條件下分別算輸入與輸出的相關性再相減,他們把撤走輸入那一相叫 sleep phase。代價是要等整個網絡達到平衡、算出平均相關性,算力消耗遠大於反向傳播。

— Terrence Sejnowski
8:10

玻爾茲曼機要求整個網絡全局相干

謝諾夫斯基用物理學的相變來解釋玻爾茲曼機的限制:層數越多,輸入往上走、再往下走,整個網絡必須變成一個單一協調的狀態,他稱之為 coherence,就像水變蒸汽的臨界點附近整個系統變得相干。這既是它的優雅之處,也是它慢的原因——必須逐層把這種相干性建起來。他同時強調,玻爾茲曼機在 80 年代就已經是多隱層的深度網絡,只是當時不叫這個名字,而且它既能做監督學習,也能學輸入的概率分布,不只是學一個分類映射。

— Terrence Sejnowski
17:20

明斯基的乒乓球機器人沒申請視覺預算

謝諾夫斯基講了一個他當面跟明斯基核實過的故事:AI 實驗室拿到的第一筆 DARPA 經費是造一個會打乒乓球的機器人,拿到錢之後才發現沒有申請寫視覺程序的經費,於是把它派給了一個研究生做暑期項目。50 週年紀念會上他問明斯基這是不是真的,明斯基糾正他說:不是研究生,是本科生。謝諾夫斯基由此推出符號主義的根本問題:問題越大,程序就越長,寫程序極其昂貴且不 scale,就算給幾十億美元寫幾十億行代碼也解決不了。

— Terrence Sejnowski
23:24

萊特兄弟學的是滑翔,不是扇翅膀

謝諾夫斯基用萊特兄弟反駁「看鳥學不會造飛機」:他們觀察的不是扇翅膀,而是鳥不扇翅膀時的滑翔,還自己建了風洞設計機翼。他們學的是原理不是細節——羽毛是輕而表面積大的材料,於是他們用木頭做骨架、蒙上帆布,得到同樣的高表面積和輕重量。Kitty Hawk 上只飛起來十幾二十英尺、飛了半英里左右,但那是原理驗證。他認為最難的問題其實是控制,後來靠機翼襟翼解決,而鳥轉彎時正是扭動翅膀。

— Terrence Sejnowski
28:27

光速有限,是超算和大腦共同的約束

謝諾夫斯基去德州參觀超算中心,對方說最難的地方是光速不是無限的——一納秒大約走一英尺,而一納秒正是千兆赫茲的時鐘週期,所以核心之間連線的時延變得至關重要。他指出大自然面對的是同一個問題:神經元之間有傳導延遲,而大自然已經解決了它。這正是他現在在做的工作——搞清自然怎麼解決延遲,再把它用到大規模並行架構的設計裡,繼續往上 scale。

— Terrence Sejnowski
33:40

他當眾問明斯基:你是魔鬼嗎

在 50 週年紀念會的晚宴上,謝諾夫斯基舉手問明斯基:神經網絡社區有人認為你是魔鬼,因為你讓進展停滯了幾十年,你是魔鬼嗎。他說自己生氣的不是明斯基的觀點,而是他對學生的態度——明斯基最後站起來對學生們說 shame on you,說他們做應用是失敗,不做通用人工智能。謝諾夫斯基認為這是濫用學生、傷害學生。明斯基被問到後開始大談複雜性和計算的本質,謝諾夫斯基打斷他說我問的是是非題,明斯基最後說 yes, I'm the devil。

— Terrence Sejnowski
37:57

自監督讓訓練數據變成半無限

謝諾夫斯基認為生成模型真正的突破是自監督:以前做物體識別要人工標註圖片,成本高且受限,網絡越大就需要越多數據,數據量反過來限制了網絡規模。自監督什麼都不用標,只要訓練它預測句子裡的下一個詞,就能把各處所有句子都喂進去,訓練數據變成 semi-infinite,規模限制消失。他承認還有很多重要的技術細節,但這一條是讓他意外的那條——沒人預料到大模型會具備這些能力,最讓他吃驚的是它們的英語語法完美到不像人類。

— Terrence Sejnowski
45:08

大模型缺的是基底核,不是語言

謝諾夫斯基說他正在寫一本關於新語言模型的書,裡面有一個他認為別人沒看懂的點:不能怪 GPT-3,它沒有父母。人腦裡負責強化學習的是皮層之下的基底核,它學習達成目標的動作序列,需要世界反饋什麼是好什麼是壞,AlphaGo 正是深度學習網絡加一個給所有局面賦值的強化學習引擎兩部分。大模型沒有價值函數,這是缺失的一環。他還說情緒比語言更容易裝進去,長期記憶也一樣——只要模擬海馬體,而大腦裡這樣的部件有上百個,現在的大模型只有皮層那一部分。

— Terrence Sejnowski

原話 · 已逐字校驗

it proved that Minsky and Papert were wrong

它證明了明斯基和 Papert 是錯的。

Terrence Sejnowski5:10

as the problem gets bigger and bigger if you try to solve it with writing a computer program the program gets bigger and bigger and that's very labor intensive

問題越來越大,如果你想靠寫程序解決它,程序就會越來越大,而這是極其勞動密集的。

Terrence Sejnowski18:20

i thought i was angry not because of what he said but the way he said it to his students

我想我生氣不是因為他說的內容,而是他對他學生說話的方式。

Terrence Sejnowski33:40

the only thing we can be absolutely sure of is that it's not human it's not human it's an alien

我們唯一能百分之百確定的是:它不是人,它不是人,它是一個異類。

Terrence Sejnowski43:01

You can't blame GB3. They didn't have parents.

你不能怪 GPT-3。它沒有父母。

Terrence Sejnowski45:08

what you should be capping is a capability not the size

你該設上限的是能力,不是規模。

Terrence Sejnowski53:23

the most important things that will come out of it are ones that we can't even imagine that we don't even know about yet

它帶來的最重要的東西,是我們現在根本無法想像、甚至還不知道存在的那些。

Terrence Sejnowski1:00:38

if anybody tells you that oh it can't do general artificial intelligence right well just wait for tomorrow it's a moving target

如果有人告訴你它做不了通用人工智能,那就等明天再說,這是一個移動的靶子。

Terrence Sejnowski1:01:43

數字與實體

人腦連接/參數數量級10 的 14 到 15 次方,比當前模型多約一千倍12:12
當前模型參數量級最高約一萬億(a trillion)11:12
AlexNet 在 ImageNet 上降低的錯誤率20%13:16
靈長類視覺皮層的處理層級約 12 層13:16
NeurIPS 會議規模線下約 16000 人,線上約 3000 人,合計約 19000 人50:12
訓練一個大模型的成本數千萬美元、數月機時56:28
光速對應的時延一納秒約走一英尺28:27

術語

Boltzmann machine玻爾茲曼機
把單元改為概率性、會波動的多層網絡,用局部相關性學習,是深度網絡的前身。
self-supervision自監督
不需要人工標註,用數據本身構造訓練目標,如預測句子中的下一個詞。
basal ganglia基底核
皮層之下負責強化學習的腦區,學習達成目標的動作序列,需要外部反饋。
hippocampus海馬體
負責長期記憶形成的腦區,大模型目前沒有對應部件。
stochastic parrots隨機鸚鵡
批評者給大模型起的貶稱,指其只是複述統計規律而不理解語義。

收聽指南

誰該聽

做模型和 AI 產品的工程師、關注 AI 長期判斷的投資人,以及想補深度學習早期一手歷史的人。

可跳過

開頭關於他個人求學經歷和物理背景的部分可以快進。