世界太吵,來原聲聽播客

科技這碗飯

谷歌發明了 Transformer,卻把大模型時代讓給了 OpenAI

谷歌手裡同時握著 Transformer、TPU 和最多算力,卻因為搜索廣告的包袱和兩支 AI 團隊的內耗,把語言模型這條最關鍵的賽道讓給了 OpenAI。

谷歌DeepMindTransformer大模型組織管理AI芯片

原視頻在 YouTube 上放不出來,用音頻聽:

信息密度高,15 年谷歌 AI 的組織史講得很細,尤其後半段兩支團隊搶算力、搶發布權的細節,是別處少見的。

核心論點 · 點時間戳可跳到原聲

5:05

谷歌的底層問題一次性解決

2000 年谷歌索引五個月沒更新,工程師查了很多天找不到原因。Jeff Dean 和桑傑把一批看似無關的錯誤放在一起比較,發現是機器內存裡某一位二進制會莫名翻轉——為了省錢,谷歌服務器用的是不帶糾錯功能的便宜內存。他們沒有要求換更貴的機器,而是從軟件層面加一層保險,哪臺機器出錯就自動隔離。這就是兩人最典型的做事方式:不在表層修故障,而是深入底層把這一類問題一次性解決,讓其他工程師不必再考慮機器本身會不會出錯。

11:44

為神經網絡專門造一塊芯片

Jeff Dean 用語音一項做估算,做成兩頁 PPT 給管理層看:未來每個安卓用戶每天說三分鐘話,光處理這些語音,谷歌全球數據中心就要再擴大兩到三倍。他的辦法是專門為神經網絡造芯片,別的什麼都不管。這違背了他對芯片的一貫看法——專用硬件通常不是好主意,等造出來算法早換代了——但神經網絡是例外,圖片識別和語音聽寫底層都是同一類矩陣相乘。為了縮短時間,芯片直接做成插卡塞進服務器原本留給硬盤的位置,從項目啟動到裝進數據中心只用了 15 個月。

27:25

哈薩比斯給辛頓打的那通電話

辛頓在酒店房間用郵件辦拍賣大會,買家有谷歌、微軟、百度,第四個是哈薩比斯的 DeepMind。DeepMind 手上沒什麼現金,哈薩比斯報出的是價值 1000 萬美元的公司股票,差不多相當於整家公司的五分之一。價格很快超過他承受範圍,他退出後給辛頓打了個電話,說雖然本來只想出一千萬買你們,但我心裡覺得你們真正的價值是 5000 萬美元。這句話辛頓聽進去了,微軟高層私下加價 1000 萬他一度心動,最後還是回絕。谷歌最終出價 4400 萬美元買下辛頓和兩個學生。

35:31

別人看引擎蓋,他要看發動機

谷歌盡調團隊飛倫敦,Jeff Dean 也在其中,任務是替谷歌把關 DeepMind 說的東西到底是不是真的。當時 DeepMind 只有 50 個人還沒有收入,開出的價格卻是谷歌平時收購同等規模公司的兩倍,談判桌上不少人都覺得離譜,Jeff Dean 也覺得有點貴。PPT 放完後他提出一個要求:想看源代碼。演示可以包裝,代碼很難騙人。負責寫代碼的研究員一下子慌了,因為做研究時寫代碼只為儘快讓實驗跑起來,通常很亂很難讀。哈薩比斯後來把這一刻叫做度過盧比孔河——代碼一旦交出去,就再也沒有回頭之路。

49:52

AlphaGo 越成功,越不可能獨立

DeepMind 想借 Alphabet 重組從谷歌分出去,談了一年多,條款都落到了紙面上。但 Pichai 在電話裡說,其他賭注那一欄是留給跟谷歌主頁相距很遠的登月項目的,AI 已經不屬於這一類,它正在成為谷歌最核心的技術。哈薩比斯過去擅長的是先打一場足夠大的勝仗,再拿勝利去換下一階段的籌碼,但這一次籌碼變化的方向正好相反:AlphaGo 越成功,AI 在谷歌內部就越重要,越接近主頁核心,就越不可能被放進其他賭注。2021 年 4 月,哈薩比斯在全員會上宣布爭取獨立到此結束。

1:07:01

把搜索索引全扔掉,這個建議太瘋狂

Transformer 論文剛寫出來,作者之一沙澤爾就開始琢磨它的未來,找到谷歌高層提出一個近乎瘋狂的建議:把谷歌搜索用了這麼多年的索引全部扔掉,改用新架構訓練一張巨大的神經網絡,重新學習和組織谷歌掌握的全部信息,用戶問什麼就回答什麼。連跟他一起寫論文的合作者都覺得這個想法太瘋狂,提議不了了之。2018 年前後他和同事訓練了一個聊天模型 Mina,可以聊哲學、閒扯電視劇、還會獻諧音梗,兩人越做越覺得有戲。接下來幾年他們先後提過三次申請,包括開放給外部研究者試用、接入語音助手、做公開演示,三次都因為同一個理由被否決:不符合公司的 AI 原則。

1:27:12

同一個公司,卻要防著對方看文件夾

DeepMind 沒有自己的數據中心,谷歌的數據中心是一個巨大的公共算力池,搜索、油管、谷歌雲這些賺錢團隊和谷歌大腦、DeepMind 這些燒錢團隊共享同一個池子,想訓練模型得按額度排隊。DeepMind 和谷歌大腦常年爭人才、爭成績,爭得最多的是機器。2017 年年底為了讓機器學下國際象棋,光是自己跟自己下棋就同時佔了 5000 塊 TPU;第二年谷歌大腦訓練 BERT 一共用了 64 塊。GPT3 出來後兩個團隊目標都變成了語言模型,DeepMind 必須改掉文件夾名字,不能讓谷歌大腦知道自己瞄準的參數規模,於是 280B 換成了地鼠。

2:02:29

對手手裡一把尖刀,谷歌一抽屜刀

2025 年下半年 AI 最大的一塊生意轉向企業市場,企業花錢最多的不是聊天而是寫代碼,這塊市場有一半落在 Anthropic 手裡,另一半是 Cursor。谷歌的問題不是沒看到編程方向,而是做得太多,散落在各個部門,光是對外的產品就有五個部門做出六七款編程工具,彼此功能還有重疊。谷歌內部規定寫代碼原則上只能用自家 AI 工具,用第三方需要特別審批,但留了一個口子:能證明業務需要就可以申請特批。有幾位前員工說,谷歌 DeepMind 裡負責訓練 Gemini 的幾個團隊全都申請了 Cloud Code,理由是「最好的工程師就應該用最好的工具」。

原話 · 已逐字校驗

我們要做出人類歷史上最大的發明 他會把今天所有的產品 全部都重新做一遍 你如果非要我挑一個產品出來 當然可以 但你會這麼問問題 就說明你還沒有明白 我們到底在做什麼

我們要做出人類歷史上最大的發明,它會把今天所有的產品全部重新做一遍。你如果非要我挑一個產品出來,當然可以,但你會這麼問問題,就說明你還沒有明白我們到底在做什麼。

代碼一旦交出去 就再也沒有回頭之路了 全世界最懂這一行的一群人 把他的底牌看了一個遍

代碼一旦交出去,就再也沒有回頭之路了。全世界最懂這一行的一群人,把它的底牌看了一個遍。

如果你請來的是既有權勢 又看得懂這項技術的人 那麼他們不會甘心一直坐在場邊給你提意見 所謂的顧問 最後很有可能就是你的對手

如果你請來的是既有權勢、又看得懂這項技術的人,那麼他們不會甘心一直坐在場邊給你提意見。所謂的顧問,最後很有可能就是你的對手。

問題從來不是當時他們有沒有看到這條路 而是明明已經看見了 為什麼最後什麼都沒有做

問題從來不是當時他們有沒有看到這條路,而是明明已經看見了,為什麼最後什麼都沒有做。

12歲那年 哈薩比斯決定 他這一輩子最值得做的事情 就是把腦力用在科學上 46歲這一年 他站在一屋子的科學家面前說 我們不能只做科學了

12 歲那年,哈薩比斯決定,他這一輩子最值得做的事情就是把腦力用在科學上。46 歲這一年,他站在一屋子的科學家面前說,我們不能只做科學了。

他想要重新擁有一支 只有十來個人 只專注做一件事情的小團隊

他想要重新擁有一支只有十來個人、只專注做一件事情的小團隊。

數字與實體

谷歌大腦貓臉實驗處理器核心數16000 個9:07
谷歌自研芯片從啟動到進機房15 個月14:11
谷歌收購 DeepMind 價格約 6 億多美元36:32
AlphaGo 對戰李世石全球觀看人數2 億人41:34
DeepMind 2018 至 2019 兩年虧損將近 10 億英鎊1:28:12
谷歌大腦訓練 BERT 使用 TPU 數量64 塊1:28:12
DeepMind 下國際象棋佔用 TPU 數量5000 塊1:28:12
谷歌回購沙澤爾團隊花費約 27 億美元1:52:23

術語

Transformer變換器架構
谷歌 2017 年論文提出的神經網絡架構,用注意力機制取代逐詞傳遞,支持大規模並行訓練。
TPU張量處理單元
谷歌為神經網絡專門設計的自研芯片,2015 年裝進數據中心。
強化學習強化學習
讓智能體在行動中試錯、根據反饋調整策略的方法,AlphaGo 靠它學會下圍棋。
稀疏模型稀疏模型
把模型拆成多個小網絡,每次只調用其中一兩個,參數總量大但單次計算量小。
思維鏈思維鏈
讓模型先示範推理過程再給答案,正確率能提高好幾倍。
NeoLab新實驗室
行業對離開大公司後新辦、把研究放在產品前面的實驗室的稱呼。

收聽指南

誰該聽

適合關注大模型競爭格局的創業者和投資人,尤其是想理解為什麼技術領先不等於產品領先、組織內耗如何吃掉先發優勢的人。

可跳過

19:16 到 24:23 哈薩比斯童年和 DeepMind 創立的部分可以快進,信息密度低於後半段。