模型是煉油廠:第一階段的贏家不是最後的贏家
商業史上第一波跑出來的公司幾乎從不是下個階段的贏家。模型公司是提煉基礎油的煉油廠,值錢的是化工廠和汽車公司。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
GPU 的勝利不是遠見,是堅持
1999 年 GeForce 256 把三維計算從 CPU 裡拆出來,2001 年引入可編程 shader,GPU 才變得可編程。2004 年 Brook for GPU 把底層圖像硬件抽象化,做出 CUDA 的前身。關鍵判斷:老黃並不是看見了 AI,2012 年英偉達對 GPU 的設想裡基本不包含現代 AI 的東西,ATI 當時也做了類似 CUDA 的東西,只是沒堅持住退出了市場。Cuda 早期讓顯卡遊戲性能沒提升、BOM 成本幾乎翻倍,老黃為此堅持了大約十年才等到科學計算的產出。
— 謝金馳ResNet 之前,模型越大反而越差
2015 年人們發現模型堆到 100 層以上不但不會更好,反而更差,這叫模型退化,也就是說今天大家熟知的 scaling 在當時其實不 work。ResNet 引入殘差,把學習目標從「把 X 直接變成 Y」改成「在 X 上做多少增減變成 Y」,後者學習難度更低,同時緩解梯度消失和爆炸,幾乎消解退化問題。此後才能訓練幾百層甚至幾千層的網絡,在此之前通常限制在幾十層。這篇論文引用量接近 30 萬,比 Transformer 更高。
— 謝金馳AlphaGo Zero 啟發了 thinking 模式
AlphaGo Zero 只用強化學習,不給模型任何人類先驗知識,模型只知道圍棋的格子和規則,不知道棋譜、氣、眼。它比擊敗李世石的版本用了更少的卡,只訓了 36 個小時就取得超越。更深遠的影響是它每走一步都執行 1600 次 MCTS 搜索,這啟發了 OpenAI 在 test time 做 scaling,也就是 O1 的 thinking 模式。一個反直覺的點:如果模型不做 test time computing,模型能力其實並沒有我們想像那麼強。
— 謝金馳COT 把 scaling 重心從預訓練轉向後訓練
過了 2017 年大家拼命 scale 模型,但在算術、常識、符號推理領域收益不明顯,不是所有領域都有 scaling law。同時用 SFT 解決推理問題,構建推理數據集成本很高,要請很多博士來做。COT 發現只要向模型展示推導的中間步驟,就能大幅提高推理任務表現,這就是「請你一步一步思考」的來源。它讓整個行業意識到很多能力其實已經蘊含在模型裡,只是沒被激發出來,scaling 重心從預訓練轉向後訓練,也影響了後來 thinking 模型的誕生。
— 謝金馳OpenAI 和 DeepMind 對 scaling 有分歧
兩篇 scaling law 論文發現語言模型訓練和 loss 之間存在對數線性關係,可以用小模型實驗預測放大後的效果,避免花三個月開盲盒。但兩家結論不同:OpenAI 建議在給定計算預算下訓儘可能大的模型,即使這意味著提前停止訓練;DeepMind 認為這會導致很多模型訓練不足,主張模型規模和訓練 token 數等比例擴展,參數翻倍數據也翻倍。DeepMind 還證明用更多數據訓練更小的模型,比用更少數據訓更大的模型更好,因為小模型推理成本低,這就是現在很多小模型用過量數據訓練的原因。
— 謝金馳萬卡訓練全世界只有三家公司有經驗
2020 到 2022 年期間,全世界大概只有三家公司有把一萬張卡連起來訓練的經驗:OpenAI、Google、DeepSeek。DeepSeek 搭螢火蟲二號時就是一個很大的集群,用不完,還讓大學老師和學生通過學術理由申請使用。把一萬張卡連起來當一張卡用,挑戰在訓練效率和訓練穩定性:卡越多不一定越好,弄不好一萬張卡的效率還不如一千張;GPU 在萬卡尺度上會壞,有物理損壞,也有比特翻轉,需要一套深度可觀察的系統來監控、診斷、歸因、自動定位故障和自動恢復。
— 謝金馳DeepSeek 貼著 H800 的帶寬限制做設計
DeepSeek 的卡是 H800,特點是帶寬比較窄。帶寬窄的時候做張量並行,模型傳不過去,比如帶寬只有 80G、要傳的模型有 20G,就只能切 4 張卡,想切 5 張就堵住了。他們的並行設計正好貼著 H800 的限制,實現了幾乎的計算和通信平衡,計算不需要等通信。現在訓練裡 MFU 只有 50% 甚至不到,也就是說接近一半的 GPU 算力被空置,理論上如果能做到 100%,就可以少買一半的卡。
— 謝金馳1.3B 的模型調教後比 175B 更聽話
GPT-3 雖然強大但不好用,會生成不真實、有毒、無助於用戶的內容,指令遵循能力差,這些問題並沒有隨著 scaling 改善而改善,從 GPT-1 的 0.1B 放大一萬倍也沒徹底解決。InstructGPT 用基於人類反饋的強化學習,僱了 40 多個合同工構建 SFT 數據和排序數據,把優劣信號放大一兩個量級。結果發現 1.3B 的 GPT-3 經過這種方法調整後,在遵循指令方面比 1750 億參數的 GPT-3 還要好,參數量縮小了 100 倍。這讓行業意識到除了單純擴大模型,優化後訓練方法的提升也非常大。
— 謝金馳原話 · 已逐字校驗
那麥說我們不提供對模型解釋 為什麼模型work的任何解釋 如果它work 那我們把它歸為神的仁慈
那麥說,我們不提供對模型為什麼 work 的任何解釋。如果它 work,那我們把它歸為神的仁慈。
謝金馳1:00:42
所以發現一個好問題 核心問題很關鍵 對而且你會發現 你會發現 如果我們回過頭來看 這些好問題 好像沒有那麼的難
所以發現一個好問題、核心問題很關鍵。而且你會發現,如果我們回過頭來看,這些好問題好像沒有那麼的難。
謝金馳1:38:04
他說我們從能夠智能搞到70年 發現利用計算的通用方法 最終最為有效 且優勢顯著 他說根本原因在於某個定律 或者說更廣義的計算單位成本的 持續指數級下降
他說我們從能夠智能搞到 70 年,發現利用計算的通用方法最終最為有效,且優勢顯著。根本原因在於某個定律,或者說更廣義的計算單位成本的持續指數級下降。
謝金馳1:43:08
所以AI研究者 試圖將知識編碼入其智能體 這在短期內總是有效 且令人的個人滿足 它有收益 但長期會陷入平臺期 甚至阻礙進展 而突破性的進展 最終來自相反路徑 通過搜索 searching和learning 搜索和學習 實現計算規模擴展
所以 AI 研究者試圖將知識編碼入其智能體,這在短期內總是有效且令人個人滿足,它有收益,但長期會陷入平臺期甚至阻礙進展。而突破性的進展最終來自相反路徑:通過搜索(searching)和學習(learning)實現計算規模擴展。
謝金馳1:46:11
你會發現 如果你不用標籤的數據來訓練的話 模型會失去對人體結構的理解能力
你會發現,如果你不用標籤的數據來訓練的話,模型會失去對人體結構的理解能力。
謝金馳2:09:24
數字與實體
| AlphaGo Zero 訓練時長 | 36 小時 | 1:12:48 |
| AlphaGo Zero 每步 MCTS 搜索次數 | 1600 次 | 1:12:48 |
| ResNet 引用量 | 接近 30 萬 | 54:38 |
| GPT-2 參數量 | 15 億 | 2:54:57 |
| InstructGPT 僱用的合同工數量 | 40 多個 | 3:02:06 |
| LAION-5B 圖文對數量 | 5B | 2:07:24 |
術語
- MFU模型浮點運算利用率
- GPU 算力實際被使用的比例,現在通常只有 50% 甚至不到。
- MOE混合專家模型
- 超大參數模型每次推理只激活一小部分參數,降低推理成本。
- COT思維鏈
- 讓模型展示推導的中間步驟,從而大幅提高推理任務表現。
- LoRA低秩適配
- 在模型旁掛一個小矩陣做微調,不改變原模型,推理時可合併。
- RLHF基於人類反饋的強化學習
- 用人類排序數據訓練獎勵模型,再強化學習調整模型行為。
- 光流optical flow
- 相鄰幀相減得到的運動影子,包含視頻中的運動信息。
收聽指南
想系統補 AI 論文但不知從何下手的工程師和產品經理,適合當工具書按章節跳聽。
1:52:58 到 2:21:28 的 Infra 和數據部分,嘉賓自認了解較少,可快進。