多模態缺的不是架構,是視覺空間裡的思維鏈
圖像的理解、生成、人類對齊三者天然割裂,因為圖像來自大自然、不包含人類對它的理解;生成模型至今還停在語言模型「一口爆」的原始形態,連 CoT 都沒有。
原視頻在 YouTube 上放不出來,用音頻聽:
核心論點 · 點時間戳可跳到原聲
對比學習學的是人工設計的不變性
張祥雨在 21 年底就想明白了為什麼 contrastive learning 和 MIM 都沒有 scaling 特性:它們學到的不是數據賦予的不變性,而是 handcraft 的不變性。contrastive learning 極度依賴 augmentation,分子部分在學一種你人工設計的不變性,分母部分相當於一個 regular 在防止信息坍縮;MIM 學到的是遮擋不變性,而遮擋不變性只是必要條件,不是充分條件。NLP 之所以 work,是因為它真正做到了「語料越好、模型越強」的壓縮學習;CV 這邊你設計了幾種不變性,模型就只學那幾種,數據再多也沒有信息增量。
— 張祥雨圖像的理解、生成、對齊是割裂的
張祥雨從三個維度拆解:GPT 這類自迴歸模型建模了聯合概率,就同時擁有了生成、理解和人類對齊——前文會改變後文的條件概率,這就是理解;語料來自人類,建模它的分布就完成了對齊。但靜態圖像不是自迴歸的:你能做出一個完美建模圖像像素聯合分布的生成模型,可這個聯合分布有無數種建模方式,沒有任何約束要求它剛好符合人類對圖像的理解方式。圖像是大自然的創造,它不管你人類怎麼理解。所以靜態圖像上做再多東西,都很難形成人類意義上的智能。
— 張祥雨生成和理解放一起,摘掉一個另一個不受影響
23 年 Step1 就把所有數據組織成圖文混排,圖像和文字 tokenize 到同一空間,外掛一個預訓練好的 diffusion 做圖像生成。結果文字部分效果不錯,圖像理解尤其好,字寫在圖上問問題和 OCR 出來問問題效果幾乎一樣——但生成效果特別差。更打擊人的是:訓練到某個階段把生成部分去掉,理解部分完全不受影響。他做了大半年,得到一個越來越強的理解模型和一個越來越強的生成模型,放在一起沒有一加一大於二的效果,隨便摘掉一個另一個既不變強也不變弱。生成分支的可控性依然極差,會生成肢體畸變、違反幾何約束、違反物理常識的視頻,而理解模型自己都能準確指出這些不符合常識。
— 張祥雨模型越大,數學推理反而先升後降
Step2 是萬億參數、激活 200 多 B 的巨無霸,訓了九個多月。結果這個模型文科極強、寫作極強,理科尤其是數學還不如一個更小的模型。他們從 1B 到 7B 到 30B 到 70B 做了一系列嚴謹測試,確認:通用對話能力、情商、知識量確實越大越強,但推理能力尤其是數學,表現為先上升、再平緩、再擴大反而下降。張祥雨說這在去年那個時間點還是業界非共識,因為很少有人真做到這麼大、把增長曲線的後半段畫下來。
— 張祥雨壓縮率最大化和算對,是兩個目標
他給了一個思想實驗:數據集裡 50% 是互聯網語料,十幾個數字相加直接給結果、沒有過程;50% 是精心清洗的、一步步相加的過程數據。理論最優是模型以 50% 概率直接輸出結果、50% 概率一步步算。但小模型參數量有限,擬合不了「直接出結果」這個複雜函數,只能學會右邊那條一步步算的路徑——這就是生成模型裡的特徵坍縮。大模型不一樣,Step2 激活 200 多 B,真的能十幾個兩位數相加一口爆出答案,大概 90% 概率是對的。問題在於:如果以壓縮率論英雄,大模型壓縮率更高;但數學題要求的是算對,不是分布更接近預訓練語料。大模型總有傾向「覺得它行了」就跳步,90% 對,10% 錯,錯一步整題就廢。
— 張祥雨一個 token 之內做不出關鍵決策
為什麼 RL 之前不 work?張祥雨說關鍵在於 critical decision:模型走到某一步,面前有左右兩個分支,這件事能不能在一個 token 之內解決?他認為對很多問題不可能。比如大數乘法,Transformer 單步做點積的複雜度是 O(n),而乘法至少是 O(n²),複雜度超過單步上限就做不對。數學題還依賴巧妙構造,你在構造那一刻只能憑感覺,算完之前不知道行不行。更麻煩的是數據裡同時存在兩類題:走到這個點,60% 概率走左分支對;換幾個數字的另一道題,40% 走左才對。模型無法同時最大化兩類題的正確率,所以永遠到不了 100%。解法就是允許兩條分支都走——引入反思。
— 張祥雨反思 pattern 在預訓練語料裡本來就有
o1 激發的反思 pattern,比如 wait、recheck、verify、大循環、審題,不是無中生有。張祥雨發現這些 pattern 在預訓練語料中都有分布,雖然非常少——典型的是 Stack Overflow 上高讚的答案,作者會先嚐試求解,解著解著發現不對勁,寫「等等,我少考慮了一個因素」,加上去發現之前的方法完全不 work,陷入 stuck,最後用另一種形式呈現結果。國內論壇則相反,喜歡用「注意到」把腳手架全部裁掉,顯得自己很牛,這種語料模型看多了是災難,因為它把真實的思考過程隱藏了。預訓練裡的 pattern 雖然稀疏,但由不同人和機構生成、涵蓋不同領域,跟其他數據形成全連接,所以 cold start 激發出來再用 RL 強化,就能順帶把相連的廣大領域都激發出來。
— 張祥雨在圖上圈點批註,預訓練里根本沒有
為什麼視覺空間做 Long CoT 效果不好?因為圈點批註這些動作全是人工合成的數據,pattern 過於固定,在預訓練語料中根本不存在——誰解冪公式會真的從第一張圖走一步、第二張圖再走一步?而 o3 對圖像的處理看起來更原始,只做 crop、resize 這類簡單編輯,但泛化性很強。原因是圖文混排語料裡大量存在這種模式:電子維修論壇上有人傳一張圖問收音機哪裡壞,底下就有人把局部放大,說你看這裡電容 12 號、那個電阻什麼故障。所以 RL 這一步並不能無中生有,所有知識和能力都已經在分布裡了。
— 張祥雨長上下文不是智能,是智能的倒費
張祥雨對 long context 有不同看法。標準 Transformer 的 context 隨數據同等比例增長,不做任何壓縮,這跟人類記憶完全不同——人開完會只記最重要的細節,不會記住第多少分鐘桌上幾個水杯。人類是分層記憶:短期記憶兩到四秒,中期記憶從分鐘到星期不等、會遺忘、抓重點、靠反覆刺激增強,長期記憶固化下來。而 Transformer 只有短期記憶,還太長了。更麻煩的是隨著 context 增長,模型性能反而下降:讓它連續做一百道題,越往後性能急劇下降,attention 明顯渙散,因為太多相似 context 沒清空,模型要花大量精力避免干擾。他說這些訓練不是智能的表現,是智能的倒費。
— 張祥雨RL 的瓶頸是環境不能 scaling
張祥雨說 Rubase RL 最大的問題是環境不可 scaling:要解編程問題就得搭環境,配 Docker、輸入輸出、測試數據,結果只產生一條數據,效率太低。大廠現在找很多工程師一個個寫 Rubase,但這跟人類不一樣——人類是自驅的,自己看文章、自己搭環境、從環境反饋中學習。他舉了個很小的例子:老師評價作文會說第一段不錯、第二段稍微兇持、第三段銜接不行、第四段有錯別字、整體略顯乾巴、篇幅太短,從多個維度評價;但今天的 RL 把每條評價單獨加個權,這個 0.1 分、那個 0.5 分,最後說得了 7 分,完全丟失了評價維度,模型只能靠大量樣本去猜打分規則。
— 張祥雨原話 · 已逐字校驗
我們做這一行,很多人都說,OE,做OE,或者做思考,本質就是PAT,就是OE。
我們做這一行,很多人都說,做 o1、做思考模型,本質就是 pattern。
張祥雨53:21
你不是有一個critical,或者你不知道從左走還是右走,沒關係,你自己隨便選,選到底,你意識到不對,你可以反悔。
你不是遇到一個 critical decision、不知道走左還是走右嗎?沒關係,你自己隨便選,選到底,意識到不對,你可以反悔。
張祥雨1:07:28
我還一直強調一個觀點,架構不重要,架構是服務算法和系統。
我一直強調一個觀點:架構不重要,架構是服務算法和系統的。
張祥雨2:06:54
數字與實體
| Step2 訓練時長 | 九個多月 | 40:19 |
| 大模型直接輸出多位數相加結果的正確率 | 約 90% | 47:19 |
| 數學序列中的關鍵決策點數量 | 四五千長度的數學序列,不超過十個 critical decision | 58:21 |
| 人類短期記憶時長 | 兩到四秒 | 1:47:46 |
| 視覺信號按碼率估計的 token 量 | 兩到四百,約三十萬個 | 1:50:46 |
術語
- next token prediction下一詞預測
- GPT 的核心範式,本質是聯合概率建模,等價於對數據做無損壓縮。
- critical decision關鍵決策點
- 長思維鏈中真正影響最終結果的分叉點,數量很少,RL 實際要搜的就是這些。
- Meta-CoT思維鏈的思維鏈
- o1 範式的本質,讓模型在多種 CoT 之間自由切換、組合,解決網狀複雜問題。
- feature collapse特徵坍縮
- 模型能力或訓練不足時只建模分布中最簡單的模式,擬合不上複雜函數。
- environment scaling環境擴展
- RL 時代的新瓶頸:搭環境產生訓練數據的效率太低,無法像數據那樣規模化。
- Linear Transformer線性 Transformer
- 把注意力複雜度降到線性的架構變體,張祥雨認為它不本質,因為架構服務於算法。
收聽指南
做大模型預訓練、多模態、後訓練與 RL 的研究員和工程師;想判斷多模態與自主學習時間表的創業者和投資人。
開頭 12 分鐘 ResNet 與 CV 學習史的個人經歷,可只聽結論。