世界太吵,來原聲聽播客

張小珺·商業訪談錄

Operator 不是 O3 的延續,是推理伸向物理世界的第一隻手

OpenAI 2016 年做 Web Agent 失敗並裁掉二三十人,缺的是基座模型;十年後 Operator 把基座模型、人類數據和強化學習三件事湊齊,才讓推理從抽象文本走向視覺交互。

Agent強化學習多模態OpenAIOperator
吳翼是前 OpenAI 研究員、清華叉院助理教授,從強化學習視角拆解 Operator 的技術要點、Agent 分級和創業機會,信息密度高,適合想理解 Agent 技術路線的聽眾。

核心論點 · 點時間戳可跳到原聲

4:09

Operator 是閉環控制,O1 是開環

吳翼把 Operator 在 AGI 路線圖上的位置定義為「通用型的變化」:O1、O3 是在聚焦問題上思考的變身,但中間沒有環境交互,也沒有多模態。Operator 補上了這兩點——它能看到觀測、做一步動作、再看到新觀測,連續做很多輪交互,形成一個閉環控制系統。傳統大模型是開環的,給一個指令直接輸出,不要任何反饋;Operator 則會在輸出後主動調用,期待下一個反饋,再基於反饋做下一步思考。這個「橫軸」的通用能力,是通往通用智能體一定要有的。

— 吳翼
7:13

Operator 的思維鏈短,回溯發生在動作上

吳翼不認為 Operator 是 O1、O3 的簡單延續。他觀察 Operator 放出的思維鏈,相對來說是短的,回溯主要出現在動作上——比如點了個網頁半天沒點開,它會點後退。而 O1、O3 的思維鏈很長很長,有很多回溯。所以他傾向於認為 Operator 不是 O3 那麼極致的模型,更像是「一個多模態閉環的 O1,一個 Agent O1 的版本」,或者可能 3O1 一點的位置。它是在廣度上往寬裡走,而不是在深度上走到極致,因此還有空間。

— 吳翼
11:16

復刻 Operator 需要三件事,國內沒那麼遠

吳翼把 Operator 的技術要點拆成三件:一個好的原生多模態基座模型、高質量的人類數據和任務、一個高效率的大規模支持 Agent 的強化學習系統。第三件最麻煩,因為 Agent 環境裡模型吐了幾百個 token 後要去屏幕上點一下,你需要有電腦在那等著 AI 去點、做模擬,幾千卡或一萬卡規模下怎麼高效交互是個課題。但他判斷國內團隊追趕 Operator 沒有追趕 GPT 或 Sora 那麼難,路線清楚,很多基建本身已經在了,是一個 half there 的狀態。問題在於你不知道 OpenAI 水下有多少東西。

— 吳翼
20:21

OpenAI 第一個大項目就是 Web Agent,失敗了

吳翼回溯到 2016 年:OpenAI 成立後乾的第一個大項目就是 Web Agent,一個通用視覺智能體在網頁上點。當時他們只有強化學習,沒有基座模型,甚至沒有人去找數據標註,連傳輸都沒有,用一個大的 LSTM 叫 Covnet 去點網頁,用強化學習點,然後失敗,還把那個團隊裁了,裁了二三十人。吳翼在深度學習課上跟同學講這個故事,說當時的 missing recipe 就是基座模型——光靠強化學習不行,光靠好的基座模型也不太行,兩塊加起來才行。十年之後他們把這事做成了。

— 吳翼
24:27

三到四級是特別大的改變,不止兩三年

吳翼拆解 OpenAI 的五級分類:chatbot 是 reactive,你說一句我說一句;reasoning 是腦子裡想十秒鐘再說,有推理和規劃;agent 則多了一個外部世界,是三方過程,AI 的 scope 變大了。但一到三級都是 instruction following 或 instruction execution,給指令、完成、可以 verify 對錯。創新不一樣,你只能給方向性的東西,對錯沒有意義,要的是超越原來知識體系的好。吳翼認為三到四是個特別大的改變,可能不止兩三年就能做成。而四和五哪個先來不一定,組織可能被動形成——以後每個軟件都帶一個 agent,它們之間就會存在交互。

— 吳翼
34:34

短時間不會出現多 Agent 交互

吳翼的觀點是短時間內暫時不會出現多個 agent 之間交互的情況。因為如果目標是完成一個任務,一個足夠通用的大模型可以自己完成所有事情——O1 和 O3 已經證明,只要強化學習訓練到位、context 和記憶超級長,一萬個 token 也沒問題,推理過程依然清楚。多 Agent 交互一定發生在任務中間涉及到一個 AI 被動觸發的時候,比如以後所有網站進門也是一個 agent,或者你讓 AI 去豆包、ChatGPT 上查東西。但短時間大部分人機交互界面還是圖形化界面,還是為人設計的,所以未來一兩年還是單智能體狀態。

— 吳翼
40:46

Operator 的用戶數據比 Chatbot 值錢得多

吳翼同意廣密說的 chatbot 不能幫助提升智能——閒聊沒有智能,對話形式大部分 by default 不會出現深思熟慮的過程。但 Operator 不一樣:你什麼時候需要人幫你去點網頁,一般是帶著目的的,比如算個稅、定複雜行程,query distribution 跟 chatbot 很不一樣,比較重。所以如果能收集這樣的用戶反饋和最後完成信號,是有助於提高模型通用能力的。OpenAI 有一個選項是不提交你的用戶腳本,吳翼說這種帶著複雜任務的指令和是否完成的評判數據,非常適合強化學習訓練,而強化學習訓練如果一個難題被找到了,需要的數據量很少。

— 吳翼
59:05

Operator 是信號,不是物理世界的智能

吳翼一直有個觀點:智能分兩塊,一塊是純文本模態的推理,一塊是視覺信號的推理,兩者不太一樣。Operator 現在沒有真的到物理世界裡面去,它還是在軟件網頁層面,而網頁大部分是為人瀏覽設計的,文本概念比較強。所以它展現的是可能性的開端,沒有把可能性真正拖出去。它把能力拓展了,但智力上限沒有——純邏輯推理沒有比 O3 強,物理世界推理也沒到。吳翼用指針比喻:本來是個 90 度的指針一直往北走,現在 90 度往右擴了一點,可能到了 80 度,你不知道它會往哪裡走。

— 吳翼

原話 · 已逐字校驗

就是那個基礎模型 如果沒有好的基礎模型 光靠強化學習是不行的 但是你看光靠好的基礎模型 也不太行 對吧 還要加強化學習兩塊加起來

就是那個基礎模型。如果沒有好的基礎模型,光靠強化學習是不行的;但光靠好的基礎模型也不太行,還要加強化學習,兩塊加起來。

吳翼22:23

但是創新不一樣 創新其實是你只能給出方向性的 比如說我們知道學生 我們知道博士生寫論文 你其實不能說這個東西是對的還是錯的 因為對錯沒有意義了 因為如果要創新 它肯定是對的

但創新不一樣,創新其實是你只能給出方向性的。比如博士生寫論文,你其實不能說這個東西是對的還是錯的,因為對錯沒有意義了——如果要創新,它肯定是對的。

吳翼25:28

所以如果通過用戶那樣大量的反饋 它不能提高智能 只能提高這個產品的舒適度 所以這個是沒有問題的 但是我覺得operator 相對來說有一點點不一樣

所以通過用戶那樣大量的反饋,它不能提高智能,只能提高產品的舒適度,這沒有問題。但我覺得 Operator 相對來說有一點點不一樣。

吳翼39:46

它只是展現了 這個可能性的開端 它沒有把這個可能性 真正拖出去

它只是展現了這個可能性的開端,沒有把這個可能性真正拖出去。

吳翼1:00:05

數字與實體

OpenAI 2016 年 Web Agent 團隊裁員人數二三十人21:23
Operator 在 OS World 榜單上的分數30 多53:57
吳翼在 OpenAI 工作時間2019 年到 2020 年2:04

術語

CUAComputer-Using Agent
OpenAI 為 Operator 定製的、專門為交互和 Agent 使用訓練的模型。
GUI agent圖形界面智能體
通過鼠標鍵盤操作圖形界面完成任務的智能體。
close loop system閉環系統
輸出動作後接收環境反饋、再基於反饋做下一步決策的系統。
OS World操作系統世界基準
評估智能體在操作系統環境中完成任務能力的榜單。

收聽指南

誰該聽

想理解 Agent 技術路線和 Operator 定位的工程師、創業者與投資人,尤其是做強化學習、多模態或 Agent 產品的人。

可跳過

1:11:21 之後的收尾和訂閱口播可跳過。