世界太吵,來原聲聽播客

Latent Space

OpenAI 一週內抄出競品 API:根本沒訓練新模型

決策 API 的誕生是看到對手產品爆火後的應激反應,OpenAI 一週內就做出競品,秘訣是直接在現有 Luna 模型上加結構化輸出和批量並行推理,根本沒訓練新模型。

Computer UseAgents APIDecisions APIOpenAI DevDay推理成本Agent自動化

原視頻在 YouTube 上放不出來,用音頻聽:

前半段是產品發布會常規復述,後半段關於 Decisions API 誕生過程和 Computer Use 底層機制的內容信息密度更高,值得聽到最後。

核心論點 · 點時間戳可跳到原聲

4:53

「Computer Use 兩年沒進步」被當面反駁

有主持人提到某頭部AI播客幾個月前說過 Computer Use 兩年沒有實質進步,這個說法被直接擺上檯面。Ari Weinstein 的回應很乾脆:那是幾個月前的判斷了,Computer Use 現在和當時已經「180度大轉變」。他的從業背景支撐這個判斷——做過蘋果 Shortcuts、創業做 Sky,再到現在帶 OpenAI 的 Computer Use 團隊,一直在做計算機自動化,這次反駁建立在他親眼看著模型能力躍遷的基礎上。

— Ari Weinstein
5:57

能力躍遷的關鍵不是更聰明,是會自己糾錯

Ari 指出,過去一年最大的變化不是「能不能開始做任務」,而是「卡住之後會不會自己排查」——模型現在很擅長調試、重試、反思哪裡沒做對。與此同時 harness 層面也在升級:模型不再是一步步點擊截圖,而是直接寫 JavaScript 代碼一次性執行多步操作,並按任務需要在截圖、無障礙接口(accessibility)、Playwright 之間切換模態,這是速度提升背後的核心機制。

— Ari Weinstein
11:27

雙擊 Command 調出的不是截圖,是整頁結構化數據

App Shot 功能常被用戶誤解成「截圖」。實際上雙擊兩個 Command 鍵拉出來的是頁面完整的無障礙表示(accessibility representation)——鏈接指向哪裡、日曆事件的完整標題,這些普通截圖會丟失的信息都保留著。Ari 提到這項技術本來是為視障人士的屏幕閱讀器做的,現在同樣的技術路徑讓語言模型能「看清」整個應用,而不用像以前那樣靠反覆截圖、滾動、再截圖來拼湊信息。

— Ari Weinstein
12:32

已經比普通人快,瓶頸變成了網頁加載速度

Ari 給出一個具體判斷:現在 Computer Use 完成任務的速度,在大多數場景下已經超過普通人類,下一個目標是真正「超人類」——比資深電腦操作者本身還快。但他也坦承當下最大的瓶頸已經不在模型本身,而在網頁加載速度:benchmark 裡相當一部分時間是在等 doordash.com 這類網站本身加載完,如何用事件驅動而不是盲等去觸發下一步動作,反而成了新的工程難題。

— Ari Weinstein
17:31

最愛用法:讓 Computer Use 測試自己寫的軟件

Ari 最喜歡的使用場景是讓 agent 自己完成軟件開發的完整閉環:Codex 寫完代碼後,不再需要人去當 QA 驗收,而是另一個 Computer Use agent 直接打開應用操作一遍、截圖核對。他調侃自己有時在用 Computer Use 開發 Computer Use——一個 agent 測試另一個 agent 操作的軟件,這種自測閉環讓交到他手裡的東西「已經是跑通的」。

— Ari Weinstein
24:16

決策 API 抄的是一週前剛火的競品

Nikunj Handa 坦承 Decisions API 的起點,是看到競品爆火之後的應激反應——用戶在催,內部團隊也在喊「我們需要一個更快的分類系統」。他承認四周前這件事根本不在產品路線圖上,是 OpenAI 內部「黑客文化」的產物:推理團隊和基礎設施團隊各出一人,看到對手產品後直接動手搭原型,驗證可行後就開始卷延遲,目標是一達到延遲指標就儘快發布。

— Nikunj Handa
27:26

所謂決策模型,其實是戴著鐐銬跑的 Luna

關鍵信息在這裡:Decisions API 沒有訓練任何新模型,底層就是現有的 Luna 權重,沒有變。所做的工作是在推理層加約束——強制結構化輸出、把多個問題打包並行批量跑、極致優化首 token 時間(TTFD)。Nikunj 說這是 OpenAI 一貫的迭代發布打法:先把 zero-shot 版本放出來收反饋,後續再看是否需要針對校準、置信度這些能力專門訓練模型。

— Nikunj Handa
32:12

長線程 Agent 的緩存窗口拉到 12 小時

針對 Dots 這類「一個線程無限跑下去」的個人 agent 場景,Responses API 把緩存策略當成重點在打磨:默認保證 30 分鐘內的緩存命中,還給一位客戶單獨上線了 12 小時緩存窗口的預覽功能——哪怕用戶三四個小時後才回來繼續同一個對話線程,依然能吃到緩存帶來的速度和成本優勢。配合新上線的「預熱」功能,開發者可以提前為還沒發生的請求付一次緩存寫入費,讓後續調用隨時處於熱啟動狀態。

— Nikunj Handa

原話 · 已逐字校驗

they said that a few months ago, I think, and I hope they have a different perspective now because Computer Use is, like, 180 degrees different than it was.

他們幾個月前是這麼說的,我希望他們現在有不一樣的看法了,因為 Computer Use 已經和當時完全不一樣了,可以說是 180 度大轉變。

Ari Weinstein4:53

now Computer Use, often writes code. So if you actually look at it in Codex and you expand the tool calls manually, you can see that it’s not just doing one action at a time. It’s actually writing JavaScript code that it executes

現在 Computer Use 經常是直接寫代碼。如果你在 Codex 裡把工具調用展開看,會發現它不是一步一步執行單個動作,而是真的在寫一段 JavaScript 代碼去執行。

Ari Weinstein5:57

if you take a screenshot of a webpage that has a link- The screenshot doesn’t include where the link goes. It doesn’t include, you know, maybe you take a screenshot of your calendar, the ca- event ti- titles are truncated, you know?

如果你截一張帶鏈接的網頁截圖,截圖裡是看不到鏈接指向哪裡的。也看不到完整信息——比如截一張日曆的圖,事件標題是被截斷的,你懂吧?

Ari Weinstein11:27

now Computer Use is, like, faster at accomplishing tasks than, like, the average human probably in most cases. and I think that the next frontier is to have Computer Use be, like, literally superhuman in its performance

現在 Computer Use 完成任務的速度,在大多數情況下已經比普通人更快了。我認為下一個前沿是讓 Computer Use 真正變得超人類——性能上比我們這樣的電腦操作專家還要快。

Ari Weinstein12:32

One of my favorite use cases for Computer Use actually, and one that we see a lot in the wild, is Computer Use letting the agent- actually test the software that the agent has built, which is far more consequential than it sounds.

我最喜歡的 Computer Use 用例之一,也是我們在實際使用中看到很多的,就是讓 Computer Use 去測試 agent 自己構建出來的軟件,這件事的意義比聽上去重要得多。

Ari Weinstein17:31

This is, like, really just Luna. And, on top of that, what you’re doing is you’re constraining. So, like, structured output’s a big part of it. you’re really optimizing the inference stack to, like, get very fast on TTFD.

這其實就是 Luna。在這基礎上,你做的事是加約束——結構化輸出是很重要的一部分,你在推理棧上做極致優化,讓首 token 時間(TTFD)變得非常快。

Nikunj Handa27:26

We’ve been, trying to, like, really up our game on caching. We provide now guarantees of, like, cache hits within, like, 30 minutes. We’re actually, like, we-- for one of our users, we just launched, like, a much longer cache window. So we have, like, a 12-hour caching guarantee

我們一直在努力把緩存這件事做得更好。現在我們提供 30 分鐘內緩存命中的保證。實際上我們剛剛為一位客戶上線了更長的緩存窗口——我們現在有 12 小時的緩存保證。

Nikunj Handa32:12

數字與實體

GPT-6.1 Sol 成本(對比 Astra)五分之一;Computer Use 場景下為七分之一0:00
meal prep 下單耗時人工2小時 → Computer Use 15分鐘(快8倍)3:47
Computer Use 速度提升(Tejal 在演講中提到)7倍8:03
Luna 推理成本降幅降價80%21:43
決策API競品克隆數量兩週內約100個26:20
Responses API 緩存保證窗口默認30分鐘,預覽版12小時32:12
新模型緩存讀取成本降幅便宜25%33:40

術語

App Shot應用快照
雙擊快捷鍵抓取應用完整無障礙數據,而非普通截圖
TTFT/TTFD首Token延遲
模型生成第一個輸出token所需時間,衡量推理速度的關鍵指標
mid-turn steering推理中途引導
在模型推理過程中途插入新指令來調整其行為
WebSocketsWebSocket雙向連接
支持異步工具調用和實時交互的持久通信協議

收聽指南

誰該聽

關注 OpenAI Agent 產品線、想摸清 Computer Use 和 Decisions API 底層機制的開發者與創業者。

可跳過

22:57-23:21 關於 UltraFast 是否用了 Cerebras 芯片的調侃,沒有實質信息,可跳過。