世界太吵,来原声听播客

张小珺·商业访谈录

Operator 不是 O3 的延续,是推理伸向物理世界的第一只手

OpenAI 2016 年做 Web Agent 失败并裁掉二三十人,缺的是基座模型;十年后 Operator 把基座模型、人类数据和强化学习三件事凑齐,才让推理从抽象文本走向视觉交互。

Agent强化学习多模态OpenAIOperator
吴翼是前 OpenAI 研究员、清华叉院助理教授,从强化学习视角拆解 Operator 的技术要点、Agent 分级和创业机会,信息密度高,适合想理解 Agent 技术路线的听众。

核心论点 · 点时间戳可跳到原声

4:09

Operator 是闭环控制,O1 是开环

吴翼把 Operator 在 AGI 路线图上的位置定义为「通用型的变化」:O1、O3 是在聚焦问题上思考的变身,但中间没有环境交互,也没有多模态。Operator 补上了这两点——它能看到观测、做一步动作、再看到新观测,连续做很多轮交互,形成一个闭环控制系统。传统大模型是开环的,给一个指令直接输出,不要任何反馈;Operator 则会在输出后主动调用,期待下一个反馈,再基于反馈做下一步思考。这个「横轴」的通用能力,是通往通用智能体一定要有的。

— 吴翼
7:13

Operator 的思维链短,回溯发生在动作上

吴翼不认为 Operator 是 O1、O3 的简单延续。他观察 Operator 放出的思维链,相对来说是短的,回溯主要出现在动作上——比如点了个网页半天没点开,它会点后退。而 O1、O3 的思维链很长很长,有很多回溯。所以他倾向于认为 Operator 不是 O3 那么极致的模型,更像是「一个多模态闭环的 O1,一个 Agent O1 的版本」,或者可能 3O1 一点的位置。它是在广度上往宽里走,而不是在深度上走到极致,因此还有空间。

— 吴翼
11:16

复刻 Operator 需要三件事,国内没那么远

吴翼把 Operator 的技术要点拆成三件:一个好的原生多模态基座模型、高质量的人类数据和任务、一个高效率的大规模支持 Agent 的强化学习系统。第三件最麻烦,因为 Agent 环境里模型吐了几百个 token 后要去屏幕上点一下,你需要有电脑在那等着 AI 去点、做模拟,几千卡或一万卡规模下怎么高效交互是个课题。但他判断国内团队追赶 Operator 没有追赶 GPT 或 Sora 那么难,路线清楚,很多基建本身已经在了,是一个 half there 的状态。问题在于你不知道 OpenAI 水下有多少东西。

— 吴翼
20:21

OpenAI 第一个大项目就是 Web Agent,失败了

吴翼回溯到 2016 年:OpenAI 成立后干的第一个大项目就是 Web Agent,一个通用视觉智能体在网页上点。当时他们只有强化学习,没有基座模型,甚至没有人去找数据标注,连传输都没有,用一个大的 LSTM 叫 Covnet 去点网页,用强化学习点,然后失败,还把那个团队裁了,裁了二三十人。吴翼在深度学习课上跟同学讲这个故事,说当时的 missing recipe 就是基座模型——光靠强化学习不行,光靠好的基座模型也不太行,两块加起来才行。十年之后他们把这事做成了。

— 吴翼
24:27

三到四级是特别大的改变,不止两三年

吴翼拆解 OpenAI 的五级分类:chatbot 是 reactive,你说一句我说一句;reasoning 是脑子里想十秒钟再说,有推理和规划;agent 则多了一个外部世界,是三方过程,AI 的 scope 变大了。但一到三级都是 instruction following 或 instruction execution,给指令、完成、可以 verify 对错。创新不一样,你只能给方向性的东西,对错没有意义,要的是超越原来知识体系的好。吴翼认为三到四是个特别大的改变,可能不止两三年就能做成。而四和五哪个先来不一定,组织可能被动形成——以后每个软件都带一个 agent,它们之间就会存在交互。

— 吴翼
34:34

短时间不会出现多 Agent 交互

吴翼的观点是短时间内暂时不会出现多个 agent 之间交互的情况。因为如果目标是完成一个任务,一个足够通用的大模型可以自己完成所有事情——O1 和 O3 已经证明,只要强化学习训练到位、context 和记忆超级长,一万个 token 也没问题,推理过程依然清楚。多 Agent 交互一定发生在任务中间涉及到一个 AI 被动触发的时候,比如以后所有网站进门也是一个 agent,或者你让 AI 去豆包、ChatGPT 上查东西。但短时间大部分人机交互界面还是图形化界面,还是为人设计的,所以未来一两年还是单智能体状态。

— 吴翼
40:46

Operator 的用户数据比 Chatbot 值钱得多

吴翼同意广密说的 chatbot 不能帮助提升智能——闲聊没有智能,对话形式大部分 by default 不会出现深思熟虑的过程。但 Operator 不一样:你什么时候需要人帮你去点网页,一般是带着目的的,比如算个税、定复杂行程,query distribution 跟 chatbot 很不一样,比较重。所以如果能收集这样的用户反馈和最后完成信号,是有助于提高模型通用能力的。OpenAI 有一个选项是不提交你的用户脚本,吴翼说这种带着复杂任务的指令和是否完成的评判数据,非常适合强化学习训练,而强化学习训练如果一个难题被找到了,需要的数据量很少。

— 吴翼
59:05

Operator 是信号,不是物理世界的智能

吴翼一直有个观点:智能分两块,一块是纯文本模态的推理,一块是视觉信号的推理,两者不太一样。Operator 现在没有真的到物理世界里面去,它还是在软件网页层面,而网页大部分是为人浏览设计的,文本概念比较强。所以它展现的是可能性的开端,没有把可能性真正拖出去。它把能力拓展了,但智力上限没有——纯逻辑推理没有比 O3 强,物理世界推理也没到。吴翼用指针比喻:本来是个 90 度的指针一直往北走,现在 90 度往右扩了一点,可能到了 80 度,你不知道它会往哪里走。

— 吴翼

原话 · 已逐字校验

就是那个基础模型 如果没有好的基础模型 光靠强化学习是不行的 但是你看光靠好的基础模型 也不太行 对吧 还要加强化学习两块加起来

就是那个基础模型。如果没有好的基础模型,光靠强化学习是不行的;但光靠好的基础模型也不太行,还要加强化学习,两块加起来。

吴翼22:23

但是创新不一样 创新其实是你只能给出方向性的 比如说我们知道学生 我们知道博士生写论文 你其实不能说这个东西是对的还是错的 因为对错没有意义了 因为如果要创新 它肯定是对的

但创新不一样,创新其实是你只能给出方向性的。比如博士生写论文,你其实不能说这个东西是对的还是错的,因为对错没有意义了——如果要创新,它肯定是对的。

吴翼25:28

所以如果通过用户那样大量的反馈 它不能提高智能 只能提高这个产品的舒适度 所以这个是没有问题的 但是我觉得operator 相对来说有一点点不一样

所以通过用户那样大量的反馈,它不能提高智能,只能提高产品的舒适度,这没有问题。但我觉得 Operator 相对来说有一点点不一样。

吴翼39:46

它只是展现了 这个可能性的开端 它没有把这个可能性 真正拖出去

它只是展现了这个可能性的开端,没有把这个可能性真正拖出去。

吴翼1:00:05

数字与实体

OpenAI 2016 年 Web Agent 团队裁员人数二三十人21:23
Operator 在 OS World 榜单上的分数30 多53:57
吴翼在 OpenAI 工作时间2019 年到 2020 年2:04

术语

CUAComputer-Using Agent
OpenAI 为 Operator 定制的、专门为交互和 Agent 使用训练的模型。
GUI agent图形界面智能体
通过鼠标键盘操作图形界面完成任务的智能体。
close loop system闭环系统
输出动作后接收环境反馈、再基于反馈做下一步决策的系统。
OS World操作系统世界基准
评估智能体在操作系统环境中完成任务能力的榜单。

收听指南

谁该听

想理解 Agent 技术路线和 Operator 定位的工程师、创业者与投资人,尤其是做强化学习、多模态或 Agent 产品的人。

可跳过

1:11:21 之后的收尾和订阅口播可跳过。