世界太吵,来原声听播客

Cognitive Revolution

Zapier CEO:80% 的智能体任务本该用确定性代码

Wade Foster 说客户用 agent 干的事里 80% 其实该用老式确定性代码;no code 已经过时,新的 no code 就是 code。

AI 智能体自动化企业 AI 转型模型评测定价

原视频在 YouTube 上放不出来,用音频听:

Zapier 同时押注 MCP、agent、SDK 和 guardrails 后的一手复盘,含 Automation Bench 与内部 AI 转型的具体做法。

核心论点 · 点时间戳可跳到原声

5:21

知识工作正在搬进个人的日常工具

Foster 复盘过去 18 个月最大的认知变化:大多数人已经选定了一个日常 AI 工具——可能是 Cursor、Claude Code 或 ChatGPT——工作主要在那里发生。因此把上下文和数据送进这个日常工具(比如 Zapier MCP 这类 MCP server)才是知识工作的走向。他把市场分成两派:一派想把人留在自己平台上建 agent,另一派像 Salesforce 那样做 headless、随你带到哪里用。他明确认为后者是赢的策略,因为那正是工具消费者想要的,也是增长所在。

— Wade Foster
10:20

最强模型只做对四成自动化任务

Zapier 的 Automation Bench 用约 600 个真实知识工作任务测模型,例如「刚签下 Meridian Core 平台合同,按路由政策标记为赢单并转给对应团队,从账户层级表确认账户,必要时换汇,检查是否有未结支持升级」。Foster 说新出的最强模型准确率约 40%,是当前最高,但比 Gemini 3.7 贵得多,于是形成一条「为增量性能付多少钱」的曲线。他强调这个 benchmark 远未饱和,而 Zapier 要证明的是:把 Zapier 装到 agent 旁边,输出会好过单用模型。

— Wade Foster
23:02

80% 的 agent 任务该用确定性代码

Foster 的核心判断:客户用 agentic 产品做的事里,绝大多数——他给的数字是 80%——其实应该用老式的确定性代码。做法是让 agent 先判断哪些环节写代码(成本更低、可靠性更高),只在真正需要推理的地方调用 AI 或建 agent。他承认模型会越来越好,但很难想象一个世界里确定性代码不再更可靠、更便宜。同时他保留可视化:人仍然需要看到工作流长什么样,用来验证「这是不是我想让它做的事」,也当文档用。

— Wade Foster
30:34

真正的对手是那个两年后跳槽的产品总监

被问最该担心哪类竞争者时,Foster 搬出 YC 时 PG 的话:当年问的不是「如果 Anthropic 或 OpenAI 做了你怎么办」,而是「如果 Google 做了怎么办」,而 PG 想灌输的是——你很少直接和 Google 对打,你面对的是一个想拿晋升、待两年就走的中层产品总监。他说 OpenAI、Anthropic 现在已是大厂,模型上会最强,但不可能什么都做。另一面,普通 AI 用户其实什么都没做,可能只用过 ChatGPT 或 Gemini,所以大多数公司的竞争不是彼此,而是「人们到底知不知道拿这些工具干什么」。

— Wade Foster
39:30

让 AI 盯着你干活,替你找自动化机会

Foster 认为最难的一直是推荐:该拿这东西干什么。他今年开始跑一个工作流,让 AI 去看自己在 Gmail、Slack、浏览器、聊天里的日常操作,然后告诉他「你该换个做法」。多数 Zapier 员工的做法是把工具接进 Zapier MCP,每周跑一次自动化,收集一周的工作信号,给出「你做了这个和这个,这里有个工具建议你建」。他说一半的仗只是让你对某个建议产生反应——想法不需要完美,五成好就够启动头脑风暴。他确认这很可能被产品化。

— Wade Foster
46:09

AI 转型的瓶颈从技术变成了人事

Foster 说第一阶段是全员 AI 熟练度,一年内几乎 100% 员工每天用 AI,技术采用不是瓶颈。之后问题变成:怎么把个人的成功变成公司级的生产级工作流,于是挑战越来越像人的问题——重写岗位描述、重想薪酬、团队重组、把不需要的组的人再培训到需要的组。当时的人民官 Brandon 擅长这些,团队也走在前沿,所以让他去帮全公司。Foster 强调这不是「必须由人民官来管 AI」的观点:换 CMO 或 CPO 也可以,关键是看你的瓶颈在哪,再找对的人。

— Wade Foster
55:46

有人一个月烧三万美元 token

Foster 说有个别工程师每月在 token 上花三万美元,属于离群值。Zapier 目前没有给个人设预算,但做了工具让人看到自己的花费、看到选强模型和便宜模型在不同工作流上的成本差。看到有人花得特别多,第一反应是去聊:「你在干什么,我很好奇。」结果有的在做极其高产的事,有的则是把 Fable 或 Astro 用在了不需要的地方。他预计 token 预算最终会成为真事,AI 熟练度的一部分就是有人拿到更高预算,因为更会用。

— Wade Foster
55:46

用 AI 不是问题,低质量才是

Foster 说他不反对员工用 AI 写沟通,真正的问题是低质量沟通:低判断力的人能极快地生产大量低质内容,淹没读者。他给的几条准则:你要为发出去的东西负责,作者花的时间应该多于读者读的时间;你要理解自己发的东西,被追问时不能答不上来;把请求写明确,要决策、要反馈还是标成草稿;核实细节,因为 AI 会幻觉,也可能拉出三个月前的旧项目当相关材料,摘要的摘要层层传下去就变成错误信息。他还点名了那套 AI 腔——「不是这个,是那个」、破折号、honest truth、load-bearing point。

— Wade Foster

原话 · 已逐字校验

I definitely think that latter is the winning strategy

我确实认为后一种(headless,随你带到哪里用)才是赢的策略。

Wade Foster5:21

the idea of building a no code, it, it feels antiquated to me. It's like the new co- no code is code

做 no code 这件事在我看来已经过时了。新的 no code 就是 code。

Wade Foster18:01

the vast majority of what people are using an agent for, 80% in fact, they probably should be using actually old fashioned deterministic code

人们用 agent 做的事里绝大多数——事实上 80%——大概都该用老式的确定性代码。

Wade Foster23:02

you're going toe-to-toe with a potential mid-level product director who's trying to get a promo- promo, might be there for two years and then bounce

你在对打的是一个想拿晋升的中层产品总监,他可能待两年就跳槽。

Wade Foster30:34

most of us, our competition isn't each other. It isn't the, the tools that you talked about. It's do people actually know what to do with these tools yet?

我们大多数人的竞争对手不是彼此,也不是你提到的那些工具,而是:人们到底知不知道拿这些工具干什么?

Wade Foster30:34

You need to look at what are your bottlenecks, what are your constraints, and go identify the person who is the right fit for that job

你要看自己的瓶颈和约束在哪,然后去找适合那件事的人。

Wade Foster46:09

using AI is not the problem. It's like low quality. That's the fight at the end of the day

用 AI 不是问题,低质量才是。说到底要打的是这一仗。

Wade Foster55:46

数字与实体

Automation Bench 最强模型任务准确率约 40%10:20
Automation Bench 任务数量约 600 个10:20
客户 agent 使用中本应用确定性代码的比例80%23:02
Zapier 员工每日使用 AI 的比例接近 100%46:09
Zapier 员工规模接近 800 人55:46
Zapier 持有客户凭证的年限15 年55:46

术语

MCP模型上下文协议
把外部工具和数据接进 AI 日常工具的接口标准。
headless无头
产品不要求用户留在自己界面里,能力可被带到任意工具中调用。
Automation Bench自动化基准
Zapier 用真实知识工作任务测各模型自动化能力的评测集。
PangramAI 文本检测工具
判断一段文字由 AI 生成概率的检测器。
harness外壳/驾驭层
包在模型外面、提供上下文与工具调用的日常使用界面。

收听指南

谁该听

正在做 agent 或自动化产品的创业者、评估模型性价比的工程负责人,以及要推动公司内部 AI 落地的管理者。

可跳过

赞助商口播与结尾推荐语可跳过,其余部分信息密度均匀。