90% 的 AI 原型死在 POC:缺的不是模型是 harness
模型再强也扛不住中途崩溃——退款发到一半进程挂了,客户收到两笔钱。把状态从 agent 里抽出来、交给 harness 托管,才是从笔记本走进生产的分界线。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
90% 的 AI 原型死在 POC 之后
Samar 说,现在人人都能靠 coding agent 把想法变成应用,但 90% 的想法在 POC 之后就死了,永远见不到天日。死因不是模型不够聪明,而是「不稳定、脆弱、不可复制」。Jason 说他天天在组织里看到这一幕:有人兴奋地演示一个东西,他问「能上生产吗」,答案永远是「我不知道,感觉不行,但也许吧」。POC 和生产级软件之间那道鸿沟,就是这一集要拆的东西。
— Samar Abbasagent 越值钱,就越像分布式系统
Samar 的观察是:AI 应用一旦上生产,运行时间就越来越长、越来越异步、在真实世界里做的动作越来越多,创造的价值也越大。但一走到这一步,撞上的就是可靠性、可扩展性、持久性这些基础设施级挑战——和当年云平台迁移时一模一样。他的判断是:这些问题本质上是分布式的,而不是全新的 AI 问题。agent 从笔记本毕业进入真正的分布式环境,问题就换了性质。
— Samar Abbas退款发到一半崩了,你要发第二笔吗
Samar 给的画面很具体:一个 agent 正在处理退款,刚处理完退款、还没通知客户,机器重启或进程崩溃了。这时候你只有两个选项——要么重跑,要么再发一笔退款。Jason 接话:那可能会很贵。Samar 说,处理这类失败正是所有生产系统卡住的地方,因为 AI 开始在真实世界里采取行动。Temporal 提供的叫 durable execution:代码执行过程中发生失败,平台替你记住全部状态,开发者一行代码都不用写,应用仍能在各种失败下继续向前推进。
— Samar Abbas把 agent 的 HUD 显示出来给人看
Jason 看了 Temporal 的界面后说,左上角是工作流代码,右边是运行时事件时间线,能实时看到 agent 在执行工具、调用 LLM、拿回响应、一步步向前推进,底部是应用实际产出的输出。他说自己从没见过有人把幕后过程展示出来,希望每个消费级产品都有这样一个 HUD,让他对「我上次做到哪了」更有信心。Samar 补充:Temporal 不只是事务引擎,还给你对 agentic 应用的完整可见性——agent 就是选一个 LLM、给个 prompt、配一组工具,由 LLM 自己决定怎么推进。
— Jason Calacaniscode mode 让安全团队睡不着觉
Samar 提出一个被低估的风险:现在有一种 code mode,agent 在解题过程中会现场生成更多代码并执行它。想象一家大企业把大型业务流程交给这种 code mode agent——你等于把 LLM 在运行时吐出来的代码直接跑进业务环境,从安全视角看非常令人不安。Temporal 用 workflows 和 activities 两个构造来应对:workflows 负责生成命令,平台可以拦截这些命令,在真正进入沙箱或运行时之前加上必要的护栏。
— Samar Abbasharness 是从 MS-DOS 走向云的那一步
Samar 用了一个比喻:现在正从 agent 的 MS-DOS 时代过渡到真正的云环境。今天大多数人跑 agent 的方式,就是在笔记本上装个 coding agent 然后跑起来。但人们已经开始构建 loop,甚至出现了 loop engineering、graph engineering 这些说法,意味着 agent 要更独立、更长时间地运行,也就必然从笔记本搬到分布式环境。这时 harness 成为核心组件——它是被抽出来的「大脑」,放在 agentic loop 之外,这样 agent 走错路时不会把整个流程搞崩。
— Samar Abbas企业永远不会允许 agent 跑在笔记本上
Jason 问:怎么判断该把桌面上玩的那个 agent 挪进生产循环?Samar 的回答很硬:企业根本不可能采用这些 agent 架构,除非能在所需护栏下运行业务流程,所以没有企业会允许 agent 跑在笔记本上——对企业来说这是 table stakes。他给出一条更普适的毕业信号:当你从一个人解决问题,变成一支团队在解决复杂业务问题,唯一可行的路径就是让 agent 跑在分布式环境里。这时候 forward deployed engineer 必须嵌入业务单元,用对的工具把它建对,让它不脆弱。
— Samar Abbas原话 · 已逐字校验
But 90% of those ideas die after a POC, essentially. They never see light of the day.
但 90% 的想法在 POC 之后就死了,永远见不到天日。
Samar Abbas2:05
these problems start to look more and more similar to like distributed in nature rather than a completely new AI problem
这些问题开始越来越像是分布式性质的问题,而不是一个全新的 AI 问题。
Samar Abbas3:08
Imagine an agent which is kind of building, processing a refund and literally, immediately after processing a refund, a failure happens.
想象一个 agent 正在处理退款,就在处理完退款之后,失败立刻发生了。
Samar Abbas5:21
Where during an execution of a code, if a failure happens, we remember all of that state. Without you as a software developer writing a single line of code for it.
在代码执行过程中,如果发生失败,我们会记住全部状态,而你作为软件开发者一行代码都不用写。
Samar Abbas6:26
i feel right now we are transitioning from an ms dos era of agents to a real cloud environment essentially
我觉得现在我们正从 agent 的 MS-DOS 时代过渡到真正的云环境。
Samar Abbas13:02
which means like none of the enterprises will ever allow these agents to run on a laptop, essentially. So for them, it's core table stakes, in my opinion.
这意味着没有企业会允许这些 agent 跑在笔记本上。所以对他们来说,这是核心的入场门槛。
Samar Abbas16:01
I think at this point, running agents on your laptop is no longer even an option.
我认为到了这个阶段,在笔记本上跑 agent 已经不再是一个选项了。
Samar Abbas17:03
数字与实体
| POC 后死掉的 AI 想法比例 | 90% | 2:05 |
术语
- harness执行框架
- 抽离在 agent 循环之外的「大脑」,负责协调、持久化和容错。
- durable execution持久化执行
- 代码执行中发生失败时自动保存全部状态,让应用继续向前推进。
- code mode代码模式
- agent 在解题过程中现场生成并执行新代码的工作方式。
- forward deployed engineer前置部署工程师
- 嵌入业务单元、用对的工具把 agent 系统建到生产标准的工程师。
收听指南
正在把 AI demo 推向生产的工程负责人、平台架构师,以及要给 agent 上护栏的 CTO。
0:00-1:00 开场介绍和嘉宾履历,可跳过。