世界太吵,来原声听播客

a16z

AI编码工具写代码更快,但软件本身十年没怎么变聪明

编码智能体让人写代码更快,但产出的还是同一种软件;Diogo Almeida说真正该做的是把AI变成软件里的新原语,让此前不能自动化的事情变得可以自动化。

AI编程编码智能体SaaSAI可靠性AGI叙事概率编程

原视频在 YouTube 上放不出来,用音频听:

创始人亲述从OpenAI早期AGI幻灭到做出Jev的心路,讲清了AI原生编程与传统编码智能体的本质差异。

核心论点 · 点时间戳可跳到原声

3:02

编码智能体与Jev根本不是一回事

Cloud Code、Codex这类编码智能体的本质是「just in time software」——用自然语言现写代码,但写出来的东西和人类工程师写的代码没有本质区别,表达力还是原来那套。Diogo想做的不是让写代码更快,而是往软件里塞一个新原语:不是自动化「软件工程师」这件事,而是扩展软件本身能做的事,让本来「该被自动化却做不到」的事情变得可以自动化。

— Diogo Almeida
7:11

Jev就是个分类器,但这不是贬义

Diogo承认Jev本质上就是个分类器(classifier)——这不是黑话,分类器这个词本来就是从「要真正解决问题」的工程师那里来的。它更像一个库:用自然语言描述想要的行为,配上一个状态机,Jev在里面带着置信度选择走哪条分支。他猜测Jev现在做到的事,可能已经好过一支2019年的传统机器学习工程团队花几个月做数据集、调模型才能做出来的东西,而现在普通开发者当场就能「编」出来。

— Diogo Almeida
12:19

我们造的是产品,不是神

Ben Horowitz说TypeSafe最打动他的一句话是「we build prod, not God」——别的大模型实验室哪怕私下也乐在其中,公开场合总要端着「我们在造可能失控的东西」的沉重感;TypeSafe的态度完全相反,直接把AI乐观主义摆到台面上。Diogo认为这种悲观情绪很大程度上来自「一个大脑统治一切」的单一模型迷思,只要还相信只有一个越来越大的中心化模型才是AI的未来,就很难理解开发者拿到一个可编程AI原语后有多兴奋。

— Ben Horowitz
18:25

他曾以为GPT已经是AGI,幻灭后转向

Diogo在OpenAI参与了早期RLHF模型的发布,在那之前他完全没料到指令微调后模型的泛化能力会这么强——团队故意拿「为什么冥想前要先吃袜子」这种确定不在互联网上出现过的怪问题去测,模型却能给出说得通的人类式回答。这让他一度真心相信这个模型有相当大概率就是AGI。等它没有变成AGI,他形容那是「整个世界观崩塌」的时刻,也是他后来转向「AI要真正变得有用而不只是看起来聪明」这条路的起点。

— Diogo Almeida
19:26

他不信递归自我改进,但信AGI的另一种定义

Diogo明确说,出于一些复杂原因,他不认为AI走在RSI(递归自我改进)的路上,过去和现在都不信。但他认同OpenAI给AGI下的那个更朴素的定义——自动化世界上大多数有经济价值的工作——认为这事完全可行,因为大量经济价值工作其实很基础、很重复。问题出在RLHF之后,行业把力气都花在讨好「人类评委」这个代理指标上:GPT-3本来校准得还不错,但因为是人在打分,模型越来越会说漂亮话,却没有同步变得更能真正自动化任务。

— Diogo Almeida
24:39

客服自动化卡在长尾,不是卡在智能

Diogo举OpenAI自2020年就在尝试自动化客服作为反例:智能程度早就够了,为什么还是做不成。Martin补充了一个更具体的观察——早年看客服公司数据时,对方常说「我们能回答95%的工单」,听起来很厉害,但把工单按内容去重后会发现真正不重复的问题只占一半左右,剩下全是密码重置之类的高频重复问题。这说明卡住自动化的不是模型不够聪明,而是现实世界天然是个长尾分布,标准聊天机器人只能吃掉头部,吃不掉长尾里的例外。

— Diogo Almeida
26:42

可靠不等于每次答案一样

Diogo把「可靠性」拆成三层:第一层接近传统的可用性/SLA;第二层接近「确定性」,但他强调这对单元测试有用、对真实系统没用——比如提示词里塞一个UUID,输出理论上该「功能上相同」但字面上不会完全一样;第三层他还没想到统一说法,姑且叫「鲁棒性」——不要求每次给出相同答案,但要求每次都给出一个换成人来看也说得通的判断。他说可靠性每提高一个「9」,都能撑起一批此前不敢用AI的全新应用场景。

— Diogo Almeida
33:49

SaaS末日论错了:大PR才十行代码

编码智能体刚出来时市场一度相信SaaS要被平替,股价应声下跌;Jev出来后SaaS公司反而集体叫好,因为「软件很便宜」这个判断没错,但「所以容易被复制」这个推论是错的,很多价值藏在看不见的细节工程里。Ben Horowitz补了一个数据感:大公司里一条典型PR平均也就10行代码,编码智能体自动化的其实是这10行本身,而不是给软件新增能力;Jev提供的是一个新原语,能让软件长出此前没有的功能,这也是为什么软件用AI写得更快,却没有变得更好,甚至因为审查变少而更容易出安全问题。

— Diogo Almeida

原话 · 已逐字校验

Where the fuck is all the automation? AI is so unbelievably smart, and yet it's so useless at all other stuff.

自动化到底跑哪儿去了?AI已经聪明到这种地步了,可它在其他所有事情上都没什么用。

Diogo Almeida0:00

But TypeSafe is making AI for software. You know, we want to make AI powerful, not just for humans in the loop, but to actually build real software.

但TypeSafe是在为软件本身做AI。我们想让AI变得强大,不只是服务于「人在回路里」的场景,而是让它真正能去构建软件。

Diogo Almeida3:02

But like intelligence per dollar is my North Star right now. And it could be wrong, just to be clear.

但「每一美元能买到多少智能」现在是我的北极星指标。说清楚,这个方向也可能是错的。

Diogo Almeida8:15

And my favorite thing that you guys say is we build prod, not God.

我最喜欢你们说的一句话是:我们造的是产品,不是神。

Ben Horowitz12:19

And, you know, my favorite query was, why is it important to eat socks before meditating?

我最喜欢的一条测试问题是:为什么冥想之前吃袜子很重要?

Diogo Almeida18:25

I am not, for nuanced reasons, I don't think we are on the path of RSI.

出于一些复杂的原因,我不认为我们正走在递归自我改进(RSI)的路上。

Diogo Almeida19:26

OpenAI has been trying to automate customer service since 2020.

OpenAI从2020年就开始尝试自动化客服了。

Diogo Almeida23:35

You know, like, imagine if all technology just did what you mean. That is, like, that's not sci-fi.

想象一下,如果所有技术都能「做你真正想要的事」。这不是科幻,是真的可能实现。

Diogo Almeida41:57

数字与实体

OpenAI尝试自动化客服的起始时间2020年23:35
客服工单声称可解决的比例 vs 按内容去重后唯一问题占比声称95%可解决,去重后唯一问题约占50%24:39
大型公司单个PR的平均代码行数约10行33:49

术语

RSI递归自我改进
AI自己不断改进自身能力、可能失控加速的路径,常与AGI风险论绑定。
SaaSpocalypseSaaS末日论
AI编码工具兴起后一度流行的悲观叙事:软件因AI而变得廉价易复制,SaaS公司价值将被摧毁。
4GL第四代编程语言
上世纪80年代出现的、试图更接近自然语言表达意图的编程语言概念。
probabilistic programming概率编程
让程序直接对不确定性和概率建模的编程范式,70年代曾一度沉寂。

收听指南

谁该听

做AI应用或AI基础设施的工程师、产品负责人,以及关心AI编码工具对SaaS估值逻辑影响的投资人。

可跳过

9分左右到11分左右的个人成长小故事(数学竞赛、Kaggle经历)信息量较低,可跳过。