AI编码工具写代码更快,但软件本身十年没怎么变聪明
编码智能体让人写代码更快,但产出的还是同一种软件;Diogo Almeida说真正该做的是把AI变成软件里的新原语,让此前不能自动化的事情变得可以自动化。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
编码智能体与Jev根本不是一回事
Cloud Code、Codex这类编码智能体的本质是「just in time software」——用自然语言现写代码,但写出来的东西和人类工程师写的代码没有本质区别,表达力还是原来那套。Diogo想做的不是让写代码更快,而是往软件里塞一个新原语:不是自动化「软件工程师」这件事,而是扩展软件本身能做的事,让本来「该被自动化却做不到」的事情变得可以自动化。
— Diogo AlmeidaJev就是个分类器,但这不是贬义
Diogo承认Jev本质上就是个分类器(classifier)——这不是黑话,分类器这个词本来就是从「要真正解决问题」的工程师那里来的。它更像一个库:用自然语言描述想要的行为,配上一个状态机,Jev在里面带着置信度选择走哪条分支。他猜测Jev现在做到的事,可能已经好过一支2019年的传统机器学习工程团队花几个月做数据集、调模型才能做出来的东西,而现在普通开发者当场就能「编」出来。
— Diogo Almeida我们造的是产品,不是神
Ben Horowitz说TypeSafe最打动他的一句话是「we build prod, not God」——别的大模型实验室哪怕私下也乐在其中,公开场合总要端着「我们在造可能失控的东西」的沉重感;TypeSafe的态度完全相反,直接把AI乐观主义摆到台面上。Diogo认为这种悲观情绪很大程度上来自「一个大脑统治一切」的单一模型迷思,只要还相信只有一个越来越大的中心化模型才是AI的未来,就很难理解开发者拿到一个可编程AI原语后有多兴奋。
— Ben Horowitz他曾以为GPT已经是AGI,幻灭后转向
Diogo在OpenAI参与了早期RLHF模型的发布,在那之前他完全没料到指令微调后模型的泛化能力会这么强——团队故意拿「为什么冥想前要先吃袜子」这种确定不在互联网上出现过的怪问题去测,模型却能给出说得通的人类式回答。这让他一度真心相信这个模型有相当大概率就是AGI。等它没有变成AGI,他形容那是「整个世界观崩塌」的时刻,也是他后来转向「AI要真正变得有用而不只是看起来聪明」这条路的起点。
— Diogo Almeida他不信递归自我改进,但信AGI的另一种定义
Diogo明确说,出于一些复杂原因,他不认为AI走在RSI(递归自我改进)的路上,过去和现在都不信。但他认同OpenAI给AGI下的那个更朴素的定义——自动化世界上大多数有经济价值的工作——认为这事完全可行,因为大量经济价值工作其实很基础、很重复。问题出在RLHF之后,行业把力气都花在讨好「人类评委」这个代理指标上:GPT-3本来校准得还不错,但因为是人在打分,模型越来越会说漂亮话,却没有同步变得更能真正自动化任务。
— Diogo Almeida客服自动化卡在长尾,不是卡在智能
Diogo举OpenAI自2020年就在尝试自动化客服作为反例:智能程度早就够了,为什么还是做不成。Martin补充了一个更具体的观察——早年看客服公司数据时,对方常说「我们能回答95%的工单」,听起来很厉害,但把工单按内容去重后会发现真正不重复的问题只占一半左右,剩下全是密码重置之类的高频重复问题。这说明卡住自动化的不是模型不够聪明,而是现实世界天然是个长尾分布,标准聊天机器人只能吃掉头部,吃不掉长尾里的例外。
— Diogo Almeida可靠不等于每次答案一样
Diogo把「可靠性」拆成三层:第一层接近传统的可用性/SLA;第二层接近「确定性」,但他强调这对单元测试有用、对真实系统没用——比如提示词里塞一个UUID,输出理论上该「功能上相同」但字面上不会完全一样;第三层他还没想到统一说法,姑且叫「鲁棒性」——不要求每次给出相同答案,但要求每次都给出一个换成人来看也说得通的判断。他说可靠性每提高一个「9」,都能撑起一批此前不敢用AI的全新应用场景。
— Diogo AlmeidaSaaS末日论错了:大PR才十行代码
编码智能体刚出来时市场一度相信SaaS要被平替,股价应声下跌;Jev出来后SaaS公司反而集体叫好,因为「软件很便宜」这个判断没错,但「所以容易被复制」这个推论是错的,很多价值藏在看不见的细节工程里。Ben Horowitz补了一个数据感:大公司里一条典型PR平均也就10行代码,编码智能体自动化的其实是这10行本身,而不是给软件新增能力;Jev提供的是一个新原语,能让软件长出此前没有的功能,这也是为什么软件用AI写得更快,却没有变得更好,甚至因为审查变少而更容易出安全问题。
— Diogo Almeida原话 · 已逐字校验
Where the fuck is all the automation? AI is so unbelievably smart, and yet it's so useless at all other stuff.
自动化到底跑哪儿去了?AI已经聪明到这种地步了,可它在其他所有事情上都没什么用。
Diogo Almeida0:00
But TypeSafe is making AI for software. You know, we want to make AI powerful, not just for humans in the loop, but to actually build real software.
但TypeSafe是在为软件本身做AI。我们想让AI变得强大,不只是服务于「人在回路里」的场景,而是让它真正能去构建软件。
Diogo Almeida3:02
But like intelligence per dollar is my North Star right now. And it could be wrong, just to be clear.
但「每一美元能买到多少智能」现在是我的北极星指标。说清楚,这个方向也可能是错的。
Diogo Almeida8:15
And my favorite thing that you guys say is we build prod, not God.
我最喜欢你们说的一句话是:我们造的是产品,不是神。
Ben Horowitz12:19
And, you know, my favorite query was, why is it important to eat socks before meditating?
我最喜欢的一条测试问题是:为什么冥想之前吃袜子很重要?
Diogo Almeida18:25
I am not, for nuanced reasons, I don't think we are on the path of RSI.
出于一些复杂的原因,我不认为我们正走在递归自我改进(RSI)的路上。
Diogo Almeida19:26
OpenAI has been trying to automate customer service since 2020.
OpenAI从2020年就开始尝试自动化客服了。
Diogo Almeida23:35
You know, like, imagine if all technology just did what you mean. That is, like, that's not sci-fi.
想象一下,如果所有技术都能「做你真正想要的事」。这不是科幻,是真的可能实现。
Diogo Almeida41:57
数字与实体
| OpenAI尝试自动化客服的起始时间 | 2020年 | 23:35 |
| 客服工单声称可解决的比例 vs 按内容去重后唯一问题占比 | 声称95%可解决,去重后唯一问题约占50% | 24:39 |
| 大型公司单个PR的平均代码行数 | 约10行 | 33:49 |
术语
- RSI递归自我改进
- AI自己不断改进自身能力、可能失控加速的路径,常与AGI风险论绑定。
- SaaSpocalypseSaaS末日论
- AI编码工具兴起后一度流行的悲观叙事:软件因AI而变得廉价易复制,SaaS公司价值将被摧毁。
- 4GL第四代编程语言
- 上世纪80年代出现的、试图更接近自然语言表达意图的编程语言概念。
- probabilistic programming概率编程
- 让程序直接对不确定性和概率建模的编程范式,70年代曾一度沉寂。
收听指南
做AI应用或AI基础设施的工程师、产品负责人,以及关心AI编码工具对SaaS估值逻辑影响的投资人。
9分左右到11分左右的个人成长小故事(数学竞赛、Kaggle经历)信息量较低,可跳过。