世界太吵,來原聲聽播客

a16z

AI編碼工具寫代碼更快,但軟件本身十年沒怎麼變聰明

編碼智能體讓人寫代碼更快,但產出的還是同一種軟件;Diogo Almeida說真正該做的是把AI變成軟件裡的新原語,讓此前不能自動化的事情變得可以自動化。

AI編程編碼智能體SaaSAI可靠性AGI敘事概率編程

原視頻在 YouTube 上放不出來,用音頻聽:

創始人親述從OpenAI早期AGI幻滅到做出Jev的心路,講清了AI原生編程與傳統編碼智能體的本質差異。

核心論點 · 點時間戳可跳到原聲

3:02

編碼智能體與Jev根本不是一回事

Cloud Code、Codex這類編碼智能體的本質是「just in time software」——用自然語言現寫代碼,但寫出來的東西和人類工程師寫的代碼沒有本質區別,表達力還是原來那套。Diogo想做的不是讓寫代碼更快,而是往軟件裡塞一個新原語:不是自動化「軟件工程師」這件事,而是擴展軟件本身能做的事,讓本來「該被自動化卻做不到」的事情變得可以自動化。

— Diogo Almeida
7:11

Jev就是個分類器,但這不是貶義

Diogo承認Jev本質上就是個分類器(classifier)——這不是黑話,分類器這個詞本來就是從「要真正解決問題」的工程師那裡來的。它更像一個庫:用自然語言描述想要的行為,配上一個狀態機,Jev在裡面帶著置信度選擇走哪條分支。他猜測Jev現在做到的事,可能已經好過一支2019年的傳統機器學習工程團隊花幾個月做數據集、調模型才能做出來的東西,而現在普通開發者當場就能「編」出來。

— Diogo Almeida
12:19

我們造的是產品,不是神

Ben Horowitz說TypeSafe最打動他的一句話是「we build prod, not God」——別的大模型實驗室哪怕私下也樂在其中,公開場合總要端著「我們在造可能失控的東西」的沉重感;TypeSafe的態度完全相反,直接把AI樂觀主義擺到檯面上。Diogo認為這種悲觀情緒很大程度上來自「一個大腦統治一切」的單一模型迷思,只要還相信只有一個越來越大的中心化模型才是AI的未來,就很難理解開發者拿到一個可編程AI原語後有多興奮。

— Ben Horowitz
18:25

他曾以為GPT已經是AGI,幻滅後轉向

Diogo在OpenAI參與了早期RLHF模型的發布,在那之前他完全沒料到指令微調後模型的泛化能力會這麼強——團隊故意拿「為什麼冥想前要先吃襪子」這種確定不在互聯網上出現過的怪問題去測,模型卻能給出說得通的人類式回答。這讓他一度真心相信這個模型有相當大概率就是AGI。等它沒有變成AGI,他形容那是「整個世界觀崩塌」的時刻,也是他後來轉向「AI要真正變得有用而不只是看起來聰明」這條路的起點。

— Diogo Almeida
19:26

他不信遞歸自我改進,但信AGI的另一種定義

Diogo明確說,出於一些複雜原因,他不認為AI走在RSI(遞歸自我改進)的路上,過去和現在都不信。但他認同OpenAI給AGI下的那個更樸素的定義——自動化世界上大多數有經濟價值的工作——認為這事完全可行,因為大量經濟價值工作其實很基礎、很重複。問題出在RLHF之後,行業把力氣都花在討好「人類評委」這個代理指標上:GPT-3本來校準得還不錯,但因為是人在打分,模型越來越會說漂亮話,卻沒有同步變得更能真正自動化任務。

— Diogo Almeida
24:39

客服自動化卡在長尾,不是卡在智能

Diogo舉OpenAI自2020年就在嘗試自動化客服作為反例:智能程度早就夠了,為什麼還是做不成。Martin補充了一個更具體的觀察——早年看客服公司數據時,對方常說「我們能回答95%的工單」,聽起來很厲害,但把工單按內容去重後會發現真正不重複的問題只佔一半左右,剩下全是密碼重置之類的高頻重複問題。這說明卡住自動化的不是模型不夠聰明,而是現實世界天然是個長尾分布,標準聊天機器人只能吃掉頭部,吃不掉長尾裡的例外。

— Diogo Almeida
26:42

可靠不等於每次答案一樣

Diogo把「可靠性」拆成三層:第一層接近傳統的可用性/SLA;第二層接近「確定性」,但他強調這對單元測試有用、對真實系統沒用——比如提示詞裡塞一個UUID,輸出理論上該「功能上相同」但字面上不會完全一樣;第三層他還沒想到統一說法,姑且叫「魯棒性」——不要求每次給出相同答案,但要求每次都給出一個換成人來看也說得通的判斷。他說可靠性每提高一個「9」,都能撐起一批此前不敢用AI的全新應用場景。

— Diogo Almeida
33:49

SaaS末日論錯了:大PR才十行代碼

編碼智能體剛出來時市場一度相信SaaS要被平替,股價應聲下跌;Jev出來後SaaS公司反而集體叫好,因為「軟件很便宜」這個判斷沒錯,但「所以容易被複制」這個推論是錯的,很多價值藏在看不見的細節工程裡。Ben Horowitz補了一個數據感:大公司裡一條典型PR平均也就10行代碼,編碼智能體自動化的其實是這10行本身,而不是給軟件新增能力;Jev提供的是一個新原語,能讓軟件長出此前沒有的功能,這也是為什麼軟件用AI寫得更快,卻沒有變得更好,甚至因為審查變少而更容易出安全問題。

— Diogo Almeida

原話 · 已逐字校驗

Where the fuck is all the automation? AI is so unbelievably smart, and yet it's so useless at all other stuff.

自動化到底跑哪兒去了?AI已經聰明到這種地步了,可它在其他所有事情上都沒什麼用。

Diogo Almeida0:00

But TypeSafe is making AI for software. You know, we want to make AI powerful, not just for humans in the loop, but to actually build real software.

但TypeSafe是在為軟件本身做AI。我們想讓AI變得強大,不只是服務於「人在迴路裡」的場景,而是讓它真正能去構建軟件。

Diogo Almeida3:02

But like intelligence per dollar is my North Star right now. And it could be wrong, just to be clear.

但「每一美元能買到多少智能」現在是我的北極星指標。說清楚,這個方向也可能是錯的。

Diogo Almeida8:15

And my favorite thing that you guys say is we build prod, not God.

我最喜歡你們說的一句話是:我們造的是產品,不是神。

Ben Horowitz12:19

And, you know, my favorite query was, why is it important to eat socks before meditating?

我最喜歡的一條測試問題是:為什麼冥想之前吃襪子很重要?

Diogo Almeida18:25

I am not, for nuanced reasons, I don't think we are on the path of RSI.

出於一些複雜的原因,我不認為我們正走在遞歸自我改進(RSI)的路上。

Diogo Almeida19:26

OpenAI has been trying to automate customer service since 2020.

OpenAI從2020年就開始嘗試自動化客服了。

Diogo Almeida23:35

You know, like, imagine if all technology just did what you mean. That is, like, that's not sci-fi.

想像一下,如果所有技術都能「做你真正想要的事」。這不是科幻,是真的可能實現。

Diogo Almeida41:57

數字與實體

OpenAI嘗試自動化客服的起始時間2020年23:35
客服工單聲稱可解決的比例 vs 按內容去重後唯一問題佔比聲稱95%可解決,去重後唯一問題約佔50%24:39
大型公司單個PR的平均代碼行數約10行33:49

術語

RSI遞歸自我改進
AI自己不斷改進自身能力、可能失控加速的路徑,常與AGI風險論綁定。
SaaSpocalypseSaaS末日論
AI編碼工具興起後一度流行的悲觀敘事:軟件因AI而變得廉價易複製,SaaS公司價值將被摧毀。
4GL第四代編程語言
上世紀80年代出現的、試圖更接近自然語言表達意圖的編程語言概念。
probabilistic programming概率編程
讓程序直接對不確定性和概率建模的編程範式,70年代曾一度沉寂。

收聽指南

誰該聽

做AI應用或AI基礎設施的工程師、產品負責人,以及關心AI編碼工具對SaaS估值邏輯影響的投資人。

可跳過

9分左右到11分左右的個人成長小故事(數學競賽、Kaggle經歷)信息量較低,可跳過。