世界太吵,來原聲聽播客

硅谷101

通用大模型刷到99分,真實電商任務通過率僅61%

張闊說,模型通用榜單接近滿分,但他們用107個真實電商任務測試,無人干預下最強模型通過率只有61%——差距不在模型智商,而在商業任務複雜、難驗證、反饋週期長。

電商Agent模型評測多模型路由跨境電商AI成本

原視頻在 YouTube 上放不出來,用音頻聽:

既有具體的評測方法論和數字支撐,也有多模型路由如何把執行成本壓到對手三分之一的做法,信息密度高。

核心論點 · 點時間戳可跳到原聲

2:00

Coding滲透率見頂,商業Agent才起步

張闊估計Coding場景的AI滲透率已經到99%,很難再找到不用AI寫代碼的研發人員。原因是代碼100%數字化、全部沉澱在GitHub這樣的代碼庫裡,而且結果是否正確可以立刻編譯驗證。商業場景完全不同:數據更多元,沒有統一流程,不同企業對「好結果」的判斷標準也不一樣,而且驗證週期可能長達一週、一月甚至一年,這是Cowork類產品在電商等複雜場景裡進展慢得多的根本原因。

— 張闊
9:03

採購比價從以月計壓縮到以天計

沒有Agent時,商家要維護一張20列的Excel去比較十幾個供應商的生產資質、報價、賬期、物流方案,來回溝通往往以月計,最後才能拿到樣品。Accio Work先把一個想法拆解成可製造的產品和所需能力,再匹配供應商、代為溝通、拿到報價,原來一個月的工作現在24小時內出結果。張闊提到,有供應商反饋說「沒有見過這麼專業的design pack」,因為過去買家大多只是在紙上畫一畫來溝通需求。

— 張闊
22:09

榜單接近滿分,真實任務剛過及格線

很多模型發布時榜單已經刷到99分(滿分100),但團隊在日常經營中感覺不到同等提升。於是他們用上百萬條真實經營數據整理出107個電商任務,覆蓋報價、糾紛、訂船等七大類,測試模型無人干預下能否獨立完成。結果是:最前沿模型的通過率也只有61%多一點,「想要達到及格水平,現在都有點費勁」。張闊強調,Coding和通用智能得分高,與能否完成電商任務「沒有那麼大相關性」。

— 張闊
24:10

多模型路由把成本壓到對手三分之一

Accio Work不是所有任務都跑最貴的模型,而是按帕累托最優把問題路由到不同模型:簡單的L3以下任務用小尺寸、高性價比模型就能完成,複雜問題才交給frontier模型,同時用自己的harness和context能力讓同一個模型拿到更好結果。張闊舉例,用千問最新小尺寸模型做post-train,效果已經接近frontier頂尖模型。完成同樣通過率的107個任務,Accio Work的估算成本是3.69美元,而Codex和Claude Code都在9美元以上——只有三分之一。

— 張闊
27:13

商業版AGI:比人更會賺錢才算數

張闊給「商業上的AGI」下了一個具體定義:在預算、供應鏈條件相同的情況下,Agent做日常經營判斷一定比人能賺到更多錢,這才算數。但他也提醒,模型和Agent迭代一段時間後會「腐化」——同樣的案例過一段時間可能又做不對了,所以基準測試不是一次性的,每個版本都要重新跑一遍107個任務的評估,避免新版本看似升級、實際在某些任務上反而退步。

— 張闊
29:13

多平臺流水大,不代表真賺錢

國內商家普遍多平臺經營——抖音、淘系、京東、拼多多等,但哪個平臺今天真正賺錢,不是看流水多少,而要把投入、收益、退換貨數據跨平臺拉通才能算清楚,以前靠人工在多個後臺來回切換、整理Excel,經常算不準。張闊認為這類跨平臺實時經營結論,現在交給AI去解「應該非常容易」,這也是任務難度從L1級「問答」逐步升級到L4級「幫我做經營判斷」過程中,商家最常提的訴求之一。

— 張闊
39:24

多個Agent給出不同建議,誰拍板?

當商家同時用多個平臺自己的Agent,得到互相矛盾的建議時,張闊的回答是:這很正常,因為Accio Work的定位是站在商家「一本賬」的整體視角做優化,而不是圍著某一個平臺的利益做優化。至於聽誰的,取決於老闆自己的經營目標是追求毛利、規模還是速度——「這個事情沒有辦法用一個統一Agent 來統一一下所有Agent的意見」,這不是產品設計的初衷,最終的商業判斷必須留給人。

— 張闊
44:26

中小商家靠AI把生意做到幾千萬美金

CoCreate大會現場註冊人數達到約15000人。張闊分享了兩個用Accio Work起步的創業案例:英國一個15歲中學生靠它找供應商、做出寵物降溫毛巾等系列產品,年銷售額已到100萬英鎊左右;美國MIT畢業的Christian Reed從創意到找供應鏈全靠Alibaba.com和Accio Work完成,客戶現在包括施耐德電氣和SpaceX,今年生意規模做到幾千萬美金以上。張闊認為,這是AI幫中小企業把生意做大的典型樣本。

— 張闊

原話 · 已逐字校驗

我估計有99% 因為很難看到身邊有一個研發人員 不用任何AI去寫代碼

Coding場景的AI滲透率我估計有99%,因為很難看到身邊有研發人員不用任何AI寫代碼。

張闊1:00

週期一般可能是以月計 到最後你能拿到一個樣品 如果有Agent 我們可以把你這個週期 縮短到以天計

採購週期一般以月計,最後才能拿到樣品;如果有Agent,我們可以把這個週期縮短到以天計。

張闊8:02

甚至非常多的榜單 都已經達到99分了 滿分100 99小數點之後去進步 但我們自己在日常去使用的時候 又沒有感覺到像說得這麼好

很多榜單都已經刷到99分了(滿分100),都在小數點之後進步,但我們自己日常使用時,並沒有感覺到說得這麼好。

張闊21:08

事實上可能現在 最frontier的模型 在我們這個基準測試下面 能夠通過率就是61%多一點點 它想要達到及格水平 現在都有點費勁

事實上現在最前沿的模型,在我們這個基準測試下通過率只有61%多一點,想達到及格水平都有點費勁。

張闊22:09

用Accio Work的估算成本 是3.69美元 我看到是你們給到的一個數字 Codex和Claude Code 都是在9美元以上 所以就是Accio Work的成本 是另外兩家的三分之一

用Accio Work的估算成本是3.69美元,這是你們給的數字,Codex和Claude Code都在9美元以上,所以Accio Work的成本是另外兩家的三分之一。

Yiwen33:18

這個事情沒有辦法 用一個統一Agent 來統一一下所有Agent的意見 然後給用戶一個更好的反饋 這不是我們這個產品設計的初衷

這件事沒辦法用一個統一的Agent,去統一所有Agent的意見再給用戶反饋,這不是我們產品設計的初衷。

張闊39:24

我們可能最終估計 註冊到場的有15000人 我們肯定前面那個攤位 註冊攤搞小了 一直排隊到中午吃飯的時候 人還沒有完全進來解鎖

我們最終估計註冊到場的有15000人,前面的註冊攤位肯定搞小了,一直排隊到中午吃飯時間人還沒完全進場。

張闊43:25

數字與實體

Coding場景AI滲透率約99%1:00
整體搜索 vs 多模態搜索增長整體漲20%,多模態漲130%4:02
阿里國際站自建電商基準測試任務數107個任務(七大類)21:08
最前沿模型無人干預下通過率61%多一點點22:09
Accio Work完成同等任務的估算成本3.69美元33:18
Codex/Claude Code完成同等任務的成本9美元以上33:18
CoCreate大會註冊到場人數約15000人43:25
英國15歲創業冠軍年銷售額約100萬英鎊43:25
美國創業冠軍Christian Reed今年生意規模幾千萬美金以上44:26

術語

Harness工程執行框架
連接工具、管理記憶與授權的工程層,決定Agent能否把任務真正執行到底
ontology本體
對企業內部各類數據和業務含義的結構化理解
verifiable可驗證性
任務結果能否被直接判斷對錯,如代碼能否編譯通過

收聽指南

誰該聽

做跨境電商、B2B採購或企業級Agent產品的人,想知道模型評測分數能否兌現為真實業務結果。

可跳過

10:13-14:11 中美SaaS生態對比部分與此前節目內容重合,可快進。