世界太吵,来原声听播客

硅谷101

通用大模型刷到99分,真实电商任务通过率仅61%

张阔说,模型通用榜单接近满分,但他们用107个真实电商任务测试,无人干预下最强模型通过率只有61%——差距不在模型智商,而在商业任务复杂、难验证、反馈周期长。

电商Agent模型评测多模型路由跨境电商AI成本

原视频在 YouTube 上放不出来,用音频听:

既有具体的评测方法论和数字支撑,也有多模型路由如何把执行成本压到对手三分之一的做法,信息密度高。

核心论点 · 点时间戳可跳到原声

2:00

Coding渗透率见顶,商业Agent才起步

张阔估计Coding场景的AI渗透率已经到99%,很难再找到不用AI写代码的研发人员。原因是代码100%数字化、全部沉淀在GitHub这样的代码库里,而且结果是否正确可以立刻编译验证。商业场景完全不同:数据更多元,没有统一流程,不同企业对「好结果」的判断标准也不一样,而且验证周期可能长达一周、一月甚至一年,这是Cowork类产品在电商等复杂场景里进展慢得多的根本原因。

— 张阔
9:03

采购比价从以月计压缩到以天计

没有Agent时,商家要维护一张20列的Excel去比较十几个供应商的生产资质、报价、账期、物流方案,来回沟通往往以月计,最后才能拿到样品。Accio Work先把一个想法拆解成可制造的产品和所需能力,再匹配供应商、代为沟通、拿到报价,原来一个月的工作现在24小时内出结果。张阔提到,有供应商反馈说「没有见过这么专业的design pack」,因为过去买家大多只是在纸上画一画来沟通需求。

— 张阔
22:09

榜单接近满分,真实任务刚过及格线

很多模型发布时榜单已经刷到99分(满分100),但团队在日常经营中感觉不到同等提升。于是他们用上百万条真实经营数据整理出107个电商任务,覆盖报价、纠纷、订船等七大类,测试模型无人干预下能否独立完成。结果是:最前沿模型的通过率也只有61%多一点,「想要达到及格水平,现在都有点费劲」。张阔强调,Coding和通用智能得分高,与能否完成电商任务「没有那么大相关性」。

— 张阔
24:10

多模型路由把成本压到对手三分之一

Accio Work不是所有任务都跑最贵的模型,而是按帕累托最优把问题路由到不同模型:简单的L3以下任务用小尺寸、高性价比模型就能完成,复杂问题才交给frontier模型,同时用自己的harness和context能力让同一个模型拿到更好结果。张阔举例,用千问最新小尺寸模型做post-train,效果已经接近frontier顶尖模型。完成同样通过率的107个任务,Accio Work的估算成本是3.69美元,而Codex和Claude Code都在9美元以上——只有三分之一。

— 张阔
27:13

商业版AGI:比人更会赚钱才算数

张阔给「商业上的AGI」下了一个具体定义:在预算、供应链条件相同的情况下,Agent做日常经营判断一定比人能赚到更多钱,这才算数。但他也提醒,模型和Agent迭代一段时间后会「腐化」——同样的案例过一段时间可能又做不对了,所以基准测试不是一次性的,每个版本都要重新跑一遍107个任务的评估,避免新版本看似升级、实际在某些任务上反而退步。

— 张阔
29:13

多平台流水大,不代表真赚钱

国内商家普遍多平台经营——抖音、淘系、京东、拼多多等,但哪个平台今天真正赚钱,不是看流水多少,而要把投入、收益、退换货数据跨平台拉通才能算清楚,以前靠人工在多个后台来回切换、整理Excel,经常算不准。张阔认为这类跨平台实时经营结论,现在交给AI去解「应该非常容易」,这也是任务难度从L1级「问答」逐步升级到L4级「帮我做经营判断」过程中,商家最常提的诉求之一。

— 张阔
39:24

多个Agent给出不同建议,谁拍板?

当商家同时用多个平台自己的Agent,得到互相矛盾的建议时,张阔的回答是:这很正常,因为Accio Work的定位是站在商家「一本账」的整体视角做优化,而不是围着某一个平台的利益做优化。至于听谁的,取决于老板自己的经营目标是追求毛利、规模还是速度——「这个事情没有办法用一个统一Agent 来统一一下所有Agent的意见」,这不是产品设计的初衷,最终的商业判断必须留给人。

— 张阔
44:26

中小商家靠AI把生意做到几千万美金

CoCreate大会现场注册人数达到约15000人。张阔分享了两个用Accio Work起步的创业案例:英国一个15岁中学生靠它找供应商、做出宠物降温毛巾等系列产品,年销售额已到100万英镑左右;美国MIT毕业的Christian Reed从创意到找供应链全靠Alibaba.com和Accio Work完成,客户现在包括施耐德电气和SpaceX,今年生意规模做到几千万美金以上。张阔认为,这是AI帮中小企业把生意做大的典型样本。

— 张阔

原话 · 已逐字校验

我估计有99% 因为很难看到身边有一个研发人员 不用任何AI去写代码

Coding场景的AI渗透率我估计有99%,因为很难看到身边有研发人员不用任何AI写代码。

张阔1:00

周期一般可能是以月计 到最后你能拿到一个样品 如果有Agent 我们可以把你这个周期 缩短到以天计

采购周期一般以月计,最后才能拿到样品;如果有Agent,我们可以把这个周期缩短到以天计。

张阔8:02

甚至非常多的榜单 都已经达到99分了 满分100 99小数点之后去进步 但我们自己在日常去使用的时候 又没有感觉到像说得这么好

很多榜单都已经刷到99分了(满分100),都在小数点之后进步,但我们自己日常使用时,并没有感觉到说得这么好。

张阔21:08

事实上可能现在 最frontier的模型 在我们这个基准测试下面 能够通过率就是61%多一点点 它想要达到及格水平 现在都有点费劲

事实上现在最前沿的模型,在我们这个基准测试下通过率只有61%多一点,想达到及格水平都有点费劲。

张阔22:09

用Accio Work的估算成本 是3.69美元 我看到是你们给到的一个数字 Codex和Claude Code 都是在9美元以上 所以就是Accio Work的成本 是另外两家的三分之一

用Accio Work的估算成本是3.69美元,这是你们给的数字,Codex和Claude Code都在9美元以上,所以Accio Work的成本是另外两家的三分之一。

Yiwen33:18

这个事情没有办法 用一个统一Agent 来统一一下所有Agent的意见 然后给用户一个更好的反馈 这不是我们这个产品设计的初衷

这件事没办法用一个统一的Agent,去统一所有Agent的意见再给用户反馈,这不是我们产品设计的初衷。

张阔39:24

我们可能最终估计 注册到场的有15000人 我们肯定前面那个摊位 注册摊搞小了 一直排队到中午吃饭的时候 人还没有完全进来解锁

我们最终估计注册到场的有15000人,前面的注册摊位肯定搞小了,一直排队到中午吃饭时间人还没完全进场。

张阔43:25

数字与实体

Coding场景AI渗透率约99%1:00
整体搜索 vs 多模态搜索增长整体涨20%,多模态涨130%4:02
阿里国际站自建电商基准测试任务数107个任务(七大类)21:08
最前沿模型无人干预下通过率61%多一点点22:09
Accio Work完成同等任务的估算成本3.69美元33:18
Codex/Claude Code完成同等任务的成本9美元以上33:18
CoCreate大会注册到场人数约15000人43:25
英国15岁创业冠军年销售额约100万英镑43:25
美国创业冠军Christian Reed今年生意规模几千万美金以上44:26

术语

Harness工程执行框架
连接工具、管理记忆与授权的工程层,决定Agent能否把任务真正执行到底
ontology本体
对企业内部各类数据和业务含义的结构化理解
verifiable可验证性
任务结果能否被直接判断对错,如代码能否编译通过

收听指南

谁该听

做跨境电商、B2B采购或企业级Agent产品的人,想知道模型评测分数能否兑现为真实业务结果。

可跳过

10:13-14:11 中美SaaS生态对比部分与此前节目内容重合,可快进。