通用大模型刷到99分,真实电商任务通过率仅61%
张阔说,模型通用榜单接近满分,但他们用107个真实电商任务测试,无人干预下最强模型通过率只有61%——差距不在模型智商,而在商业任务复杂、难验证、反馈周期长。
原视频在 YouTube 上放不出来,用音频听:
核心论点 · 点时间戳可跳到原声
Coding渗透率见顶,商业Agent才起步
张阔估计Coding场景的AI渗透率已经到99%,很难再找到不用AI写代码的研发人员。原因是代码100%数字化、全部沉淀在GitHub这样的代码库里,而且结果是否正确可以立刻编译验证。商业场景完全不同:数据更多元,没有统一流程,不同企业对「好结果」的判断标准也不一样,而且验证周期可能长达一周、一月甚至一年,这是Cowork类产品在电商等复杂场景里进展慢得多的根本原因。
— 张阔采购比价从以月计压缩到以天计
没有Agent时,商家要维护一张20列的Excel去比较十几个供应商的生产资质、报价、账期、物流方案,来回沟通往往以月计,最后才能拿到样品。Accio Work先把一个想法拆解成可制造的产品和所需能力,再匹配供应商、代为沟通、拿到报价,原来一个月的工作现在24小时内出结果。张阔提到,有供应商反馈说「没有见过这么专业的design pack」,因为过去买家大多只是在纸上画一画来沟通需求。
— 张阔榜单接近满分,真实任务刚过及格线
很多模型发布时榜单已经刷到99分(满分100),但团队在日常经营中感觉不到同等提升。于是他们用上百万条真实经营数据整理出107个电商任务,覆盖报价、纠纷、订船等七大类,测试模型无人干预下能否独立完成。结果是:最前沿模型的通过率也只有61%多一点,「想要达到及格水平,现在都有点费劲」。张阔强调,Coding和通用智能得分高,与能否完成电商任务「没有那么大相关性」。
— 张阔多模型路由把成本压到对手三分之一
Accio Work不是所有任务都跑最贵的模型,而是按帕累托最优把问题路由到不同模型:简单的L3以下任务用小尺寸、高性价比模型就能完成,复杂问题才交给frontier模型,同时用自己的harness和context能力让同一个模型拿到更好结果。张阔举例,用千问最新小尺寸模型做post-train,效果已经接近frontier顶尖模型。完成同样通过率的107个任务,Accio Work的估算成本是3.69美元,而Codex和Claude Code都在9美元以上——只有三分之一。
— 张阔商业版AGI:比人更会赚钱才算数
张阔给「商业上的AGI」下了一个具体定义:在预算、供应链条件相同的情况下,Agent做日常经营判断一定比人能赚到更多钱,这才算数。但他也提醒,模型和Agent迭代一段时间后会「腐化」——同样的案例过一段时间可能又做不对了,所以基准测试不是一次性的,每个版本都要重新跑一遍107个任务的评估,避免新版本看似升级、实际在某些任务上反而退步。
— 张阔多平台流水大,不代表真赚钱
国内商家普遍多平台经营——抖音、淘系、京东、拼多多等,但哪个平台今天真正赚钱,不是看流水多少,而要把投入、收益、退换货数据跨平台拉通才能算清楚,以前靠人工在多个后台来回切换、整理Excel,经常算不准。张阔认为这类跨平台实时经营结论,现在交给AI去解「应该非常容易」,这也是任务难度从L1级「问答」逐步升级到L4级「帮我做经营判断」过程中,商家最常提的诉求之一。
— 张阔多个Agent给出不同建议,谁拍板?
当商家同时用多个平台自己的Agent,得到互相矛盾的建议时,张阔的回答是:这很正常,因为Accio Work的定位是站在商家「一本账」的整体视角做优化,而不是围着某一个平台的利益做优化。至于听谁的,取决于老板自己的经营目标是追求毛利、规模还是速度——「这个事情没有办法用一个统一Agent 来统一一下所有Agent的意见」,这不是产品设计的初衷,最终的商业判断必须留给人。
— 张阔中小商家靠AI把生意做到几千万美金
CoCreate大会现场注册人数达到约15000人。张阔分享了两个用Accio Work起步的创业案例:英国一个15岁中学生靠它找供应商、做出宠物降温毛巾等系列产品,年销售额已到100万英镑左右;美国MIT毕业的Christian Reed从创意到找供应链全靠Alibaba.com和Accio Work完成,客户现在包括施耐德电气和SpaceX,今年生意规模做到几千万美金以上。张阔认为,这是AI帮中小企业把生意做大的典型样本。
— 张阔原话 · 已逐字校验
我估计有99% 因为很难看到身边有一个研发人员 不用任何AI去写代码
Coding场景的AI渗透率我估计有99%,因为很难看到身边有研发人员不用任何AI写代码。
张阔1:00
周期一般可能是以月计 到最后你能拿到一个样品 如果有Agent 我们可以把你这个周期 缩短到以天计
采购周期一般以月计,最后才能拿到样品;如果有Agent,我们可以把这个周期缩短到以天计。
张阔8:02
甚至非常多的榜单 都已经达到99分了 满分100 99小数点之后去进步 但我们自己在日常去使用的时候 又没有感觉到像说得这么好
很多榜单都已经刷到99分了(满分100),都在小数点之后进步,但我们自己日常使用时,并没有感觉到说得这么好。
张阔21:08
事实上可能现在 最frontier的模型 在我们这个基准测试下面 能够通过率就是61%多一点点 它想要达到及格水平 现在都有点费劲
事实上现在最前沿的模型,在我们这个基准测试下通过率只有61%多一点,想达到及格水平都有点费劲。
张阔22:09
用Accio Work的估算成本 是3.69美元 我看到是你们给到的一个数字 Codex和Claude Code 都是在9美元以上 所以就是Accio Work的成本 是另外两家的三分之一
用Accio Work的估算成本是3.69美元,这是你们给的数字,Codex和Claude Code都在9美元以上,所以Accio Work的成本是另外两家的三分之一。
Yiwen33:18
这个事情没有办法 用一个统一Agent 来统一一下所有Agent的意见 然后给用户一个更好的反馈 这不是我们这个产品设计的初衷
这件事没办法用一个统一的Agent,去统一所有Agent的意见再给用户反馈,这不是我们产品设计的初衷。
张阔39:24
我们可能最终估计 注册到场的有15000人 我们肯定前面那个摊位 注册摊搞小了 一直排队到中午吃饭的时候 人还没有完全进来解锁
我们最终估计注册到场的有15000人,前面的注册摊位肯定搞小了,一直排队到中午吃饭时间人还没完全进场。
张阔43:25
数字与实体
| Coding场景AI渗透率 | 约99% | 1:00 |
| 整体搜索 vs 多模态搜索增长 | 整体涨20%,多模态涨130% | 4:02 |
| 阿里国际站自建电商基准测试任务数 | 107个任务(七大类) | 21:08 |
| 最前沿模型无人干预下通过率 | 61%多一点点 | 22:09 |
| Accio Work完成同等任务的估算成本 | 3.69美元 | 33:18 |
| Codex/Claude Code完成同等任务的成本 | 9美元以上 | 33:18 |
| CoCreate大会注册到场人数 | 约15000人 | 43:25 |
| 英国15岁创业冠军年销售额 | 约100万英镑 | 43:25 |
| 美国创业冠军Christian Reed今年生意规模 | 几千万美金以上 | 44:26 |
术语
- Harness工程执行框架
- 连接工具、管理记忆与授权的工程层,决定Agent能否把任务真正执行到底
- ontology本体
- 对企业内部各类数据和业务含义的结构化理解
- verifiable可验证性
- 任务结果能否被直接判断对错,如代码能否编译通过
收听指南
做跨境电商、B2B采购或企业级Agent产品的人,想知道模型评测分数能否兑现为真实业务结果。
10:13-14:11 中美SaaS生态对比部分与此前节目内容重合,可快进。