电商模型评估迎来新标准,AI 实力到底几何?

测评人工智能的难度逐渐增加。几年前,AI 主要是聊天机器人的时候,评估的方式相对简单,仅仅通过解答一些预设题目,比如写作、数学和编程等,最后得出分数来表示模型的能力。然而,随着 AI 的发展,能够执行更复杂的任务,比如处理网页、文档以及跨系统协作,该评估变得愈加复杂。我们在手机上看到的 AI,能够浏览电商网站、将商品添加到购物车并完成下单,但在商家端同样有 AI 参与,支持更复杂的商业流程。

在专门评估电商环境中模型表现的 RealReplicaBench 测试中,参与的所有模型都未能达及及格线,尤其是通过了107项真实商业任务的考核,最高分也只为56.1分,连排名靠前的如 GPT、Claude、GLM、Qwen、Deepseek 和最后一名的 Gemini 也没有例外。以评分最高的 Claude Opus 5 为例,它在 Accio Work 执行框架中的通过率(66/107)明显优于 OpenClaw(60/107)和 PI(65/107)。 Accio Work 由阿里巴巴推出,是全球首个专注于电商领域的 AI Agent,旨在帮助商家统一管理和自动化操作多个平台店铺,从而降低运营门槛、提升工作效率并助力业务增长。

RealReplicaBench 测试的设计灵感源于 Accio Work 的团队,他们意识到只通过做题无法真实反映模型解决问题的能力,尤其是在电商中,工作往往繁杂且具体。例如,采购环节需要从邮件和报价中确认信息,而产品上架及经营分析则要处理图像、价格和物流等信息,跨平台的数据比对也是必需的。虽然 AI 付出了努力来确保商品能准确送达,但它们的表现并不总是令人满意,因为真实的工作往往不是孤立的问题。

虽然看似是考题目,但实际上是考查模型在实际工作中能否胜任。如果单看分数,RealReplicaBench 的结果似乎在告诉我们:“AI 的能力不行。”然而,这一评价未必公允,因为这套题目确实具有挑战性。传统评测注重的是答对了多少题,完成了多少步骤,就能获得对应的得分。这就像高考,最后一道题即便只写个“解”字,也能得分。然而,一旦 AI 进入实际商业工作流之后,用户需要的并不仅仅是一份努力的答卷,而是能持续推进、真正完成的工作。

对于“完成”的重视,是 Accio Work 团队技术理念的核心,源于其多年来在电商场景中的实战经验。电商工作需要将判断转化为行动,并以新的业务状态为下一步行动提供依据。例如,是否选择正确的供应商会影响后续的采购措施,是否准确计算价格则决定商品的是否能顺利发布,而物流路线是否符合时限将影响是否可以安全订舱。一次小错误可能在整个流程中引发连锁反应。

因此,关键不在于某一步做对了,而在于整个过程是否能够顺畅贯通。RealReplicaBench 对“完成”的定义更加接近真实交付:只有当一项工作能够顺利交接给下一环节时,才算真正完成。技术负责人强调,“如果一个任务完成了80%,但依然有20%需要用户手动处理,且这20% 为关键内容,那么对用户来说,它依然没有形成可以直接使用的交付。”基于这一原则,RealReplicaBench 测评一律不接受折中方案;没有完成则为0分。

若要形象比喻,传统的 Benchmark 更像是交通规则笔试,而 RealReplicaBench 则更像是驾驶考试。知道何时打转向灯是第一步,但能否安全驾驶、顺利到达目的地才是关键。即便每个转向灯都打对,但最后出现意外,依然无法称之为合格司机。同时,随之而来的挑战是,如何制定出一套可重复验证且具备真实工作表现的评测标准?

为了评估“真实工作”,RealReplicaBench 需要先构建一个接近真实商业环境的测试世界。任何一种评测标准都必须回答一个基本问题:它测量的是否是它想要评估的内容?如果目标是判断 Agent 能否完成真实商业任务,仅仅把真实需求转述成几句文字并让模型回答显然不够有效。挑战往往隐藏在被文字省略的地方:页面状态变化、历史与新信息的冲突以及系统字段的不统一等。

RealReplicaBench 的方法是尽可能在测试环境中复现这些复杂情况。它不仅仅给出题目,还重现了前端 UI、浏览器操作、命令行接口、API/MCP、文件系统以及后台状态,使得 Agent 所面对的不再是纸面上的问题,而是真正可操作的商业环境。供应商采购任务就是一个典型案例。Agent 需要在约30个变量中进行信息收集和处理,这要求其具备极高的综合能力与协作能力,方能顺利完成任务。

感谢这里的教练,他们为我量身定制了训练计划,帮助我快速提高身体素质,并且避免了运动伤害!...

感谢这里的教练,他们为我量身定制了训练计划,帮助我快速提高身体素质,并且避免了运动伤害!...