通用榜单上的分数越来越高,但商家打开后台,感觉和半年前没什么两样。阿里国际站总裁张阔在复盘 AI 电商 Agent 半年进展时,给出了一个不太好看的答案:最前沿的模型,在无人干预条件下跑真实电商任务,通过率只有 61% 多一点点。他的原话是,想达到及格水平,现在都有点费劲。
这个数字来自一套从阿里国际站真实经营与问答数据里整理出来的测试集,共 107 个电商任务,已经开源。任务覆盖采购比价、船期预订、交易纠纷判断等七大类,按难度分成 L1 到 L4。跑这套题的不是实验室环境,是商家每天真正要处理的事。
![]()
榜单满分,生意里不及格
张阔的核心观察是:模型在通用榜单上不断逼近满分,但商家在真实经营中的体感提升并不成比例。数学、编程、通用 Agent 的评测成绩,和电商垂直任务的完成度之间,相关性有限。这解释了为什么模型一轮轮升级,商家的感受却没有同步变化。
他把 Agent 能力概括成一个乘法公式:Agent = model × harness × context。三项里任何一项为零,整体就是零。只等模型升级,解决不了垂直场景里的问题。
垂直产品的优势,来自二十多年积累的交易数据、供应商沟通记录、行业属性和平台趋势。这些上下文决定了 AI 能不能理解一家企业到底在优化利润、份额还是速度。张阔认为,垂直 Agent 必须同时做模型后训练、推理服务、工程框架和上下文管理,缺一不可。
成本决定 AI 能不能天天用
商家的一个真实感受是:用得起的 AI,才是有价值的 AI。张阔提到,固定用最贵的模型解决所有问题,是常见误区。XWork 的做法是按任务难度路由:L3 以下交给高性价比或小尺寸模型,复杂任务才交给前沿模型。
配合集约采购和工程、上下文层面的优化,跑完这 107 个任务的成本对比是:
- XWork:约 3.69 美元
- Codex:9 美元以上
- Claude Code:9 美元以上
差距大约是三倍。这个数字决定了 AI 是演示品还是日常工具。
哪些活交给 AI,哪些必须留给人
适合 AI 接手的是重复性经营工作:多平台经营报表、商品发布、客户经营分析、风险预警。这些事量大、规则相对清晰,人做起来耗时且容易出错。
但采购下单、产品品味、市场判断、预算分配,以及多个 Agent 给出冲突建议时的取舍,张阔认为仍应由老板基于整体经营目标决定。AI 可以让生意更灵活,但替代不了对"这盘生意到底要什么"的判断。他的表述是,最终这个商业判断还是人去做。
关于 AI 与 SaaS 的关系,他的判断不是简单的替代。美国 SaaS 更垂直,电商有独立站生态;中国平台更整合,商家习惯多平台经营。SaaS 掌握着企业工作流和经营上下文,AI 需要这些上下文才能真正落地,所以更可能是互相集成。AI 产品第一天就是全球化的,但工具、平台与区域上下文仍需适配。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.