【CNMO科技消息】9月3日,千问大模型正式对外发布全新评测基准E-Commerce Bench。该基准旨在评估大模型作为电商商家,在真实市场中经营网店的能力。在设定的测试中,Agent将获得10万元本金,并在动态市场中做出经营决策,以应对市场的变化和不确定性。一年的经营周期结束后,模型的表现将依据多个维度进行综合评估。
![]()
千问
还原真实电商环境,设定365天长程经营挑战
E-Commerce Bench基于电商平台的脱敏数据,高度还原了商品、供应商、促销及退货等真实市场要素。参与测试的Agent需要在有限的时间和资金内,完成市场调研、商品采购、定价、发货与库存管理等全流程工作。与此同时,模型还需应对延迟结算、仓储成本、退货和信誉变化等复杂情况,并持续经营整整一年时间。
![]()
确定性内核设计,兼顾真实体验与评测可复现性
为了在保持真实感的同时确保评测过程的公平与一致,该基准采用了确定性内核设计。用户需求由价格、季节、促销、信誉等多个因素共同计算得出,而供应商的报价、让步、接受和离场,则完全由确定性谈判内核进行决定。在此机制下,大语言模型(LLM)仅负责将决定渲染成自然对话,既保留了多轮砍价谈判的真实感,又有效避开了采样噪声可能引入的随机性。
![]()
七维评估体系,揭示“获利”并非唯一答案
E-Commerce Bench明确强调,“赚得多”并不等同于“经营得好”。评测体系从总资产、谈判质量、反欺诈、现金流与清偿、运营效率、运营执行和长程学习共七个维度,全面拆解模型在模拟经营中的真实表现。
测试数据显示,当18个模型各运行5轮后,没有任何一个模型能够在七个维度上实现全面领先。结果显示,表现强的模型也有可能因年初大量铺货而导致资金链断裂;而在整个测试中赚得最多的模型,其在反欺诈维度的表现也并不靠前。
长程学习与风控成为短板,单一模型展现进步迹象
在模拟经营的“长期学习”方面,数据表现揭示了行业共性弱点。在8647次重复进货的测试记录中,绝大多数模型都没有将历史成交低价转化为下一次谈判的优势。值得注意的是,Qwen3.8-Max-Preview是参与测试的18个模型中,唯一表现出明显长程学习迹象的模型。
![]()
千问官方指出,单一指标往往会掩盖模型的真实表现。E-Commerce Bench致力于从七大维度全面评估模型一整年的经营表现,旨在为行业提供更全面、更可靠的长程智能体评估参考框架,共同探索大模型在复杂商业博弈中的能力边界。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.