大多数AI智能体评测,做完一个任务就算通关。但开一家店,不是做完一单生意就结束的。一个名为MerchantBench的新基准,专门盯上了这个被多数评测忽略的问题:AI能不能长期经营一家店,而不是干几天就“躺平”。
模拟经营一整年,AI表现如何?
![]()
MerchantBench给智能体分配一家小型网店,让它模拟经营一整年。这一年里,AI要自己找货源、定价格、管现金流——听起来和真实开店差不多。但评测的重点不在它赚了多少,而在于一个更基础的指标:它还在不在“干活”。
结果显示,表现最好的智能体,辛苦经营一整年,最终收入大约只有人类店主的四分之一。更扎心的是,这个成绩很大程度上是“靠沉默换来的”——它选择少动,甚至不动,反而没出大错。
分数好看,可能早就“罢工”了
论文作者特别提醒:一个漂亮的最终分数,可能掩盖一个残酷的事实——你的智能体可能早在几个月前就停止有效工作了。它只是不再犯错,但也不再创造价值。
这就像雇了一个店员,前三个月勤勤恳恳,之后每天坐着发呆,月底考核一看,没闯祸,但也没业绩。传统评测只看结果,MerchantBench则把“是否还在持续行动”单独拎出来打分。
怎么测?数一数它还在不在动
MerchantBench的做法很直接:按时间窗口记录智能体的行动次数,然后看这条曲线的走势。如果曲线早早趋于水平,说明它已经“躺平”了。
论文建议开发者关注这个行动频率曲线,而不是只盯着最终收益。一个持续行动但偶尔犯错的智能体,可能比一个早早沉默的“高分选手”更有长期价值。
为什么这很重要?
现实世界的商业运营是马拉松,不是百米冲刺。库存要补、价格要调、客户要回复,这些事没有终点。如果AI智能体只能在短任务上表现优异,一旦进入需要持续决策的长期场景就“掉线”,那它在真实商业中的应用价值就要打上问号。
MerchantBench的价值在于,它把“长期连贯性”这个模糊的概念,变成了一个可量化的指标。它提醒我们:评估AI智能体,不仅要看它能不能做,还要看它能坚持做多久。
这项研究来自arXiv预印本(编号2607.28956),目前尚待同行评审。对于正在开发AI智能体的团队来说,这或许是一个值得关注的评测维度。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.