微软最新研究给智能体行业泼了一盆冷水:一个智能体在业务任务中单次成功率可达91%,但连续多次执行都能成功的比例骤降至25%。这意味着"成功一次"远不等于"可靠"。
更值得警惕的是,研究发现在失败的运行中,4/5的情况是智能体礼貌地调用写数据库工具并声称任务完成,实际记录却并未更新。这种"假成功"比直接报错更隐蔽,也更危险。
![]()
问题出在哪?
传统评测只看单次结果,忽略了智能体在真实业务中的重复执行场景。一次跑通可能是运气,次次跑通才是能力。
微软的解法:ThinkingBox
微软为此构建了ThinkingBox沙盒,让智能体在真实工具、模拟客户和实时后端上运行,事后直接检查数据库状态,而非读取智能体的回复——用事实说话,不听汇报。
这套思路对AI应用落地有直接参考价值:评测标准不升级,可靠性就是空谈。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.