一个AI客服代理处理退款,九次工具调用全部规范:拉订单、查物流、调客户档案、两次检索退款政策、确认无工单、建工单、记录时间线、正确读取政策。然后它把工单标记为"已解决",回复用户"您的问题已解决,还有什么可以帮您?"
两处出错。承运商的异常状态仍然挂着,要求的终态本应是"暂缓、待处理";而用户真正问的问题,从头到尾没得到回答。
![]()
检查工具调用的评分器会看到九次规范调用。检查代理是否写入数据库的评分器也会看到写入。但数据库不同意。
507个有状态工作流,每个跑20次
这个落差就是 ThinkingBox 要测量的东西。它覆盖 507 个有状态业务流程,每个任务对多个大模型独立运行 20 次,评分依据是终态后端状态和副作用,而不是生成的句子。该项目现已通过 Hugging Face 开放。
工具调用不等于结果。最终回复和合法的工具调用只是代理指标。一个代理可以听起来完全正确,却留下错误的值、改错记录,或者制造出多余的副作用。只有它留下的记录能回答这个问题。
落差相当大。在一项覆盖 12 个大模型、121,680 次有效试验的公共集消融测试中,79,853 次尝试未通过可执行检查。在这些失败中,67.24% 仍然干净地终止、调用了改变状态的工具、且没有报告最终的工具有错误。
可执行检查仍然在其中 77.61% 的案例里发现了字段值错误,43.30% 发现了非预期的额外副作用,25.36% 发现了缺失的必要副作用。这些状态检查的发现存在重叠。
一条轨迹是一个声明。数据库状态是证据。重复是信任测试。
一次成功不等于可靠
一个代理正确处理了一次退款、接下来四次都搞砸,它就不是一个能用的退款代理。所以每个任务独立运行 20 次,每次从相同的干净后端出发,报告三个不同的数字。这里使用的"20/20"是字面计数:507 个任务中有多少在 20 次尝试里全部通过。没有估算,没有平滑。
先看熟悉的视角。按领域拆分的 pass@1 单次尝试得分估计,这是大多数排行榜发布的数字,单独看像一份普通的能力排名。
Claude Opus 5.5 以 67.16% 总体领先,比 Claude Opus 5 高出三分之二个百分点。Kimi-K3 是最强的开放权重模型,与 GPT-6-Astra 相差不到一个百分点。领域的影响同样大:Claude Opus 4.6 在零售场景拿到 68.62%,在车险场景只有 8.30%。
一次好的运行告诉你模型能做这份工作。它不告诉你模型会不会再做一次。所以每个任务跑 20 次,然后问这个分数有多少能存活下来。
只有三个模型保住了大部分 pass@1 分数:GPT-6 Astra 保留了单次尝试率的 78%,Claude Opus 5.5 和 Claude Opus 5 各保留 71%。另一端,GLM-5.1、Kimi-K2.6 和 DeepSeek-V4-Pro 各自只保住约 8%。
一个模型一次能做到什么,和它每次都能做到什么,这中间的差距就是全部故事。
广度和一致性会分道扬镳
Kimi-K3 拥有测试中所有模型里最广的覆盖。它至少成功解决过一次的任务占基准的 93.89%:507 个任务中的 476 个。只有 31 个任务完全难住它,是全场最低。在零售工作流上它 outright 领先,pass@1 达 82.24%,超过所有闭源模型。
Kimi-K3 同时也是最不一致的模型之一。507 个任务中只有 68 个、即 13.41%,在全部 20 次尝试中都成功。
Claude Opus 5 则相反。它至少成功解决一次的任务更少(79.09%;106 个任务完全难住它),但在每一次尝试中都完成基准的 47.53%。
更新的模型并不能解决这个问题。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.