Adobe 的研究团队给智能体评测换了个思路:把标准答案写成代码,每次运行都重新取数,再让 AI 评分器对照检查智能体的回答。
在 53 个测试用例上,这种做法的 AI 评分与人类专家的一致率,比用文字描述答案高出 29%,同时少用了 16% 的 token。
![]()
为什么代码答案更管用
文字描述的标准答案容易含糊,评分器只能凭语义猜。代码答案每次运行都重新取数,评分器拿到的是可对照的确定结果,判断依据更硬。
研究还发现一个反直觉的结果:如果没有可对照的答案,AI 评分器的表现还不如随机。评分器本身并不具备判断力,它的可靠性来自那份能跑起来的答案。
论文题为《Skill-based Agentic Evaluation for Real-time Data Science Tasks》。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.