给AI智能体打分,标准答案该写成什么?Adobe给出的答案是:写成每次运行都重新取数的代码。
这套方法的核心逻辑并不复杂。传统做法是把参考答案用文字描述出来,再让AI评分器拿着这段描述去对照智能体的回答。Adobe换了个思路——把标准答案写成可执行的代码,每次评测运行时重新取数,再由AI评分器对照检查智能体的回答。
![]()
53个测试用例上的差距
在53个测试用例上,这种做法的AI评分与人类专家的一致率,比文字描述答案高出29%,同时少用了16%的token。
但反过来看,如果压根没有可对照的答案,AI评分器的表现还不如随机。这个结果说明,评分器的能力高度依赖那份"可对照的答案"本身的质量和形式。
论文题为《Skill-based Agentic Evaluation for Real-time Data Science Tasks》,指向的是实时数据科学任务场景下的智能体评测。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.