东京大学一项新研究给AI智能体评测算了一笔账:多数测试任务其实在浪费资金。论文指出,所有版本都能通过或都无法通过的任务,在测试集中占比超过70%,却和其他测试承担着相同的成本。
这些“无效任务”无法区分模型能力差异,却拉高了整体评测开销。研究团队提出的新方法Task-CoEvolve,只保留过往版本表现有分歧的测试,每轮重新选取,并调整评分机制以支持跨轮比较。
![]()
20%任务,还原全量结果
在Terminal-Bench 2.1基准上,Task-CoEvolve仅用89项任务中的20%进行评测,结果与全量评测相差约一项任务。成本随之降低67%至80%,评测时间也缩减一半。
这意味着,AI智能体评测可以用更少的资源获得接近全量的结论,为高频迭代测试提供了更经济的路径。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.