AI智能体评测有多烧钱?东京大学一篇新论文指出,多数评测测试都在浪费资金——超过70%的测试任务要么所有版本都能通过,要么都无法通过,却和其他测试一样消耗成本。
新方法Task-CoEvolve的思路很直接:只保留过往版本有分歧的测试,每轮重新选取,并调整评分以支持跨轮比较。
![]()
在Terminal-Bench 2.1上,仅用89项任务中的20%进行评测,结果与全量评测相差约一项任务,成本却降低67%-80%,时间减半。
这意味着,评测效率的提升并不必然以准确性为代价。对频繁迭代AI智能体的团队来说,这套方法可能意味着更快的反馈循环和更低的资源门槛。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.