大模型评测正在换玩法。ByteDance Seed 等机构发布了一项名为 HarnessDev 的新基准,核心变化是把评估单位从“任务输出”转向“可运行的 harness”。
两阶段评估机制
![]()
这套基准分为 Creation 与 Evolution 两个阶段。前者考察模型从零构建 harness 的能力,后者则检验其能否在已有基础上迭代演化。打分维度覆盖能力表现与执行 token 成本,兼顾效果与效率。
为什么值得关注
传统评测只看最终答案对不对,HarnessDev 则要求模型交付一套能跑通的完整工具链。这意味着评估重心从“答对题”前移到“搭好台子”,对模型的工程化能力提出了更高要求。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.