网易首页 > 网易号 > 正文 申请入驻

HarnessEval:新的评测时代,用 Harness 开启

0
分享至

评测,定义技术的品味。

一项技术能走多远,往往取决于我们用什么尺子衡量它。评测从来不只是检验实验结果,更是在为前沿探索设定坐标。然而,在面向物理世界的 RSI(Recursive Self-Improvement)进程中,世界模型始终缺少一把可靠的尺子。尤其面对物理因果、几何一致性与观测真实感,现有评测方式仍难给出稳定、可信的自动判断。与之相比,人类对于生成内容中的异常往往极为敏感:物体是否凭空消失?碰撞后的运动是否合理?场景是否突然发生变化?这些判断对人而言近乎本能,却始终难以被AI自动化实现。现有的 benchmark 也很难让人看清模型到底错在哪里、又为什么错。

在 MirroS,我们首次将 LLM 生态中的重要概念,Harness,引入评测领域。

Harness 并非简单的代码封装,而是一套可靠的执行框架。它将复杂的人类工作流程,例如问题分解、工具调用与推理验证,组织成清晰、可执行的步骤,并由此支撑完整的智能体工作流。人类评测,本质上也是一套工作流。当我们评估一个生成的世界时,我们并非简单地扫一眼图像,而是在不自觉中完成一系列复杂流程:定位物体、追踪其在时间中的存在与变化,判断动作是否合理,再核验其中的因果关系、几何约束和物理规律。我们将这一过程通过Harness自动化为一个agentic benchmark:由一个 agent 统筹全局,根据具体案例动态派生多个专业 subagent,并为它们提供相应的上下文和诊断工具,从不同角度审视模型输出。这套 evaluation harness 就像一位福尔摩斯:它不会依据单一现象仓促下结论,而是不断寻找线索、交叉验证证据,并将分散的信息组织成一条完整的推理链,最终形成判断。

评测由此从一套静态问答规则演化为一个能够主动寻找证据、完成判断的智能系统。其核心不是一条固定的评测流水线,而是一组可以被按需调用、组合与递归展开的评测能力:

  • 规划路径:根据案例确定需要的评测方式;

  • 拆解问题:调度多个 subagent 逐层分解问题;

  • 理解意图:识别待执行动作及其预期的变化;

  • 搜寻证据:定位与判断相关的线索;

  • 调用工具:按需使用测量与推理工具;

  • 形成结论:组织完整的证据与推理链。


HarnessEval-W: 将HarnessEval应用于World Model

今天,我们将 World Model 当作 HarnessEval 试验田,并正式开源 HarnessEval-W,也希望邀请社区共同参与构建这一新的agentic benchmark 工作流。我们首先将世界模型的核心能力拆解为三个评测维度:观测质量、状态转移正确性与世界持续性,并围绕这三个维度构建我们的整体评测体系。

评测的角度

参考已有研究中的常见定义,我们将物理世界模型描述为:

根据历史观测与用户动作,预测世界未来的状态。

凡是具备这一能力的模型,无论采用何种生成架构,都可以纳入 HarnessEval-W 的评测范围,包括双向视频扩散模型(bidirectional video diffusion models)、自回归视频模型(autoregressive video models)等。这一形式化描述也给出了 HarnessEval-W 的基本评测逻辑:世界是否被正确呈现,动作是否引发了正确的状态转移,以及这个世界能否在时间中保持持续而一致。由此,自然得到以下三个核心评测维度。

1. 观测质量

衡量模型输出的视觉观测是否可信。它关注生成视频本身在感知层面的质量,包括:视觉连续性、结构合理性与真实感。

2. 状态转移正确性

关注模型是否能够在正确的时间,以正确的方式响应给定的动作,并使世界状态随之发生符合预期的变化。我们进一步考虑三种类型的状态转移:探索式转移(Exploratory Transition)主要对应观察者在世界中的移动,例如改变相机位置、视角或观察区域。意图式转移(Intentional Transition)指用户主动要求改变某个实体、关系或事件。例如移动一个物体、打开一扇门,或者要求某个角色执行特定动作。物理转移(Physical Transition)关注施加物理控制之后,世界是否按照合理的物理规律演化,例如碰撞、推动、掉落、弹跳或其他动力学过程。

3. 世界持续性

关注随着世界不断演化,模型是否维持了一个持续存在、内部一致的世界。我们重点关注三类典型场景。抗漂移能力(Drift Resistance):测试在长时间生成中,世界的整体布局、风格和对象外观是否保持稳定,而不会随着生成时间增加逐渐发生无意义漂移。重访一致性(Revisit Consistency):当观察者暂时离开某个地点或物体,随后再次返回时,其状态与属性是否仍与此前保持一致。画外演化(Offscreen Evolution):当一个动态过程暂时离开视野后,是否仍能按照时间与物理规律继续演化,而不是在不可见时被冻结、重置或任意改变。世界持续性并不意味着世界中的所有内容都必须保持不变。它要求稳定属性保持一致,同时动态状态也必须沿着连续、合理的轨迹演化。

基于Harness的评测系统

世界模型的评测天然高度依赖具体情境上下文。不同案例可能对应完全不同的环境、动作类型、时间结构与观测状态,因此,很难依靠一组固定问题或静态指标覆盖所有情况。

HarnessEval-W 的核心是一个能够动态制定评测策略的智能体。对于每一个案例,它首先理解当前世界与评测目标,随后规划评测路径;调度具有不同专业能力的子智能体,并结合它们搜集到的证据,逐步形成可验证的评分判断。整个评测过程都会根据当前具体世界调整。换言之,HarnessEval-W 并不预设一条固定的评测流程,而是让评测路径随案例本身动态生成。它不仅需要回答“这个结果是否正确”,还要进一步判断:我们收集的证据,是否真的足以回答当前的评测问题?由此,HarnessEval-W 能够为每一个案例提供一种可解释、复现且按需定制的评测过程。

Skill 选择

评测的第一步,不是立即开展问答打分,而是先确定:这个案例究竟应该问什么问题?HarnessEval-W 首先理解当前评测案例的上下文与目标,再调用有资格、有能力评估这个案例的 skill。例如,在机器人操作场景中,动作是否正确执行、是否遵循合理物理规律,往往比画面是否具有“电影感”更重要。HarnessEval-W 不会机械地对所有案例套用完全相同的评测指标,而会根据场景选择真正相关的评测能力。


Skill 拆解

选定评测 skill 后,系统会把它继续拆成更小、更明确、更易测量的子问题,再分别交给合适的子智能体或工具。例如,要判断一次碰撞是否合理,HarnessEval-W 会继续追问:目标物体在哪里?它们是否在正确的时间发生接触?碰撞前后的速度如何变化?目标追踪、时序验证和速度计算等工具将分别寻找答案。各个子智能体返回的证据最终由主智能体统一汇总、验证,并形成最终结论。如果问题仍然过于复杂,子智能体还可以继续调度新的子智能体,层层拆解,直到每项任务都足够明确,可以直接通过工具或视觉证据完成验证。


从单一分数走向可追溯的证据链

HarnessEval-W 的最终目标并不仅仅是输出一个数字得分。我们希望 benchmark 最终形成一棵层级式的证据树(evidence tree),完整记录到底测了什么、哪个具体工具提供了视觉证据、以及支撑最终分数的完整逻辑链。有了这条可执行、可追溯、可验证的证据链,研究者不仅能准确定位错误来源,也能据此改进下一阶段的模型设计与训练。

评测数据集的构建


一个真正有效的 benchmark,必须覆盖足够复杂、足够多样的环境,才能持续探索世界模型的能力边界。为此,我们同样采用一套 agentic pipeline 来构建评测案例,让 benchmark 能够规模化扩展。

整个流程从预定义的场景分类体系(scene taxonomy)开始。我们首先采样世界的初始配置,确定环境、物体、空间结构、视觉风格与观察视角等属性;随后再为案例选定评测维度,尤其是前文定义的状态转移与世界持续性指标。

根据这些条件,一个图像生成 agent生成世界的初始帧;动作规划 agent随后理解画面内容,并围绕目标评测维度设计具体动作。例如,如果我们需要测试重访一致性,规划 agent 就可以设计一条“先离开当前区域,再绕行返回原位置”的相机轨迹。最后,我们引入一个独立的验证 agent进行质量控制。它会同时检查初始图像与动作设计,确认环境、前景、背景和动作是否彼此协调。未通过验证的候选案例会被自动退回并重新生成,直至满足评测要求。

通过这一闭环流程,benchmark 得以持续扩展,同时保持必要的复杂性与可验证性。

What's Next:让 Agentic Benchmark 持续进化

世界在进化,评测也应随之进化。

评测从不该是一套静态评测标准。随着世界模型不断进入更复杂的场景、展现更强的能力,评测体系本身也必须同步拓展自己的边界。HarnessEval-W 只是我们探索通过 Harness 实现 agentic benchmark 这一新范式的起点。作为一个开源项目,我们也诚挚邀请社区中的研究者与开发者一起参与进来,让 agentic benchmark 在真实的协作与迭代中不断成长。

接下来,我们将重点关注三个方向:

  1. 测试时扩展(Test-Time Scaling)

LLM 在推理时会生成复杂的推理轨迹,并借助 MCP 等外部工具完成长时程任务,评测过程本身也必须获得相应的 scaling 能力。传统 benchmark 往往默认每个样本的评测成本固定,而 agentic benchmark 则允许我们在test time 投入更多计算资源:评测时可以执行更深的搜索、多步验证与工具调用。随着被测试模型越来越强,评测系统也需要通过更多推理和验证计算同步提升自身能力,使评测模型的能力始终足以追上前沿生成模型。

  1. 技能库的扩展(Scaling Skill Libraries)

未来的世界模型将覆盖更广泛的应用场景,并生成包含更复杂物理过程和更细粒度物理细节的环境。因此,agentic benchmark 模型同样需要拥有不断扩展的能力集合。我们将持续搭建丰富的技能库(skill library):当模型模拟更精细的物理与更多样的场景时,评测智能体可以从这个不断增长的库中动态检索并组合专门技能,准确评估生成世界中的物理理解能力。benchmark 的能力不再被写死在一套固定代码中,而能够随着技能库的增长持续扩展。

  1. 自回归改进(RSI)

更进一步,我们希望 benchmark 本身具备自我改进能力。当 HarnessEval-W 在评测前沿世界模型时遇到一个分布外(OOD)场景,它不应该只是简单地给出一个低置信度分数。相反,系统首先应该:

Evaluate the Evaluator ,先评估自身。

它需要判断:当前的不确定性究竟来自被评测模型,还是因为自身缺少相应的 skill?如果发现内部能力缺口,系统就可以通过引入外部的新 skill、学习新的工具使用方式、甚至通过自主探索构建新的评测能力,进一步扩展自己的技能库。新的能力随后重新进入评测 Harness,支持未来更加复杂的评测任务。

我们希望 HarnessEval-W 所开启的,不只是一套新的世界模型 benchmark,而是以 Harness 重新定义 benchmark 范式:能够推理、能够验证,也能够与被评测对象一同进化

让 benchmark 成为技术的驱动者

让 harness 成为认知的引擎

完成 RSI 的智能飞轮

项目主页:https://mirros-lab.github.io/HarnessEval-W

论文:https://arxiv.org/abs/2608.16859

代码:https://github.com/mirros-lab/harnesseval-w

全文 Blog : https://mirros.ai/blog/harnesseval


Join us: talent@mirros.ai

Business Contact: business@mirros.ai

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
赫鲁晓夫说:斯大林为了取悦毛主席,出卖了高岗

赫鲁晓夫说:斯大林为了取悦毛主席,出卖了高岗

【历史客栈】
2026-08-24 10:02:20
我军打到谅山,苏联到底会不会动手?72岁的粟裕一句话给中央吃下一颗定心丸

我军打到谅山,苏联到底会不会动手?72岁的粟裕一句话给中央吃下一颗定心丸

磊子讲史
2026-08-05 11:07:27
我跟男友去领证,他中途去厕所,手机突然亮了,上面弹出一句:哥,你可千万别忘了告诉她,你还有个4岁的女儿

我跟男友去领证,他中途去厕所,手机突然亮了,上面弹出一句:哥,你可千万别忘了告诉她,你还有个4岁的女儿

晓艾故事汇
2026-08-25 09:03:53
赛后嘴唇发白、脸上毫无血色!韩悦:无论如何训练,也无法战胜安洗莹

赛后嘴唇发白、脸上毫无血色!韩悦:无论如何训练,也无法战胜安洗莹

兰亭墨未干
2026-08-25 12:58:38
白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

白月光的杀伤力有多大?网友:白月光就是没得到的人,得到了也就那样

带你感受人间冷暖
2026-08-20 00:18:45
《花开锦绣》大结局:俞阁老让儿子俞敬修顶罪,俞夫人替子报仇

《花开锦绣》大结局:俞阁老让儿子俞敬修顶罪,俞夫人替子报仇

手工制作阿歼
2026-08-25 08:45:40
巴沙尔为什么被赶下台?原来,叙利亚一直不承认,库尔德人的权利

巴沙尔为什么被赶下台?原来,叙利亚一直不承认,库尔德人的权利

掠影后有感
2026-08-24 10:39:57
全球资金大迁徙

全球资金大迁徙

格隆汇
2026-08-25 14:05:09
克宫:亚美尼亚可自行决定去留

克宫:亚美尼亚可自行决定去留

参考消息
2026-08-25 13:43:31
重磅!曼城欲签27岁利物浦王牌+正积极谈判 转会费或近亿 截胡热刺

重磅!曼城欲签27岁利物浦王牌+正积极谈判 转会费或近亿 截胡热刺

我爱英超
2026-08-25 01:28:54
三千公里海疆直接“腰斩”?琉球独立或将成为日本的不可承受之重

三千公里海疆直接“腰斩”?琉球独立或将成为日本的不可承受之重

壹知眠羊
2026-08-21 07:09:48
现如今,失业三宝也要消失了。

现如今,失业三宝也要消失了。

放牛娃的遐想
2026-08-24 08:42:57
ESPN预测新赛季排名:马刺62胜联盟第一 76人火箭第4勇士附加赛

ESPN预测新赛季排名:马刺62胜联盟第一 76人火箭第4勇士附加赛

追球者
2026-08-24 21:51:27
80后集体“盼退休”:不是懒了,是心里那根弦快断了

80后集体“盼退休”:不是懒了,是心里那根弦快断了

你在偷看谁
2026-08-19 20:58:41
乌克兰的兵快打光了,俄军清理战壕,扒开尸体堆时,发现倒在血泊里的不仅有拉丁美洲面孔,甚至还有人兜里揣着西班牙语和法语的家书

乌克兰的兵快打光了,俄军清理战壕,扒开尸体堆时,发现倒在血泊里的不仅有拉丁美洲面孔,甚至还有人兜里揣着西班牙语和法语的家书

扶苏聊历史
2026-08-21 16:46:04
国际原油期货持续下跌

国际原油期货持续下跌

每日经济新闻
2026-08-25 17:05:19
8月25日,2026年养老金调整通知公布了吗?哪怕涨1%总比不涨要强

8月25日,2026年养老金调整通知公布了吗?哪怕涨1%总比不涨要强

社保小达人
2026-08-25 11:05:11
皇马门神名宿开炮维尼修斯续约:没有球队想要他这样的球员

皇马门神名宿开炮维尼修斯续约:没有球队想要他这样的球员

慢享生活集
2026-08-24 15:51:23
CCTV5直播,中国女篮PK泰国女篮,韩旭、李月汝落选,宫鲁鸣大考

CCTV5直播,中国女篮PK泰国女篮,韩旭、李月汝落选,宫鲁鸣大考

体坛小快灵
2026-08-25 09:55:47
油价大跌“超1.12元/升”,近4个月大降的汽柴油,8月28日或大涨410元/吨

油价大跌“超1.12元/升”,近4个月大降的汽柴油,8月28日或大涨410元/吨

油价早知道
2026-08-25 09:10:44
2026-08-25 17:52:49
AI异类 incentive-icons
AI异类
从硅谷到中关村,AI信息与测评
240文章数 11关注度
往期回顾 全部

科技要闻

机器人跑赢博尔特,身体太快,脑子还在追

头条要闻

以黑帮头目当街被近距离"爆头":有钱到"让警察头疼"

头条要闻

以黑帮头目当街被近距离"爆头":有钱到"让警察头疼"

体育要闻

穆里尼奥如何摆贝林修斯姆巴佩?

娱乐要闻

张韶涵成都演唱会中暑,中途吸氧

财经要闻

瓜子二手车乱象调查

汽车要闻

2026成都车展 | 吉利中国星王博:以i-HEV混动技术,重新定义新一代油电混动

态度原创

教育
时尚
旅游
数码
家居

教育要闻

课本没变,学习方式变了:人民教育音像数字出版社联合小猿学习机推“中小学课本学习智能体”

43岁,未婚未育,我收养了38岁闺蜜当女儿

旅游要闻

看城超,游贵阳!这些人逛景区享免票福利!

数码要闻

酷睿i5 14600KF配B760M小雕D4 GEN5版,DDR4大内存装机更轻松!

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版