评测,定义技术的品味。
一项技术能走多远,往往取决于我们用什么尺子衡量它。评测从来不只是检验实验结果,更是在为前沿探索设定坐标。然而,在面向物理世界的 RSI(Recursive Self-Improvement)进程中,世界模型始终缺少一把可靠的尺子。尤其面对物理因果、几何一致性与观测真实感,现有评测方式仍难给出稳定、可信的自动判断。与之相比,人类对于生成内容中的异常往往极为敏感:物体是否凭空消失?碰撞后的运动是否合理?场景是否突然发生变化?这些判断对人而言近乎本能,却始终难以被AI自动化实现。现有的 benchmark 也很难让人看清模型到底错在哪里、又为什么错。
在 MirroS,我们首次将 LLM 生态中的重要概念,Harness,引入评测领域。
Harness 并非简单的代码封装,而是一套可靠的执行框架。它将复杂的人类工作流程,例如问题分解、工具调用与推理验证,组织成清晰、可执行的步骤,并由此支撑完整的智能体工作流。人类评测,本质上也是一套工作流。当我们评估一个生成的世界时,我们并非简单地扫一眼图像,而是在不自觉中完成一系列复杂流程:定位物体、追踪其在时间中的存在与变化,判断动作是否合理,再核验其中的因果关系、几何约束和物理规律。我们将这一过程通过Harness自动化为一个agentic benchmark:由一个 agent 统筹全局,根据具体案例动态派生多个专业 subagent,并为它们提供相应的上下文和诊断工具,从不同角度审视模型输出。这套 evaluation harness 就像一位福尔摩斯:它不会依据单一现象仓促下结论,而是不断寻找线索、交叉验证证据,并将分散的信息组织成一条完整的推理链,最终形成判断。
评测由此从一套静态问答规则演化为一个能够主动寻找证据、完成判断的智能系统。其核心不是一条固定的评测流水线,而是一组可以被按需调用、组合与递归展开的评测能力:
规划路径:根据案例确定需要的评测方式;
拆解问题:调度多个 subagent 逐层分解问题;
理解意图:识别待执行动作及其预期的变化;
搜寻证据:定位与判断相关的线索;
调用工具:按需使用测量与推理工具;
形成结论:组织完整的证据与推理链。
![]()
HarnessEval-W: 将HarnessEval应用于World Model
今天,我们将 World Model 当作 HarnessEval 试验田,并正式开源 HarnessEval-W,也希望邀请社区共同参与构建这一新的agentic benchmark 工作流。我们首先将世界模型的核心能力拆解为三个评测维度:观测质量、状态转移正确性与世界持续性,并围绕这三个维度构建我们的整体评测体系。
评测的角度
参考已有研究中的常见定义,我们将物理世界模型描述为:
根据历史观测与用户动作,预测世界未来的状态。
凡是具备这一能力的模型,无论采用何种生成架构,都可以纳入 HarnessEval-W 的评测范围,包括双向视频扩散模型(bidirectional video diffusion models)、自回归视频模型(autoregressive video models)等。这一形式化描述也给出了 HarnessEval-W 的基本评测逻辑:世界是否被正确呈现,动作是否引发了正确的状态转移,以及这个世界能否在时间中保持持续而一致。由此,自然得到以下三个核心评测维度。
1. 观测质量
衡量模型输出的视觉观测是否可信。它关注生成视频本身在感知层面的质量,包括:视觉连续性、结构合理性与真实感。
2. 状态转移正确性
关注模型是否能够在正确的时间,以正确的方式响应给定的动作,并使世界状态随之发生符合预期的变化。我们进一步考虑三种类型的状态转移:探索式转移(Exploratory Transition)主要对应观察者在世界中的移动,例如改变相机位置、视角或观察区域。意图式转移(Intentional Transition)指用户主动要求改变某个实体、关系或事件。例如移动一个物体、打开一扇门,或者要求某个角色执行特定动作。物理转移(Physical Transition)关注施加物理控制之后,世界是否按照合理的物理规律演化,例如碰撞、推动、掉落、弹跳或其他动力学过程。
3. 世界持续性
关注随着世界不断演化,模型是否维持了一个持续存在、内部一致的世界。我们重点关注三类典型场景。抗漂移能力(Drift Resistance):测试在长时间生成中,世界的整体布局、风格和对象外观是否保持稳定,而不会随着生成时间增加逐渐发生无意义漂移。重访一致性(Revisit Consistency):当观察者暂时离开某个地点或物体,随后再次返回时,其状态与属性是否仍与此前保持一致。画外演化(Offscreen Evolution):当一个动态过程暂时离开视野后,是否仍能按照时间与物理规律继续演化,而不是在不可见时被冻结、重置或任意改变。世界持续性并不意味着世界中的所有内容都必须保持不变。它要求稳定属性保持一致,同时动态状态也必须沿着连续、合理的轨迹演化。
基于Harness的评测系统
世界模型的评测天然高度依赖具体情境上下文。不同案例可能对应完全不同的环境、动作类型、时间结构与观测状态,因此,很难依靠一组固定问题或静态指标覆盖所有情况。
HarnessEval-W 的核心是一个能够动态制定评测策略的智能体。对于每一个案例,它首先理解当前世界与评测目标,随后规划评测路径;调度具有不同专业能力的子智能体,并结合它们搜集到的证据,逐步形成可验证的评分判断。整个评测过程都会根据当前具体世界调整。换言之,HarnessEval-W 并不预设一条固定的评测流程,而是让评测路径随案例本身动态生成。它不仅需要回答“这个结果是否正确”,还要进一步判断:我们收集的证据,是否真的足以回答当前的评测问题?由此,HarnessEval-W 能够为每一个案例提供一种可解释、复现且按需定制的评测过程。
Skill 选择
评测的第一步,不是立即开展问答打分,而是先确定:这个案例究竟应该问什么问题?HarnessEval-W 首先理解当前评测案例的上下文与目标,再调用有资格、有能力评估这个案例的 skill。例如,在机器人操作场景中,动作是否正确执行、是否遵循合理物理规律,往往比画面是否具有“电影感”更重要。HarnessEval-W 不会机械地对所有案例套用完全相同的评测指标,而会根据场景选择真正相关的评测能力。
![]()
Skill 拆解
选定评测 skill 后,系统会把它继续拆成更小、更明确、更易测量的子问题,再分别交给合适的子智能体或工具。例如,要判断一次碰撞是否合理,HarnessEval-W 会继续追问:目标物体在哪里?它们是否在正确的时间发生接触?碰撞前后的速度如何变化?目标追踪、时序验证和速度计算等工具将分别寻找答案。各个子智能体返回的证据最终由主智能体统一汇总、验证,并形成最终结论。如果问题仍然过于复杂,子智能体还可以继续调度新的子智能体,层层拆解,直到每项任务都足够明确,可以直接通过工具或视觉证据完成验证。
![]()
从单一分数走向可追溯的证据链
HarnessEval-W 的最终目标并不仅仅是输出一个数字得分。我们希望 benchmark 最终形成一棵层级式的证据树(evidence tree),完整记录到底测了什么、哪个具体工具提供了视觉证据、以及支撑最终分数的完整逻辑链。有了这条可执行、可追溯、可验证的证据链,研究者不仅能准确定位错误来源,也能据此改进下一阶段的模型设计与训练。
评测数据集的构建
![]()
一个真正有效的 benchmark,必须覆盖足够复杂、足够多样的环境,才能持续探索世界模型的能力边界。为此,我们同样采用一套 agentic pipeline 来构建评测案例,让 benchmark 能够规模化扩展。
整个流程从预定义的场景分类体系(scene taxonomy)开始。我们首先采样世界的初始配置,确定环境、物体、空间结构、视觉风格与观察视角等属性;随后再为案例选定评测维度,尤其是前文定义的状态转移与世界持续性指标。
根据这些条件,一个图像生成 agent生成世界的初始帧;动作规划 agent随后理解画面内容,并围绕目标评测维度设计具体动作。例如,如果我们需要测试重访一致性,规划 agent 就可以设计一条“先离开当前区域,再绕行返回原位置”的相机轨迹。最后,我们引入一个独立的验证 agent进行质量控制。它会同时检查初始图像与动作设计,确认环境、前景、背景和动作是否彼此协调。未通过验证的候选案例会被自动退回并重新生成,直至满足评测要求。
通过这一闭环流程,benchmark 得以持续扩展,同时保持必要的复杂性与可验证性。
What's Next:让 Agentic Benchmark 持续进化
世界在进化,评测也应随之进化。
评测从不该是一套静态评测标准。随着世界模型不断进入更复杂的场景、展现更强的能力,评测体系本身也必须同步拓展自己的边界。HarnessEval-W 只是我们探索通过 Harness 实现 agentic benchmark 这一新范式的起点。作为一个开源项目,我们也诚挚邀请社区中的研究者与开发者一起参与进来,让 agentic benchmark 在真实的协作与迭代中不断成长。
接下来,我们将重点关注三个方向:
测试时扩展(Test-Time Scaling)
LLM 在推理时会生成复杂的推理轨迹,并借助 MCP 等外部工具完成长时程任务,评测过程本身也必须获得相应的 scaling 能力。传统 benchmark 往往默认每个样本的评测成本固定,而 agentic benchmark 则允许我们在test time 投入更多计算资源:评测时可以执行更深的搜索、多步验证与工具调用。随着被测试模型越来越强,评测系统也需要通过更多推理和验证计算同步提升自身能力,使评测模型的能力始终足以追上前沿生成模型。
技能库的扩展(Scaling Skill Libraries)
未来的世界模型将覆盖更广泛的应用场景,并生成包含更复杂物理过程和更细粒度物理细节的环境。因此,agentic benchmark 模型同样需要拥有不断扩展的能力集合。我们将持续搭建丰富的技能库(skill library):当模型模拟更精细的物理与更多样的场景时,评测智能体可以从这个不断增长的库中动态检索并组合专门技能,准确评估生成世界中的物理理解能力。benchmark 的能力不再被写死在一套固定代码中,而能够随着技能库的增长持续扩展。
自回归改进(RSI)
更进一步,我们希望 benchmark 本身具备自我改进能力。当 HarnessEval-W 在评测前沿世界模型时遇到一个分布外(OOD)场景,它不应该只是简单地给出一个低置信度分数。相反,系统首先应该:
Evaluate the Evaluator ,先评估自身。
它需要判断:当前的不确定性究竟来自被评测模型,还是因为自身缺少相应的 skill?如果发现内部能力缺口,系统就可以通过引入外部的新 skill、学习新的工具使用方式、甚至通过自主探索构建新的评测能力,进一步扩展自己的技能库。新的能力随后重新进入评测 Harness,支持未来更加复杂的评测任务。
我们希望 HarnessEval-W 所开启的,不只是一套新的世界模型 benchmark,而是以 Harness 重新定义 benchmark 范式:能够推理、能够验证,也能够与被评测对象一同进化。
让 benchmark 成为技术的驱动者
让 harness 成为认知的引擎
完成 RSI 的智能飞轮
项目主页:https://mirros-lab.github.io/HarnessEval-W
论文:https://arxiv.org/abs/2608.16859
代码:https://github.com/mirros-lab/harnesseval-w
全文 Blog : https://mirros.ai/blog/harnesseval
![]()
Join us: talent@mirros.ai
Business Contact: business@mirros.ai
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.