![]()
你有没有想过,AI 生成的交互式视频,谁来给它打分?
不是画质好不好看这么简单。想象你在玩一个 AI 生成的游戏世界,你按下"前进"键,屏幕上的画面应该逐渐放大、逼近,就像你真的在往前走。但如果 AI 生成的视频压根没理会你的指令,镜头还是原地不动,这个视频哪怕画质再精美,也是废品。
这就是
**世界模型**
:一种能根据你的操作指令(比如键盘方向键、鼠标移动)实时生成后续视频画面的 AI 系统,你可以把它理解成"会听话的视频生成器"。
问题是,怎么判断它听没听话,听话之后画面又好不好看?这篇来自腾讯混元和复旦大学等机构的论文,就是在解决这个看似简单、实则棘手的评判难题。
一个评委不够用的世界
先说说这件事到底难在哪儿。
在这篇论文之前,业界评估这类视频主要靠两套彼此独立的系统。一套是
**几何式奖励**
:用 3D 重建模型(比如 DepthAnything3)从生成的视频里反推出摄像机实际走了什么路径,再跟你下达的指令做比对,路径对不上就扣分。
这套方法能告诉你"镜头有没有按指令移动",但它对画面本身闭着眼睛。哪怕视频里全是抖动、模糊、色彩突变,只要摄像机路径数字算出来是对的,它照样给高分。
另一套是
**图像式奖励**
,比如 HPSv3 这类模型:抽几帧画面出来,单独打分,看清不清晰、好不好看。
这套方法反过来,只盯着画面质量,完全不管镜头到底有没有执行你的指令。一个视频哪怕原地不动,只要每一帧长得漂亮,它也能拿高分。
这就好比你请了两个裁判评价一场体操表演,一个只会看运动员有没有做出规定动作,完全不看动作做得优不优美;另一个只会看运动员身材姿态好不好看,完全不管有没有做规定动作。两个裁判各打各的分,永远凑不出一个综合评价。如果这时候你想训练运动员同时兼顾动作规范和优美度,用这两个割裂的裁判系统去指导训练,运动员很可能学会了一套讨好裁判A的怪异姿势,却完全没学会讨好裁判B真正想要的东西。
论文作者们意识到,一个更聪明的思路是找一个"通才裁判",让它同时看懂动作对不对、姿态美不美,并且这两个判断来自同一次观察,而不是两个互不通气的系统各说各话。
这个通才裁判,他们选择用
**视觉语言模型**
(VLM,Vision-Language Model)来担任:一种既能"看"图像视频,又能"说"自然语言进行推理的 AI 模型,类似 GPT-4V 这种能看图聊天的模型。
但事情没这么简单。如果你直接把一整段长视频和一整串复杂的动作指令甩给 VLM,让它一次性判断好坏,会出现新的麻烦:视频太长、动作太多,VLM 很容易在海量信息里"看漏"关键的那几帧。比如"向左转"这个动作可能只体现在视频中间三四帧的细微变化上,淹没在几百帧素材里,VLM 扫一眼很可能就错过了。这就像让你在一部两小时电影里找出某个演员某句台词说错的那零点五秒,你大概率会看走眼。
把长视频切成小块来看:WorldReward 的核心设计
论文提出的解决方案叫
**WorldReward**
,一个基于 VLM 的成对偏好奖励模型:它不是给单个视频打绝对分数,而是同时看两个候选视频,判断哪个更好,这种"两两比较"的方式叫成对偏好评估。
它的核心思路可以用一句话概括:别让 VLM 一口吃掉整段视频,而是把长视频切成一个个"动作片段",一块一块地精细检查。
具体来说,系统会把完整的动作轨迹(比如一串连续的前进、转弯指令)切分成若干个"
**动作块**
"(chunk),每个块包含连续 4 个动作。这就像老师批改作文不会读完全文才打分,而是逐段批注,看这一段的论点立没立住、语言通不通顺,再把每段的评价汇总成整体分数。如果老师非要憋着不做任何标记,一路读到结尾才凭印象打一个总分,很可能一开始那段精彩的破题句早就被忘光了,最后的分数其实只反映了结尾给他留下的模糊印象。分段批注保留的是全过程的证据,而不是最后一刻的记忆。
每个动作块里,WorldReward 会构造一个包含
六张图
的结构化输入:一张源图像(用来对照场景有没有跑偏)、一张"帧网格总览图"(展示这个块里每个动作的起始、中间、结束画面)、以及四张"动作细节对比图"(把每个动作的首尾帧单独拎出来对比)。这样一来,VLM 每次只需要专注分析一个短片段,既不会被无关信息干扰,也不会漏掉转瞬即逝的关键变化。
论文里有个很生动的例子(见原文图1):一辆越野车停在沙漠岩石地貌前,指令要求镜头先做几次向左偏航(yaw left),再向前推进(forward)。WorldReward 逐个动作检查,发现视频 A 在偏航时的三维运动感和景深表现更自然,视频 B 则在最后一个块里出现了严重的"场景漂移",原本的白天光线莫名其妙变成了日落色调,背景地貌也跟着走样。这种局部的、瞬时的问题,如果放在整段视频里综合评价,很容易被"整体感觉还不错"这种印象稀释掉,但拆成块之后,问题无所遁形。
每个块判断完动作对不对之后,系统还会从三个维度评估画面质量:
**时间一致性**
(纹理、光照、物体是否稳定不闪烁)、
**动态生成质量**
(运动是否符合真实的三维物理规律,而不是像纸片一样平移缩放)、
**伪影与结构完整性**
(有没有明显的画面破损、场景漂移)。
所有块级判断出来之后,系统用"投票"的方式汇总成整段视频的最终结论:哪个候选视频赢的块多,哪个就是整体优胜者,平票就判平局。这个设计背后的逻辑是,不能让某一个特别精彩或特别糟糕的片段左右整个视频的评价,就像评价一部电影不能因为某一个高潮镜头拍得惊艳,就无视其他部分剧情松散的问题。
训练数据从哪里来:AI 生成 + AI 审核 + 人工复核
有了评判框架,接下来的问题是怎么训练这个模型。VLM 需要海量的"标准答案"才能学会怎么打分,而这些标准答案不可能全靠人工一条条写。
论文团队设计了一条三级流水线。
第一步,用 Gemini 3.1 Pro(谷歌的一款前沿 VLM)给每个动作块生成初步的推理式判断,包括分析文字和最终的胜负结论。这一步产出了海量但不完全可靠的"草稿"标注。
第二步是论文里比较巧妙的一环,叫
**智能体质检**
(Agent-based QC):用另一个模型 GPT-5.5 扮演审核员角色,但它不是简单地读一遍标注文本就下结论,而是像一个真正较真的编辑一样,主动调用"读图工具",先看源图和总览图,再根据观察结果决定要不要进一步细看某个具体的动作对比图,必要时还能回头重新核对之前看过的证据。
如果这个环节直接让 GPT-5.5 一次性看完所有图然后打分,效果反而会打折扣。论文里提到,直接把所有细节图一股脑塞进模型的初始上下文,反而会让模型的注意力被无关信息稀释,审核质量下降。所以让它像人类审稿人一样,一步一步地按需调取证据,反而审得更准。这有点像医生看病历,不是把病人所有的检查报告一次性甩到他面前让他自己找重点,而是让他先看主诉,再根据主诉决定要不要调阅具体的某张CT片子,这样他才不会在海量信息里迷失方向。
审核完成后,数据显示 42.1% 的标注被智能体标记为需要修正,其中 67.4% 只是修改了推理文字的表述,23.8% 修改了具体的维度评判结果。这说明第一轮 AI 生成的标注确实存在不少偏差,需要这道审核工序来纠正。
第三步是人工复核,专门针对被智能体标记为"需要修改"的样本进行人工确认。结果显示,87% 的智能体修改建议得到了人类审核员的认可,说明这套自动化审核机制相当靠谱,不是瞎改一通。
最终,这套流水线产出了约 10 万条带推理过程的训练样本,覆盖了 8 种不同的世界模型生成的视频对,涵盖平移、旋转、复合运动等多种轨迹类型,以及照片级写实、动漫游戏、艺术风格等不同的视觉风格。
怎么知道 WorldReward 真的靠谱:WorldReward-Bench 基准测试
光训练出模型还不够,得有一把公认的尺子来量它准不准。论文团队因此专门构建了
**WorldReward-Bench**
:一个包含 760 组配对视频的人工标注基准测试集,每组视频共享同样的起始图像、文字描述和动作轨迹,专门用来检验各类奖励模型和 VLM 裁判跟真人判断的一致程度。
每一组视频都由三名标注员独立评分,从动作一致性、外观质量、运动质量三个维度分别打分,选项是"视频A更好""视频B更好"或"打平",模型身份和左右顺序全程对标注员保密,避免先入为主的偏见。
结果这张成绩单很能说明问题。在总体一致性上,WorldReward 拿到了三个维度的最高分:动作一致性 77.63%,外观质量 81.32%,运动质量 73.03%。相比之下,GPT-5.5 直接作为裁判打分只能拿到 74.21%、79.87%、69.47%,也就是说 WorldReward 在动作、外观、运动三项上分别领先 GPT-5.5 约 3.42、1.45、3.56 个百分点。
更有意思的一个细节是,WorldReward 的训练数据其实就来自 Gemini 3.1 Pro 和 GPT-5.5 这两个"老师"的标注,但经过那套智能体审核加人工复核的打磨之后,学生反而超过了两位老师。这有点像一个学生跟两个老师分别学了一部分知识,但他把两边的内容交叉验证、去伪存真之后,考试成绩反而比任何一位老师单独出题还要准。这说明真正拉开差距的不是"用了哪个 AI 生成标注",而是那道审核和纠错的工序。
论文的消融实验(Table 5)也印证了这一点:如果只用 Gemini 的直接蒸馏标注训练,平均一致性只有 68.69%,跟 Gemini 直接当裁判的 68.90% 几乎持平;但加上智能体质检环节,一致性直接跳到 75.94%,再加上人工复核,最终达到 77.33%。这就是说,光靠"找个更聪明的 AI 老师来教"提升有限,真正的增量来自那套质检加复核的组合拳。
在跟几何式和图像式基线模型比较时,WorldReward 同样全面领先。比如几何模型 DepthAnything3 在动作一致性上只有 70.53%,图像质量模型 HPSv3 在外观质量上是 73.68%,都明显低于 WorldReward 的对应分数。这也再次验证了开头那个判断:用两套割裂系统各打各的分,终究比不上一个统一模型同时看懂动作和画质。
结构化证据真的有用吗:拆解每个组件的贡献
论文还做了一组细致的消融实验,逐一拿掉六张图输入里的某个组件,看看少了它会怎样。
去掉源图像,外观质量的一致性掉了 2.37 个百分点,因为模型失去了判断"场景有没有跑偏"的参照物。去掉帧网格总览图,影响最大,平均掉了 2.48 个百分点,动作和运动两项分别掉了 2.71 和 3.29 个百分点,因为这张图承载的是整个动作块的演变过程。去掉动作细节对比图,动作一致性掉了 2.82 个百分点,因为这张图直接把每个动作的首尾变化摆在眼前,少了它模型就没法精准定位到底是哪个瞬间出了问题。
这三张图各管一摊事,缺一不可,就像医生诊断需要同时看病人的病史(源图像)、连续的体检报告(总览图)和某次具体检查的详细结果(细节图),少看任何一项都可能误诊。
除了输入证据的设计,论文还对比了推理监督的深浅程度。如果只给模型看最终的胜负标签,不给任何推理过程的文字说明,平均一致性只有 72.47%;加上"整体对比总结"这层监督,提升到 74.94%;再加上"逐段详细分析",也就是完整模型的做法,最终达到 77.33%。这说明让模型学会"说理由",不光是让输出更好解释,实实在在地提升了判断的准确度。这跟人类学习的道理是相通的:一个只背答案不理解过程的学生,遇到稍微变化的题目就容易翻车,而一个理解每一步推理逻辑的学生,才能真正把这套判断能力迁移到新场景里。
拿这个裁判去训练选手:强化学习实战效果
评判模型再准,最终目的还是要用它去指导世界模型变得更好。论文把 WorldReward 接入了
**DiffusionNFT**
(一种在线扩散模型强化学习框架)的训练流程,对 HY-WorldPlay 1.5 这款世界模型做强化学习后训练,并跟同门框架 WorldCompass(用几何奖励加图像奖励这套割裂系统)做直接对比。
结果在短期(约125帧)、中期(约253帧)、长期(约381帧)三个时间尺度上都很一致。以长期生成为例,WorldCompass 的组合动作准确率是 54.82%,WorldReward 训练出来的模型达到 56.40%;画质分数(HPSv3)上,WorldCompass 是 0.73,WorldReward 是 1.02。也就是说不仅动作执行更准,画面质量同时也在提升,没有出现常见的"顾此失彼"现象。
论文还给出了非常直观的定性对比图。用几何加图像双奖励训练出来的模型,虽然镜头控制准了,但视频后段经常出现明显的色偏和纹理漂移,比如天空的颜色莫名其妙地变了调。而用 WorldReward 训练的模型,因为奖励信号本身就是从"带着时间维度的动作对齐视频证据"里推理出来的,画面在整个轨迹过程中保持得更稳定。这背后的原因也不难理解:图像式奖励只抽查单帧,天然感知不到"这一帧跟上一帧比色彩是不是突变了",而 WorldReward 天生就是看着一段连续画面在做判断的。
论文最后还找了 GPT-5.5 和真人做了一轮独立的盲测复核,200 组视频对,三名标注员分别打分。结果三方(WorldReward、GPT-5.5、人类)给出的排序高度一致:在视觉质量上,人类偏好新模型(WorldReward-RL)胜过 WorldCompass 的比例是 48.9% 比 25.2%,差距接近两倍。这说明这套奖励模型指导出来的训练效果,不是自说自话,换一个完全独立的裁判来看,结论依然站得住。
写在后面
读完这篇论文,最触动我的其实不是 WorldReward 本身的技术设计,而是那套"智能体质检"的思路。
很多人对 AI 标注数据的想象还停留在"找个大模型跑一遍就完事了",但这篇论文用实打实的数字告诉你,直接蒸馏和经过质检审核之间,隔着接近 7 个百分点的差距。这个差距不是靠换一个更强的模型能补上的,Gemini 3.1 Pro 已经是相当顶尖的模型了,但它单次生成的标注质量依然有限。真正起作用的,是让另一个模型带着"审稿人"的姿态,用多轮工具调用去反复核实、交叉验证。这提示了一个可能被低估的方向:与其一味追求用更强的单一模型去生成数据,不如设计一套让模型互相审核、互相纠错的流程,机器和机器之间也需要"三审三校"。
另外一个让我意外的细节是,论文里提到把动作块拆成"四个动作一组"这个具体的粒度选择,背后其实是在权衡上下文长度和局部证据完整性之间的取舍。太长了会稀释局部证据,太短了又可能割裂一个连贯动作的前后文,这种看似不起眼的超参数选择,其实藏着不少工程直觉在里面。
这篇论文没有解决的问题也很明显:它依赖的评判标准,归根结底还是人类标注者的主观判断,而不同标注者对"运动是否流畅"这种问题本身就存在分歧。当奖励模型学会的是一群人的平均偏好,它会不会在某些边界情形下变得保守,倾向于生成"四平八稳但缺乏个性"的视频?这是一个值得继续追问的问题。
Q&A
Q1:WorldReward是用来做什么的?
A:WorldReward是一个基于视觉语言模型的奖励评判系统,专门用来评价摄像机可控的AI视频生成模型(世界模型)生成的视频,同时判断视频是否准确执行了摄像机指令,以及画面质量是否过关,并能用这个评判结果反过来训练和优化视频生成模型。
Q2:WorldReward和以前的评价方法有什么不同?
A:以前的方法要么只看镜头轨迹对不对(几何式奖励,但不管画质),要么只看画面好不好看(图像式奖励,但不管动作执行)。WorldReward把长视频切成小的动作片段,用一个模型同时评判动作是否正确和画质是否过关,两者来自同一次分析,而不是两套割裂的系统。
Q3:WorldReward训练用的数据是怎么来的?
A:先用Gemini 3.1 Pro给视频片段生成初步的判断和推理文字,再用GPT-5.5扮演审核员,通过多轮工具调用反复核实这些标注是否有误,最后由人工审核员确认修改建议是否合理。这套流程最终产出了约10万条高质量的训练样本。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.