![]()
2026年,如果你想生成一段视频,已经不是什么难事。Sora2、Veo3、Kling这些名字你可能都听过,输入一句话,几秒钟到几分钟的视频就出来了。
但这里有一件挺尴尬的事:视频生成模型越来越多、越来越强,可是拿什么去评价"这个视频到底生成得好不好",反倒成了一个没解决的老大难问题。
你可能觉得这很简单,不就是看看像不像、美不美吗?人一眼就能看出来。问题是,当你需要从几百万个训练样本里筛选好数据,或者要在推理阶段从8个候选视频里挑1个最好的,或者想用强化学习让生成模型自己变得更聪明的时候,你不可能雇一屋子人天天盯着视频打分。你需要一个自动化的、跑得快、还得靠谱的"评委"。
这就是这篇论文要解决的事:如何造一个足够可信的AI评委,来给AI生成的视频打分。
现在的AI评委,到底差在哪
先说说现状。目前主流的做法,是找一个大模型(比如GPT这类多模态模型),让它看完视频之后直接给出一个整体判断和分数。
这套路听起来没毛病,但实际跑起来问题不少。
第一个问题是看漏了。
评委的注意力往往被最显眼的东西吸走,比如画面整体好不好看,却容易忽略提示词里那些具体的、藏在细节里的要求,比如"手柄必须是黑色的""摄像机要从左往右移动"这种小指令,或者视频里一闪而过的动作,时间顺序对不对,局部有没有变形穿帮。
第二个问题更隐蔽,叫做"事后编故事"。
模型先在心里有了一个分数的倾向,然后再去找理由支撑这个分数,而不是先看证据再下判断。这就好比一个老师改卷子,先扫一眼觉得这学生大概能得75分,然后专门去找扣分点凑够25分,而不是逐题核对答案。这种打分方式看起来有理有据,实际上经不起推敲。
第三个问题,论文里管它叫"归因纠缠"。
同一个画面缺陷,可能同时被解读成"语义不对""物理不合理""画质差"三个不同的问题,结果就是一个错误被扣了三次分。这就像你请了三个裁判打分,他们互相不知道对方在评什么,结果同一个失误被三个人分别扣了分,选手最后的总分惨不忍睹,但其实他只犯了一个错误。
那怎么办?研究团队给出的答案是:
先检查,再打分。
这句话听起来简单,但背后是一整套方法论的转变。
核心思路:把"凭感觉打分"换成"按清单核对"
论文提出的框架叫**FIRM-Video**,核心原则叫做"check-before-score"(先检查后打分)。
它的做法是这样的:不让AI凭印象直接给一个笼统的分数,而是先针对每个评价维度构建一份具体的检查清单,然后逐条对照视频里的画面证据去验证每一条是否成立,最后把这些经过验证的判断结果汇总成分数。
这里出现了三个评价维度,论文管它们叫**IF、WC、PQ**:
指令遵循*(Instruction Following,简称IF):视频有没有忠实执行你输入的文字提示词,包括主体、动作、场景、风格、镜头运动、时间顺序等。
世界连贯性*(World Coherence,简称WC):视频里的内容是否符合基本常识和物理规律,比如物体会不会突然变形、动作是否自然、有没有违反物理直觉的交互。
感知质量*(Perceptual Quality,简称PQ):视频本身的观感好不好,清晰度、色彩稳不稳定、有没有闪烁、压缩伪影这些技术层面的瑕疵。
之所以要分成三个维度分开检查,而不是一锅炖成一个总分,正是为了解决前面提到的"归因纠缠"问题。一个缺陷只能被记在一个账上,不会被三个维度重复扣分。
三个维度的检查清单来源各不相同,因为它们本质上要回答的问题不一样。
### 指令遵循:把一句话拆成一堆是非题
指令遵循的检查逻辑很直接。
先用一个文本规划模型(论文里用的是Qwen3-32B)把提示词拆解成一组原子级别的是非题。比如提示词是"在昏暗的工业车间里,一个熟练的工人握着一把重型锤子,锤子的手柄是纯黑色的,正对着管道进行一系列有力的敲击",这句话会被拆成"是否有工业车间场景""是否光线昏暗""是否有工人""锤子手柄是否为纯黑色""是否发生了敲击管道的动作"这样一条条可以直接用"是/否"来回答的问题。
每一条问题还会被赋予一个重要性权重,从1到5分,越关键的要求权重越高。
然后,一个多模态评估模型会拿着提示词、按时间顺序排列的视频帧、还有这份清单,逐条核对:这个要求满足了吗?给出"是"或"否",并附上简短的视觉证据。如果某条要求压根没法从视频里判断出来,就直接算作没满足。
最后把每条题目的判断结果按权重加权求和,就得到了指令遵循的分数,再映射到1到5分的评级。
这个设计的好处在哪?
试想一下,如果你只是让评委看完视频后凭印象打"这个视频跟提示词符不符合",他大概率只会记住最显眼的那几个大要素,比如场景对不对、主角是谁,而"手柄颜色对不对""镜头到底往哪边移动"这种细节要求几乎肯定会被忽略。拆成一条条具体的是非题之后,评委被迫一条一条去核对,想漏都漏不掉。这跟考试改卷子按照评分细则逐条给分,和只看卷面整体印象打一个模糊分数,是完全不同的两种严谨程度。
### 世界连贯性:先看视频,再问问题,最后才提示词
世界连贯性的检查要复杂一些,因为它面对一个特殊的难题:很多需要检查的物理合理性问题,压根不在提示词里被提到过。
比如提示词只说了"一个人在森林里散步",但视频里可能出现一只没被提及的小鸟,这只小鸟的翅膀在飞行过程中突然变形了。如果直接根据提示词去构建检查清单,这种"提示词之外"的问题就完全会被漏掉。
所以这里用了一个三阶段的流程。
第一步是视频接地(Video Grounding),用一个多模态模型(Qwen3-VL-235B)在完全不看提示词的情况下,单纯分析视频本身,输出一份结构化的场景总结,列出画面里出现的所有实体和动作,每个目标同样被赋予1到5的重要性分数。这一步的意义是让检查范围完全基于视频实际内容,而不是被提示词的框架局限住。
第二步,文本规划模型把每个被识别出来的目标转换成具体的验证问题。针对实体,问的是它的结构和外观是否前后一致;针对动作,问的是运动是否流畅、是否符合物理规律。这时候提示词才被引入,但作用仅仅是帮助区分"这是刻意设计的奇幻风格"还是"这是真实的生成错误"。比如提示词如果本来就要求"一只会飞的粉色大象",那大象飞起来就不该被扣分,但如果大象的四条腿在飞行过程中莫名其妙地缠绕在一起变形了,这就是真实的连贯性问题。
第三步是清单验证,一个多模态评估模型拿着视频和生成好的问题,不看提示词、也不知道重要性权重,单纯判断"这里是否存在违反常识或物理规律的问题"。
最终的分数计算,论文给出了一个公式:每个目标下所有问题的"违规比例"会转换成一个"干净比"(clean ratio),表示这个目标有多大比例是没问题的。再按重要性权重把所有目标的干净比加权平均,得到最终的世界连贯性分数。
这里有个细节很值得琢磨:为什么要按目标分组算干净比,而不是把所有问题混在一起算一个总违规率?
想象一下一个内容特别丰富的视频,里面有五六个角色、十几个动作,对应生成了几十条检查问题。如果混着算,只要有几个问题答"是有违规",总分就会被拉得很低,尽管这些违规可能只集中在一两个次要角色身上,主要角色和核心动作完全没问题。按目标分组之后,即便某个次要角色出了点小瑕疵,也不会让整个视频的评分暴跌,这样才公平地反映出"内容越丰富,细节出错的概率天然越高"这个客观规律,而不是惩罚那些愿意生成复杂场景的视频。
### 感知质量:一份人工精心设计的通病清单
相比前两个维度,感知质量的检查方式简单直接。
论文用了一份人工精心整理的通用视觉缺陷清单,涵盖分辨率、清晰度、模糊程度、亮度色彩稳定性、闪烁、压缩伪影等常见技术问题。一个多模态评估模型直接对照这份清单分析视频,生成基于清单的自然语言分析和1到5分的评分。提示词在这里的作用仅仅是帮助区分"这是刻意的风格化处理(比如故意的诡异打光)"还是"这就是渲染失败"。
把昂贵的多阶段流程,压缩成一次前向传播
看到这里你可能会有个疑问:这套流程听起来又要文本规划、又要视频接地、又要多轮验证,跑一遍成本得多高?每个视频都这么折腾,那还谈什么效率?
这正是论文接下来要解决的问题。这套复杂流程确实贵,所以研究团队没有让它在实际使用时每次都跑一遍,而是把它当作离线的数据生产线,先批量跑出一大批高质量的标注数据,再用这些数据去训练一个更轻量的端到端模型,让这个模型学会"一次看完视频就能直接给出分析和分数",不用再走那套多阶段流程。
具体做法是,把前面check-before-score流程产出的结构化验证结果(哪些要求满足了、哪些违规、哪些缺陷)转成自然语言的分析文字,和对应的分数打包在一起,作为训练数据喂给一个视觉语言模型。
用这套流程,团队构建出了**FIRM-Video-90K**这个数据集,一共88044条按维度划分的训练样本,来自29348个视频、3012个不同的提示词。
数据的来源是两个人类偏好数据集:Rapidata提供的Text2Video-Human Preferences,以及VideoFeedback2,过滤后分别贡献了约3000和27000条样本。视频出自超过20个不同的生成模型,包括Sora2、Veo3、HunyuanVideo、Pika2.2、Wan2.1等,分辨率从256×256到1980×982不等,帧率8到30帧不一。
拿这份数据去训练,得到的模型就是**FIRM-Video-8B**,分别用Qwen3-VL-8B和InternVL3-8B两个基座模型全量微调训练出来。推理的时候,模型只需要一次前向传播,直接输出针对某个维度的自然语言理由加分数,不再需要规划器、接地模型、验证器这一整套班子。
这个设计思路,其实很像老师傅带徒弟。老师傅(那套复杂的多阶段流程)一开始教徒弟(端到端模型)的时候,要手把手带着走完每一个步骤:先列清单,再逐条核对,最后汇总打分。徒弟练熟了之后,再遇到类似的活儿,已经不需要每次都翻开清单一条条对照了,凭着练出来的直觉就能又快又准地判断。如果没有这个"离线训练、在线蒸馏"的设计,你要么只能忍受昂贵到没法大规模用的多阶段流程,要么只能退回到那种"凭印象打分"的粗糙评委,鱼和熊掌不可兼得。
有了模型,还得有把尺子:FIRM-Video-Bench
光有训练数据和模型还不够,你怎么知道这个模型打的分到底准不准?这就需要一把公认的尺子,用来衡量AI评委和真人评委之间到底有多接近。
于是团队又构建了一个基准测试集,叫**FIRM-Video-Bench**,包含250个精心挑选的视频,来自VideoFeedback2和VideoPhy2这两个数据源,每个视频都由多名人类专家独立按照IF、WC、PQ三个维度打1到5分,分歧通过讨论解决,最终形成750条精细标注。
这里有一个细节值得一提:团队特意丢弃了这些视频原本自带的标注,重新按照FIRM-Video的统一评价标准打分。原因是原始标注是在不同的评价体系下收集的,存在标注噪音,直接拿来用会污染评测结果。这份基准测试还特意做了评分等级的均衡分布,每个评分等级在每个维度里占比都不超过30.4%,避免模型靠"蒙大多数分数"就能拿高分。
结果说话:FIRM-Video-8B到底行不行
论文用了几套指标来衡量准不准,包括**平均绝对误差**(MAE,越低越好,表示预测分数和真人打分差多少)、**准确率和放宽准确率**(Acc/Relaxed Acc,预测分完全对或者相差不超过1分都算对)、以及**斯皮尔曼等级相关系数**(SRCC,衡量排序一致性)。
先看和真人打分的吻合程度,下面是FIRM-Video-Bench上几个关键模型的对比:
| 模型 | IF MAE↓ | WC MAE↓ | PQ MAE↓ | 总体MAE↓ | 总体准确率/放宽准确率↑ |
| GPT-5 | **0.62** | 1.66 | 0.95 | 1.08 | 0.35/0.71 |
| Gemini-3.1-Pro | 0.77 | 1.27 | 1.44 | 1.16 | 0.30/0.69 |
| Qwen3-VL-8B(基座) | 0.93 | 1.79 | 1.28 | 1.33 | 0.28/0.62 |
| InternVL3-8B(基座) | 1.26 | 2.10 | 1.29 | 1.56 | 0.21/0.52 |
| FIRM-Video-8B(InternVL3) | 0.69 | 0.96 | 0.90 | 0.85 | 0.38/0.81 |
| **FIRM-Video-8B(Qwen3-VL)** | 0.65 | **0.86** | 0.82 | **0.78** | **0.42/0.84** |
这张表最直观的信息是,FIRM-Video-8B在总体MAE上从基座模型的1.33一路降到0.78,几乎降低了四成误差,而且这个成绩超过了包括GPT-5在内的所有对比模型。
20个百分点的误差差距意味着什么?换算成日常感受,大概意味着原本每打5次分,基座模型就要有1到2次和真人评分对不上号,而经过FIRM-Video数据训练之后,这种明显偏差的情况被大幅压缩了。
论文还专门做了一个消融实验,把"直接跑那套复杂的check-before-score流程但不训练轻量模型"作为一个单独的对照组,发现这个流程本身的总体MAE是0.61,比训练出来的端到端模型还要低一些。这说明数据构建流程本身确实提供了高质量的监督信号,而蒸馏到端到端模型后虽然有一定损耗,但依然远远好于原始基座模型,证明了这套框架"提取可靠监督,再压缩推理成本"的策略是成立的。
换个场景考验它:域外泛化能力
只在自己造的基准上表现好,说服力还不够。研究团队又拿FIRM-Video-8B去跑了一个完全陌生的测试集,叫**MJ-Bench-Video**,这是一个包含2170个视频、由人类标注的偏好数据集,评价维度和FIRM-Video略有不同,但可以对应到Alignment(对齐度)、Consistency & Coherence(一致性与连贯性)、Fitness(适配度)这几个相近的概念。
| 模型 | Alignment↑ | C&C↑ | Fitness↑ | Overall↑ |
| Gemini-3.1-Pro | 31.53 | 28.72 | 28.24 | **33.06** |
| Qwen3-VL-8B(基座) | 29.80 | 22.37 | 27.32 | 21.17 |
| FIRM-Video-8B(Qwen3-VL) | 31.09 | 30.41 | 32.10 | 27.81 |
| **FIRM-Video-8B(InternVL3)** | **31.93** | **35.35** | 29.41 | 31.06 |
在完全没见过的测试场景下,FIRM-Video-8B(InternVL3版本)在Alignment和C&C两项上都拿到了最高分,证明这套训练方法学到的不只是"背答案",而是一种能迁移到新场景的评价能力。
真刀真枪的用武之地:帮你从8个视频里挑1个
前面说的都是"打分准不准",但打分准最终是要拿来干活的。论文用了一个非常实际的场景来验证:**Best-of-N采样**。
Best-of-N采样*:给同一个提示词,让视频生成模型生成N个不同的候选视频,再用评价模型给这N个候选打分,挑出分数最高的那一个作为最终输出。这是目前提升生成质量的一个常用手段,前提是评价模型得靠谱,不然挑出来的"最好"可能其实是最差。
论文选了三个不同能力级别的视频生成模型:LaVie-Base、CogVideoX-2B、Wan2.1-T2V-1.3B,每个提示词生成8个候选视频,分别用FIRM-Video-8B、Qwen3-VL-8B、InternVL3-8B、VideoScore2这几种方式去挑选,再用业界公认的**VBench**这套评测体系去打分,看谁挑出来的视频综合质量更高。
VBench*:一套视频生成模型的综合评测基准,把视频质量拆解成16个细分维度,分成"视频质量"和"视频-条件一致性"两大类,再汇总成总分、质量分、语义分三个综合指标。
| T2V生成模型 | 采样方式 | 总分↑ | 质量分↑ | 语义分↑ |
| LaVie-Base | 随机采样 | 79.42 | 81.34 | 71.77 |
| LaVie-Base | VideoScore2 | 79.95 | 81.61 | 73.33 |
| LaVie-Base | **FIRM-Video-8B** | **80.72** | **82.14** | **75.06** |
| CogVideoX-2B | 随机采样 | 78.57 | 80.90 | 69.25 |
| CogVideoX-2B | **FIRM-Video-8B** | **79.68** | **81.03** | **74.28** |
| Wan2.1-T2V-1.3B | 随机采样 | 80.40 | 84.13 | 65.49 |
| Wan2.1-T2V-1.3B | **FIRM-Video-8B** | **82.36** | **84.91** | **72.19** |
三个生成模型上,FIRM-Video-8B挑出来的视频在总分、质量分、语义分三项上全部拿到最高分。跟表现第二好的方法相比,总分提升了0.27到1.01分,而语义分的提升幅度更大,达到1.24到2.11分。
这里有意思的一点是,论文没有把三个维度的分数简单加总变成一个总分再排序,而是根据VBench的16个细分维度,分别去匹配最相关的FIRM-Video评价维度来排序。比如"多物体一致性"这类语义相关的维度,用IF分数去排序;"背景一致性"这类偏画质的维度,用WC或PQ的分数去排序。这种维度对维度的精准匹配,让每个细分指标都能拿到最贴切的评价依据,而不是被一个笼统的总分模糊掉。
再进一步,团队还做了候选数量N从2一路加到16的扩展性实验,用LaVie-Base测试。结果发现,当N比较小(等于2)的时候,FIRM-Video-8B甚至略输给基座模型Qwen3-VL-8B,但从N大于等于4开始,FIRM-Video-8B就一路领先,并且随着N增大,领先优势持续扩大,到N=16时,总分比随机采样高出1.03分,比基座模型高出0.33分。
这个现象其实很好理解。候选数量越多,意味着里面藏着的"细节陷阱"也越多,比如某个视频整体看着不错,但手指多长了一根,或者某个背景物体在中间某一帧突然消失又出现。如果评委只会看整体印象,在候选数量少的时候可能歪打正着,但候选数量一多,那些藏得深的瑕疵反而更容易被随手放过。而经过check-before-score训练出来的模型,因为已经养成了"逐项核对"的习惯,越是候选多、鱼龙混杂的场合,越能显出它把细节挑出来的本事。这就好比让一个只会"看总体气质"的招聘官在10个候选人里选1个可能还行,但如果是从1000个简历里挑,靠气质筛选就容易漏掉真正有硬伤的人,这时候需要的是有具体核对清单的招聘流程,一项一项地过筛子。
论文里的具体案例,能说明什么
论文里给了一个非常典型的定性案例,值得单独说一说。
提示词描述的是一个工人握着一把"纯黑色手柄"的锤子在敲打管道。生成的视频里,这把锤子的手柄颜色实际上是浅棕色,而且随着视频推进,手柄还发生了变形,甚至出现了明显的结构畸变。
针对这条样本,真人专家给出的评分是:指令遵循3分、世界连贯性2分、感知质量5分。
对照几个模型的打分:GPT-5给出4分、5分、5分;Qwen3-VL-8B(未经训练的基座)给出5分、5分、5分;而FIRM-Video-8B给出的是3分、2分、5分,和真人评分完全一致。
这个案例揭示的问题很直接。没有经过check-before-score训练的模型,倾向于给出全面偏高的分数,尤其是在手柄颜色不对、手柄发生变形这些具体细节上视而不见,大概率是因为它们的注意力被"工人在认真干活""场景整体挺逼真"这些显眼的大印象吸引走了,而真正藏在细节里的颜色错误和结构畸变反而被忽略了。这恰恰印证了论文一开始提出的那个"看漏了"的问题:不带清单核对,评委很容易只顾着看大画面,漏掉提示词里明确写着的具体要求。
局限和留白
论文也坦诚地提到了自己的局限:目前这套框架主要验证的是"评价的可靠性"和"候选筛选的有效性",还没有真正把FIRM-Video-8B当作奖励信号,拿去驱动生成模型本身的强化学习训练,让生成模型学会自己变得更好。这是留给未来的方向。
写在后面
读完这篇论文,印象最深的其实不是那些分数提升的百分比,而是那个"看漏了、编理由、扣重复分"的三重问题诊断。这三个问题分开看都不新鲜,但把它们并列在一起讲清楚,才第一次让我意识到,为什么很多AI评价系统看起来分析得头头是道,实际用起来却总是不太准。它们不是笨,是问的问题本身就没问对。
论文里那个锤子手柄的案例特别打动我。真人一眼能看出手柄颜色不对、还变形了,可几个大模型全都打出了接近满分的成绩。这说明一件挺让人不安的事:大模型的"看图说话"能力,和它"逐项核对细节"的能力,完全是两码事,前者强不代表后者也强。
这也让我想起考试作弊检测这件事。凭整体印象判断一份卷子像不像抄的,和拿着标准答案逐题核对,是完全不同的两种严谨程度。AI评价视频,可能也需要经历同样的从"凭印象"到"按清单"的转变。
那么下一个问题是:如果连视频里一把锤子手柄的颜色和形状都能被大模型系统性地忽略,还有多少类似的细节,正躲在我们以为"看起来还不错"的判断背后?
Q&A
Q1:FIRM-Video是什么?
A:FIRM-Video是一套面向文本生成视频(T2V)的奖励模型训练框架,核心思路是"先按清单核对,再打分",通过为指令遵循、世界连贯性、感知质量三个维度分别构建检查清单并逐条验证,来生成更可靠的训练数据,最终训练出高效的端到端评价模型FIRM-Video-8B。
Q2:FIRM-Video-8B打分准不准,和真人评分差多少?
A:在FIRM-Video-Bench基准测试上,基于Qwen3-VL训练的FIRM-Video-8B总体平均绝对误差降到0.78,比未经训练的基座模型(1.33)降低了约四成,超过了GPT-5、Gemini-3.1-Pro等主流模型。
Q3:FIRM-Video-8B能用来干什么实际的事?
A:可以用于从多个AI生成的候选视频里挑选质量最高的一个(Best-of-N采样)。实验显示,用FIRM-Video-8B挑选后,在三个不同视频生成模型上VBench总分都取得最优,语义分提升1.24到2.11分。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.