![]()
![]()
图 1:RefCaptioner 的任务动机。普通视频描述只生成文本,难以表达候选参考图与局部视频语义之间的对应关系;RefCaptioner 从最多 22 张候选图中选出视频实际出现的内容,将图像标签放在对应短语之后,同时排除无关干扰项。
近年来,随着多模态大模型的发展,视频理解领域已经可以对视频的内容进行详尽的描述。 然而随着多参考图视频生成与编辑的发展,除了对视频本身的理解,通常还需要模型经常同时处理人物、服装、场景等多张参考图,建立参考图和视频的对应关系。而我们通过实验发现一个几乎所有多模态大模型都存在的问题:模型虽然可以将简单的视频主体和参考图主体对应,但当参考图增多时,视频理解模型对于视频中的主体和参考图的对应能力则会大幅下降。
这正是现有视频描述范式的盲区。普通 Caption 只要求文本忠实于视频;多参考图场景还要求模型在候选图之间做选择,把每张有效参考图落到正确的局部短语上,并理解同一个主体多张不同视角,姿态的图片可能属于同一主体。问题因此从 “生成一段好的描述”,变成 “在生成描述的同时建立可用的视频对象 - 参考图对应关系”。
这引出了一个核心问题:当输入是视频和大量参考图时,如何更好的建立视频语义和参考图之间的关系,并给出合理且正确的视频理解内容?
对于这个问题,我们将多参考图场景下的视频 caption 问题进行梳理。首先。多参考图里可能有真正出现的主体和场景,也可能混入外观相似的干扰项,现有的 VLM 要么过于自信全部引用,要么过度保守又会漏掉有效信息。其次,很多 VLM 在识别参考图片时,对于同一个人或物体可能由多张不同视角图片,模型也会识别成不同的人或者物体,然而这种情况,模型需要把这些图片归到同一实体,而不是拆成多个对象。
对于这个问题,我们提出了RefCaptioner,通过后训练强化模型对参考图的识别和感应能力,同时,我们对输出的 caption 进行结构化构建,从场景,人物,物体,动作,外貌,运镜等建立结构化 caption 格式,并通过 SFT 强化输出格式约束,提升不同参考图与不同种视频语义的对应能力。同时我们建立了双层自适应奖励函数 HCD-GRPO,在保持细粒度视频语义的同时,优化模型对干扰图的识别和同一主体不同风格参考图的识别能力。
团队核心成员包括北京大学博士生刘腾飞、史阳以及可灵团队多模态理解负责人张远行。
![]()
- 论文链接:https://arxiv.org/abs/2607.28509
- 代码链接:https://github.com/pkucs-Ltf/RefCaptioner
- 模型开源链接:https://huggingface.co/TengfeiLiuCoder/RefCaptioner
- 开源数据集链接:https://huggingface.co/datasets/TengfeiLiuCoder/MRVBench
RefCaptioner:
让视频 caption 与参考图完成端到端绑定
![]()
图 2:RefCaptioner 方法概览。左侧为保持通用描述能力的混合数据监督微调;右侧为 HCD-GRPO,通过两个奖励分支分别约束事实描述与多参考图 grounding。
RefCaptioner 以 Qwen3-VL-8B-Instruct 为基座,为了在训练参考图识别能力的同时不丢失视觉模型对视频的感知和描述能力。在 SFT 阶段,我们将多参考图数据与通用的视频 caption 训练数据按 1∶1 均衡采样。前者包含人工核验的图像标签描述,用来教授参考图选择和局部绑定;后者用于保留事实性、覆盖度与细节表达能力。这样的混合方式避免模型为了学习标签格式,退化成一个只会「贴参考图」的系统。
同时,仅靠 SFT,模型可以学会输出格式,却未必能在复杂样本中兼顾事实描述、参考图召回和错误抑制。HCD-GRPO 因此把奖励拆成两个互补分支:一边检查描述是否忠实、完整,另一边检查参考图是否选对、绑定正确,并对可观测错误进行折扣。
- 事实描述奖励:先去掉回答中的图像标签,再从主体、外观、动作、背景、镜头和风格六个维度检查关键事实是否覆盖,并借助视频问答库识别事实错误。
![]()
- 正确绑定覆盖奖励:只有被正确选择、且放在正确局部短语后的参考图,才能贡献正向覆盖信号。单纯增加标签数量不会获得额外收益。
- Distractor-Aware Evidence Suppression(DAES):训练样本会在正常参考图中随机插入无关图片,但模型不知道哪些是干扰项;一旦引用视频中没有对应内容的图片,就会受到额外惩罚。
- Cross-Reference Semantic Coherence(CRSC):对于同一实体的多张不同视角图片,评估器从回答中抽取 “事件 — 实体 — 参考图组” 关系,检查这些图片是否被聚合到同一局部描述,而不是被错误拆分。
![]()
通过上面的奖励函数设计,从而使得模型无法依靠 “多贴图像标签” 提高覆盖率,也不能靠 “少贴图像标签” 规避错误,而是使得模型在有效绑定的基础上,提高对干扰图的识别能力。
MRVBench:
把 “描述正确” 与 “图文对应” 分开评测
现有视频描述基准通常只判断文本是否覆盖视频内容,却无法回答模型有没有选对参考图、标签是否落在正确短语后,以及是否误用了干扰项。为此,研究团队构建了 MRVBench,用统一协议同时评估视频事实性与多参考图 grounding。
![]()
图 3:MRVBench 数据构建流程。从真实视频和 AIGC 视频出发,依次完成关键帧提取、六维 Caption 标注、参考图池整理与干扰项注入、局部标签绑定和人工专家核验。
MRVBench 与训练语料覆盖了从简单对应到复杂多图映射的多种情况:
- 训练语料包含 20,000 个视频和 171,354 张参考图。
- 公开的 MRVBench 测试集包含 462 个与训练语料完全隔离的视频,其中 185 个为 AIGC 视频、277 个为真实视频,共配有 3,831 张候选参考图。
- 单个样本最多包含 22 张参考图;约 60% 的样本具有多图对应同一主体或视觉单元的复杂映射,约 40% 的样本包含人为注入的干扰图。
- 冻结评测库包含 5,846 个视频关键事实和 2,172 个短答案问题,覆盖主体、外观、动作、背景、镜头和风格。
不只看 Caption 是否流畅,MRVBench 如何评测?
MRVBench 将评测拆成五个方面:视频事实覆盖与正确性、参考图选择、局部短语绑定、干扰图鲁棒性,以及同一主体多参考图的一致性。所有模型接收相同的视频、任务指令和有序参考图,评分依赖冻结的关键事实、问答库与结构化标注,尽量把 “写得像” 与 “对应得准” 区分开。
实验结果:
参考图越多,优势越明显
论文将 RefCaptioner 与多种 7B–38B 开源模型进行比较,并加入 Gemini-3.1-Pro 和 GPT-5.4 作为闭源参考。8B 参数的 RefCaptioner 在所有多参考图 grounding 指标上取得了开源模型最佳表现,综合结果接近 Gemini-3.1-Pro,并高于 GPT-5.4。
![]()
图 4:MRVBench 上不同模型的视频事实理解与多参考图 grounding 结果。
在最核心的 reference grounding 上,RefCaptioner 同时保持较高的选图精度、召回和局部绑定质量,并在干扰图排除与多视角主体归组上明显优于其他开源模型。这一点很重要:高召回并不是靠 “多贴标签” 换来的,模型确实学会了在覆盖有效参考图的同时抑制错误引用。
![]()
![]()
图 5:VDC Benchmark 与 VCapsBench 上不同 VLM 的视频描述评测结果。
值得注意的是,多参考图训练并没有牺牲普通视频描述能力。在 细粒度 Video caption 评测基准 VDC Bench 上,短描述、背景、主体和细节等多个维度,RefCaptioner 均取得最高准确率;在 评测基准 VCapsBench 上,其描述覆盖和一致性也超过 Qwen3-VL-8B 基座。换言之,模型没有退化成一个只会插入图像标签的 VLM。
![]()
图 6:HCD-GRPO 消融结果。Base 为 Qwen3-VL-8B-Instruct;完整模型同时使用事实描述奖励、DAES 和 CRSC。
消融实验显示,SFT 能显著提高主体参考图召回,却会暂时影响视频问答表现;加入完整 HCD-GRPO 后,事实描述能力得到恢复,干扰图排除和主体一致性也进一步改善。三个奖励组件分别对应事实性、错误引用抑制和跨参考图一致性,作用相互补充。
参考图越多
模型还能稳定绑定吗?
为了观察模型面对复杂参考图池时的稳定性,论文按参考图数量将样本划分为 2–4、5–8、9–12 和 13+ 四组,并将参考图召回、局部绑定准确率和干扰图排除率相乘,得到一个对任何短板都敏感的鲁棒性分数。
![]()
图 7:参考图数量增加时不同模型的 grounding 鲁棒性。
根据图 7,我们发现,通过比较不同模型的结果,RefCaptioner 在四个区间均保持领先;在最困难的 13+ 参考图时仍高于 GPT-5.4。
人工评测与视频重建:
Grounding 真的有用吗?
从 Caption 回到视频:一次端到端检验
为了检验 grounded caption 的下游价值,论文使用 “模型生成的描述 + 该描述实际引用的参考图” 重建原视频。我们基于开源视频生成模型,Wan2.1-VACE-14B ,生成视频,生成视频时,参数保持不变,唯一变化的是输入 prompt,即不同 VLM 提供的原视频 Caption 还有参考图集合。 为了评价生成视频对原视频的还原程度。我们找了三位多模态专家对生成视频和原视频的还原程度进行比较并绘制 GSB 图。
三名专家采用成对 Good/Same/Bad(GSB)协议,对 RefCaptioner 与各基线生成的重建视频进行匿名比较。Good 表示 RefCaptioner 条件下的结果更符合源视频,Bad 表示基线更好,Same 表示两者相当。
![]()
图 8:描述条件视频重建的成对 GSB 人工评测。与每个基线相比,RefCaptioner 获得的 Good 比例均高于 Bad,面对开源模型时优势尤其明显。
这项评测衡量的不是孤立的文本质量,而是 “描述生成 + 参考图选择” 的端到端效用。RefCaptioner 在所有成对比较中都获得更多 Good 而非 Bad,说明其输出的描述和参考图组合保留了更多源视频中的主体、外观、动作与场景信息。
![]()
图 9:AIGC 样本 000070 的视频重建对比。不同方法采用同一 Wan2.1-VACE 后端和相同生成设置,仅替换 captioner 产生的描述与参考图子集。
总结:
多参考图 Caption 需要的不只是文本质量
RefCaptioner 处理的不是在普通 Caption 后追加图片引用,而是让模型在生成描述的同时回答三个问题:哪些图真的与视频相关、每张图对应哪个局部视觉事实,以及相似但无关的图片是否应该被拒绝。
随着多参考图视频生成、编辑的发展,Multi-reference grounding 将成为连接参考图与视频语义的一个关键接口。RefCaptioner 提供了一个多参考图视频理解的有效算法,而 MRVBench 提供了一套评测多参考图视频 caption 准确性的基准,二者共同为更准确、更可控的多参考图视频理解奠定了基础。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.