网易首页 > 网易号 > 正文 申请入驻

北大和华为团队携手开源大规模OmniVTG数据集

0
分享至



本文的第一作者为北京大学王选计算机研究所博士生郑明航,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、CVPR、ICCV、ICML 等顶会上有多项代表性成果发表,多次荣获多模态感知和生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。

本文主要介绍该团队和华为中央媒体技术院在多模态视频理解与时序定位领域的最新研究成果。该工作针对开放世界视频时序定位中数据集语义局限和模型缺乏自我修正能力的问题,提出了一个大规模、语义丰富的数据集OmniVTG,以及一种自我纠错思维链(Self-Correction CoT)训练范式。该方法不仅有效缩小了罕见与常见概念的性能差距,还在多个公开基准上取得了最先进的零样本性能。 目前相关代码已开源。



  • 论文标题:
  • OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding
  • 论文链接:
  • https://arxiv.org/abs/2604.25276
  • 开源代码:
  • https://github.com/oceanflowlab/OmniVTG
  • 数据集链接:
  • https://huggingface.co/datasets/zhengmh/OmniVTG-Dataset
  • 视频介绍:
  • https://www.youtube.com/watch?v=lrCdZU1fxQ8

背景与动机

视频时序定位(Video Temporal Grounding, VTG)旨在根据自然语言查询在未剪辑视频中精准定位事件的起止时间。如图1(a)所示,尽管多模态大模型为视频理解带来了突破,但在开放世界视频时序定位任务中,现有方法仍面临在稀有概念上性能不佳的问题。本文在以下两个方面对这些难题进行了分析:

数据层面存在语义盲区。主流数据集往往局限于特定领域(如室内活动或烹饪),词汇覆盖范围狭窄。 对于现实中存在的“罕见概念”,现有数据集中缺乏相应的训练样本,导致模型在面对这些概念时无法准确识别。 依赖人工标注的数据集成本高昂难以扩展,而简单的监督微调无法赋予模型处理陌生概念的有效推理机制。

模型层面缺乏自我修正能力。现有的定位模型大多采用直接回归或分类的方式预测时间边界,面对陌生或复杂的查询时往往会给出错误预测且无法自知。 然而本文发现,如图1(b)所示,多模态大模型在视频理解(如判断视频片段是否匹配查询、判断事件状态)上的能力显著优于其直接定位能力,且其理解能力在常见概念和稀有概念上的性能差距更小。如何利用这种较强的理解能力来修正较弱的定位结果,是提升性能的关键。



图1:背景与动机

针对上述问题,本文提出了OmniVTG,一个专为开放世界设计的大规模、语义丰富的数据集,以及一种自我纠错思维链(Self-Correction CoT)训练范式。如图2所示,OmniVTG通过语义覆盖迭代扩展策略构建,包含2124小时视频和超35万条查询对,显著扩展了语义覆盖范围。在训练方面,本文利用多模态大模型(MLLMs)强大的视频理解能力来反哺其定位能力,通过“预测-反思-修正”的思维链机制,显著提升了模型在开放世界中的鲁棒性。实验表明,该方法不仅在OmniVTG测试集上有效缩小了罕见与常见概念的性能差距,还在ActivityNet Captions、QVHighlights等四个公开基准上取得了最先进的零样本性能。



图2:OmniVTG数据集


技术方案

为解决上述挑战,本文提出了OmniVTG,包含数据构建与训练范式两个核心部分,如图3所示。

第一部分:语义覆盖迭代扩展的数据构建。为了突破现有数据集的语义局限,如图3(a)所示,本文设计了一套主动数据收集流程:(1)目标词识别:分析现有数据集的词汇分布,识别出未被覆盖的罕见词;(2)定向视频收集:利用大语言模型(LLM)将罕见词转化为具体的视频搜索关键词,从互联网检索极有可能包含这些概念的视频;(3)自动化标注:基于MLLM在密集描述任务上比直接定位更准确的观察,设计了以描述为中心的标注引擎,提示模型生成包含目标罕见词的带时间戳描述,从而获得高质量的<视频, 查询, 时间戳>三元组。最终构建了包含2124小时视频、语义丰富的OmniVTG数据集。数据集的可视化和数据统计如图2所示,本文所提出的数据集在视频领域覆盖、视频时长、词汇量大小等方面都显著强于现有公开数据集,为开放世界视频时序定位提供了坚实的数据基础。此外,数据集的测试集标注全部经过了人工验证,提供了可靠的开放世界视频时序定位评测基准。

第二部分:自我纠错思维链(Self-Correction CoT)训练范式。如图3(b)所示,基于模型理视频解强于定位的特性,本文提出了三阶段训练策略:(1)多任务监督微调(SFT)。除了基础的时序定位任务外,引入事件描述、查询-片段匹配、事件状态分类(未开始/进行中/已结束)等辅助任务,强化模型的基础理解和定位能力,为后续的自我反思打下基础。(2)自我纠错CoT微调。构建特定的思维链数据,教导模型遵循先进行初步预测,再利用理解能力检查预测片段是否匹配,最后根据事件状态调整时间边界的推理路径。(3)强化学习(RL)。利用GRPO算法进一步优化模型的推理策略,使模型从模仿CoT中固定格式的推理过程转向自我探索更鲁棒且更符合逻辑的自我修正轨迹,从而输出更精准的定位结果。



图3:开放世界视频时序定位数据集收集流程与模型训练框架


实验结果

零样本视频时序定位性能分析:如表1所示, OmniVTG模型在未接触过目标数据集训练集的情况下,凭借其在OmniVTG大规模数据上学到的开放世界知识和推理能力,在ActivityNet Captions、Charades-STA、QVHighlights和TVGBench四个权威基准上取得了全面超越现有SOTA模型的性能。

表1:零样本视频时序定位性能比较



开放世界罕见概念性能分析:表2进一步分析了模型在处理罕见概念时的表现发现,现有模型在遇到罕见词时性能下降。 而OmniVTG模型表现出更强的鲁棒性,罕见概念与常见概念的性能差距被显著缩小,证明了该方法有效提升了模型的泛化能力。

表2:开放世界罕见概念性能分析



消融实验:表3验证OmniVTG各核心设计的有效性。首先,相较于表现较弱的基线模型,引入多任务监督微调(SFT)带来了最显著的性能提升;在此基础上加入自我纠错思维链和强化学习,模型在处理罕见概念与未见过的数据集(ActivityNet)时的泛化能力得到了进一步提升。其次,随着SFT训练数据量从10%逐步增加到100%,模型的性能稳定的增长,印证了大规模数据集的价值。最后,在推理策略的对比中,自我反思策略表现出了最佳效果,显著优于无推理机制。

表3:消融实验



可视化结果:定性案例展示了自我纠错机制的有效性。 对于“无肩带婚纱”这一细粒度查询,基线模型错误地定位到了有肩带婚纱的片段;而OmniVTG模型在初步预测后,通过思维链推理发现当前片段不符合无肩带特征,并利用视觉理解能力将时间窗口调整至正确的片段,成功完成了精准定位。



图4:开放世界视频时序定位案例展示

总结

针对开放世界视频时序定位中数据匮乏与推理能力不足的问题,本文推出了OmniVTG,一个大规模、语义丰富的数据集,并提出了一种自我纠错思维链训练范式。通过主动扩展数据集语义覆盖和利用视频理解能力反哺定位,该方法不仅在数据规模和语义覆盖范围上进行了突破,也赋予了模型在面对未知和罕见概念时的推理与修正能力。实验结果证明,OmniVTG在多个基准测试中取得了最先进的零样本性能,为多模态大模型在开放世界视频理解任务中的应用提供了新的范式。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
沉默6个月后,中方通告全球,重罚新加坡499万,美国治外法权无效

沉默6个月后,中方通告全球,重罚新加坡499万,美国治外法权无效

刘森森
2026-08-17 13:32:32
震惊!广州一家律所被警方查封,带走百余人甚至多名执业律师,引发热议

震惊!广州一家律所被警方查封,带走百余人甚至多名执业律师,引发热议

火山詩话
2026-08-17 07:46:39
作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

作家李娟:靠《我的阿勒泰》还清房贷,隐居新疆,和母亲10年未见

娱说瑜悦
2026-08-18 13:12:43
山西一名民警因踩踏讨薪农妇致死被判五年,出狱后却频频喊冤,到底是怎么回事?

山西一名民警因踩踏讨薪农妇致死被判五年,出狱后却频频喊冤,到底是怎么回事?

人生录
2026-08-06 00:05:08
全国严查体制内 “关系户”:“世袭岗” 凉了,普通人的机会来了

全国严查体制内 “关系户”:“世袭岗” 凉了,普通人的机会来了

职场资深秘书
2026-08-16 08:54:57
俄乌战争,若俄罗斯最终赢了,你我有生之年很可能会亲历战争

俄乌战争,若俄罗斯最终赢了,你我有生之年很可能会亲历战争

吕醿极限手工
2026-07-18 12:20:06
程梦圆去世后,村里人说出22年的秘密:没有血缘,却是全家的团宠

程梦圆去世后,村里人说出22年的秘密:没有血缘,却是全家的团宠

社会日日鲜
2026-08-18 06:59:07
穆帅回归35天!皇马基本敲定首发 4231出击 6人铁打主力

穆帅回归35天!皇马基本敲定首发 4231出击 6人铁打主力

叶青足球世界
2026-08-18 16:53:08
皇马重大消息:季前赛4胜1平,穆帅确定主力4231阵型,32岁老将成为中场核心

皇马重大消息:季前赛4胜1平,穆帅确定主力4231阵型,32岁老将成为中场核心

小七说篮球
2026-08-18 18:27:49
乌克兰前防长透露:乌产弹道导弹将在三到六个月内投入使用 将直接打击俄境内

乌克兰前防长透露:乌产弹道导弹将在三到六个月内投入使用 将直接打击俄境内

财联社
2026-08-18 17:29:22
多名院士调查发现:喝一口放置过夜的剩茶水,等于进一次毒?

多名院士调查发现:喝一口放置过夜的剩茶水,等于进一次毒?

看世界的人
2026-08-17 19:14:40
企退人员心声:历史是人创造的,养老金公平问题不该无限等待

企退人员心声:历史是人创造的,养老金公平问题不该无限等待

白米饭怎么吃
2026-08-16 21:02:09
《复联4》牺牲后钢铁侠又要打灭霸?小罗伯特·唐尼2028年回归,地点在迪士尼

《复联4》牺牲后钢铁侠又要打灭霸?小罗伯特·唐尼2028年回归,地点在迪士尼

奶凶的小霸王
2026-08-17 17:06:01
中国工程院院士赵晓哲官网无法查询,原因未知,大连理工少了一位优秀校友

中国工程院院士赵晓哲官网无法查询,原因未知,大连理工少了一位优秀校友

东东趣谈
2026-08-18 10:20:47
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-08-18 13:11:49
$499终身AI工具跌到$39.99,竟能同时调用50+模型,ChatGPT与Gemini不用二选一

$499终身AI工具跌到$39.99,竟能同时调用50+模型,ChatGPT与Gemini不用二选一

Ping值焦虑
2026-08-17 17:31:32
江西三地市政府主要领导调整

江西三地市政府主要领导调整

上观新闻
2026-08-18 15:07:25
1977年“两个凡是”被提出后,他带头做出反对,后来官至副国级

1977年“两个凡是”被提出后,他带头做出反对,后来官至副国级

云霄纪史观
2026-08-18 18:23:59
太阳报:威尔希尔中场怒斥全队,带领卢顿4比3逆转雷丁

太阳报:威尔希尔中场怒斥全队,带领卢顿4比3逆转雷丁

懂球帝
2026-08-18 11:12:07
大学生购买“畅飞卡”兑换机票,出票不到十分钟申请退票,被收取75%的手续费,距离起飞还有10天

大学生购买“畅飞卡”兑换机票,出票不到十分钟申请退票,被收取75%的手续费,距离起飞还有10天

大风新闻
2026-08-18 18:48:07
2026-08-18 19:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13788文章数 142720关注度
往期回顾 全部

科技要闻

英伟达的资本局:从AI卖铲人到AI央行

头条要闻

女子花9.6万在工行App买金条 到货发现有瑕疵退货遭拒

头条要闻

女子花9.6万在工行App买金条 到货发现有瑕疵退货遭拒

体育要闻

中国男篮,一直被质疑,永远被期待

娱乐要闻

蓝盈莹官宣新恋情

财经要闻

一场酒局献祭,掀开了杭州地产潜规则

汽车要闻

一条视频读懂华为乾崑WEWA 2.0架构核心:WA世界行为模型

态度原创

时尚
手机
本地
数码
公开课

夏天裤子不要总穿黑色,试试粉色阔腿长裤,舒适显瘦又有个性

手机要闻

vivo OriginOS 7「光影美学」材质揭秘,支持光学折射、感知环境

本地新闻

邂逅活珊瑚的西沙,感受独属于国人的浪漫

数码要闻

优派发布新款27寸显示器:2K 340Hz屏、双HDMI 2.1

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版