网易首页 > 网易号 > 正文 申请入驻

高质量Omni训练数据如何炼成?OmniVideo-100K打造音视频理解新数据

0
分享至

来源:市场资讯

(来源:PaperWeekly)

采用 Gemini-2.5/3.1-Pro API,通过“结构化剧本+证据链”生成 10 万条训练数据,VITA-1.5-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B 模型在 OmniVideo-Test、Video-MME、Video-MME-v2、Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 音视频理解基准上均取得显著性能提升。


代码:https://github.com/MiG-NJU/OmniVideo-100K

数据:https://huggingface.co/datasets/MiG-NJU/OmniVideo-100K

为什么多模态大模型已经能够看懂画面、识别声音,却依然经常答错一些看似简单的问题?

例如,一个女孩在视频前半段说:“希望能抽到拿可乐瓶的那个玩偶。”几分钟后,她打开盲盒,看到玩偶手里拿着可乐瓶,兴奋地说:“I love it.”

如果问模型:“她为什么这么开心?”正确回答并不只是识别一句话或一帧画面,而是需要把前后的语音、人物和事件关联起来,建立跨时间的因果关系。

然而,当前大量音视频训练数据仍采用“视频→描述→问答”的自动生成方式。视频被切成多个片段,音频和视觉信息分别描述,再直接生成问答。

这个过程中,人物身份、声音来源以及跨时间事件之间的联系往往被打断,导致模型学到的是零散片段,而不是完整故事。

针对这一问题,南京大学与中科院自动化所提出 OmniVideo-100K。

该工作通过“结构化剧本+证据链”的方式自动构建高质量音视频训练数据:首先将视频整理为包含角色、时间戳、语音、声音和视觉描述的结构化剧本,再从剧本中挖掘跨片段、跨模态的证据链,最终生成真正依赖音视频协同推理的问答样本。

最终,团队利用 Gemini-2.5/3.1-Pro API 构建了 10 万条音视频问答训练数据 OmniVideo-100K,以及一个人工校验测试集 OmniVideo-Test。

使用该数据微调 VITA-1.5-7B、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B 后,三个模型在 OmniVideo-Test 上分别提升 20.59%、17.82% 和 13.86%。

在 Video-MME、Video-MME-v2、Daily-Omni、OmniVdideoBench、JointAVBench、FutureOmni 等外部基准上,最高也取得 12.64% 的泛化提升。


音视频理解的短板,不在“看不见”或“听不见”

现有自动化音视频 QA 数据构建,大多遵循一种直接的“视频-描述-问答”流程:先把长视频切成短片段,再分别生成视觉描述和音频描述,最后把这些文本交给大语言模型合成问答。

这个流程效率很高,也足够适合生成大量基础样本。但当任务从“画面里有什么”“谁说了什么”走向“为什么会这样”“前后发生了什么关系”时,它的问题会变得明显。

  • 音画关联容易断裂。声音被转成一段文本,画面被转成另一段文本,如果没有明确的说话人和时间对齐,模型很难知道某句话到底来自画面中的谁。

  • 同一实体可能在不同片段中被反复改名。前一段叫“白衣女子”,后一段又叫“短发女孩”,大语言模型读到的不是连贯叙事,而是一组松散片段。

  • 问题会停留在局部事件。如果直接从很长的片段描述里生成 QA,模型往往选择眼前最显眼的信息出题,而不是主动寻找跨时间、跨模态的深层联系。

换句话说,传统流程并不是缺少描述,而是缺少“追踪”。它可以告诉模型某个片段里出现了什么,却不一定能告诉模型:谁在什么时候说了什么,这句话后来如何被画面印证,又如何成为回答问题的证据。


先把视频写成剧本:给模型一条可追踪的时间线

OmniVideo-100K 的第一步,是把视频转成结构化剧本。这里的“剧本”不是文学化改写,而是一种中间表示:它把全局摘要、主要实体列表、分段时间戳、说话人标注、非语音声音和视觉描述统一放在同一套结构里。


〓图1. OmniVideo-100K 的自动化音视频 QA 生成流水线。

这个设计中最关键的是“实体锚定”。在正式生成分段描述之前,模型会先识别视频中的主要实体,例如人物、动物、关键物体,并为它们分配稳定的描述性标识。之后无论视频被切成多少段,后续描述都要沿用这份实体表。

这样做的价值很直接:如果一个角色在第 1 分钟说过一句话,又在第 4 分钟做出某个动作,系统能够持续把两处信息绑定到同一个实体上,而不是把它们误当成两个不同的人。

除了实体一致性,流水线还显式处理音画关联。语音会带有起止时间戳,并进一步绑定说话人;非语音声音和音乐也会被记录;视觉描述则围绕环境、人物与物体、动作与交互、镜头变化等维度展开。

最终得到的不是一堆 caption,而是一份可以被检索、对齐和推理的音视频叙事文本。

这一步让后续生成不再依赖模型对长文本的“泛读能力”。视频被拆开了,但人物、声音和事件没有被拆散。


不是直接出题,而是先挖证据链

有了剧本以后,OmniVideo-100K 并没有马上让模型生成问题。论文中真正影响数据质量的第二个机制,是 Clue-Guided QA Generation:先找线索,再围绕线索出题。

具体来说,系统会先让大语言模型扫描完整剧本,挖掘服务于特定任务的跨片段、多模态线索,并记录对应时间戳。例如,一个因果推理问题可能需要同时用到前半段的语音线索、后半段的动作线索,以及两者之间的时间关系。

随后,模型只围绕这些高价值线索和相关片段生成开放式问答或多项选择题。相比直接把完整剧本文本丢给模型,这种方式减少了无关信息干扰,也把“问题必须依赖证据链”这件事提前写进了生成流程。

消融实验也说明,这不是一个单纯的 prompt 包装。直接生成的 QA 更容易,Qwen2.5-Omni 在 Direct Generation 样本上的准确率为 80.28%;而线索引导生成的样本更难,准确率降至 59.15%。

经过 OmniVideo-100K 微调后,Qwen2.5-Omni 在这类更难样本上的准确率提升到 80.28%。同时,线索引导生成问题覆盖的平均时间跨度达到 144.75 秒,远高于直接生成的 76.24 秒。

这意味着 OmniVideo-100K 不是在制造更多“看图说话”式问答,而是在系统性地制造需要跨时间、跨模态连接证据的问题。


10 万条训练数据与测试集筛选

基于上述流水线,团队从 5214 个视频中生成了 10 万条音视频问答对。视频来源覆盖 vlog、news、cartoon、sports、documentary、tv、ego 等开放域类别;数据构建过程中会过滤低分辨率视频、硬字幕视频,并根据视觉动态和词密度保留更有音视频信息量的样本。

训练集包含开放式问答和多项选择题,两者比例为 7:3,并覆盖 10 类音视频任务:

  • Alignment:细粒度感知、场景变换检测。

  • Understanding:上下文理解、对比、情感分析、事件排序、摘要总结。

  • Reasoning:因果推理、未来预测、假设性推理。


〓图2. OmniVideo-100K 与现有音视频指令微调数据集的对比。

与已有数据集相比,OmniVideo-100K 的重点不只是样本数量。

论文强调了三个差异:平均视频长度达到 103 秒;任务包含复杂时间关系;问答被锚定在显式证据链上;同时,结构化剧本本身也可以作为后续视频理解、编辑或生成任务的中间表示。

为了评估模型是否真的具备跨模态协同理解能力,团队还构建了 OmniVideo-Test。

测试集包含 505 道多项选择题,来自 264 个视频,所有题目都经过人工校验。筛选标准包括事实准确、必须依赖音视频联合信息、答案唯一;可以只靠单模态回答、可以猜出、事实有误或选项含糊的题目都会被剔除。


实验结果:三个开源模型都明显上涨

团队分别对 VITA-1.5、Qwen2.5-Omni-7B 和 Qwen3-Omni-30B-A3B-Instruct 进行了全参数微调,并在 OmniVideo-Test 上评估。


〓图3. 不同模型在 OmniVideo-Test 上的表现。

结果显示,OmniVideo-100K 对不同规模、不同基座的开源模型都带来了稳定提升。

  • VITA-1.5:整体准确率从 40.99 提升到 61.58,提升 20.59%。

  • Qwen2.5-Omni-7B:整体准确率从 42.77 提升到 60.59,提升 17.82%。

  • Qwen3-Omni-30B:整体准确率从 49.70 提升到 63.56,提升 13.86%。

从任务类型看,现有开源模型在 Understanding 类任务上相对更好,但在细粒度时间对齐和深层跨模态推理上仍然吃力。比如模型可能能听懂一句话,也能识别画面中的动作,却未必能判断这句话和几分钟后的动作之间有什么关系。

论文中的定性案例也体现了这一点:基线模型常常依赖单一模态线索进行猜测,或者只抓住目标时间点附近的信息;经过 OmniVideo-100K 微调后,模型更倾向于引用跨片段、跨模态证据完成回答。

当然,这并不意味着问题已经被解决。Gemini-3.1-Pro 在 OmniVideo-Test 上达到 83.96,人类表现为 100,说明开源模型即便经过该数据微调,距离强闭源模型和人类水平仍有明显空间。


泛化表现

论文进一步在 Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 等外部音视频基准上评估微调后的模型。


〓图4. 不同模型在多个外部评测基准上的表现对比。

结果显示,三类基座模型在多个外部基准上也出现一致收益。

其中,VITA-1.5 在 JointAVBench 上提升 12.64%;Qwen2.5-Omni 在 Daily-Omni 上从 62.41 提升到 69.84,进一步拆分后,其 AV Event Alignment 任务从 51.26 提升到 68.49,提升 17.23%。

更重要的是,这种定向微调没有明显损伤通用视频理解能力。论文在 Video-MME 和 Video-MME-v2 上也进行了评估,虽然个别配置有波动,但整体没有出现显著退化。

团队还用 Qwen2.5-Omni 对比了其他音视频数据集微调效果。

AVQA 和 JavisInst-Und 在多数基准上会导致不同程度下降,而 OmniVideo-100K 在 OmniVideo-Test、Daily-Omni、OmniVideoBench、JointAVBench、FutureOmni 等评测中取得更稳定的正向收益。

这个对比进一步说明,音视频训练数据并不是越多越好,关键在于样本是否真的训练了跨模态协同能力。


总结

OmniVideo-100K 提出了一种通过结构化脚本和线索链构建音视频问答数据的新方案。

通过引入全局实体约束与多模态线索挖掘等机制,该方法有效缓解了自动化数据构建中叙事不连贯与问题局部表面化等缺陷。所构建的数据集为提升多模态大模型的音视频理解能力提供了有力的支持。所有训练和测试数据均已开源。

现在,在「知乎」也能找到我们了

进入知乎首页搜索「PaperWeekly」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
从141到93!巴多萨压哨入围美网正赛 郑钦文从135到123无缘美网正赛

从141到93!巴多萨压哨入围美网正赛 郑钦文从135到123无缘美网正赛

寒律
2026-07-21 00:03:09
金球奖还有戏?梅西领跑本届世界杯球员TOP50:姆巴佩第2 C罗落选

金球奖还有戏?梅西领跑本届世界杯球员TOP50:姆巴佩第2 C罗落选

风过乡
2026-07-21 06:08:51
女子与男子自愿发生性交易,发现避孕套脱落勒索8万,遭拒后诬告男子强奸,被澳门警方拘捕

女子与男子自愿发生性交易,发现避孕套脱落勒索8万,遭拒后诬告男子强奸,被澳门警方拘捕

南方都市报
2026-07-20 23:22:28
再爆料!中山大学院士团队涉嫌论文买卖和造假!

再爆料!中山大学院士团队涉嫌论文买卖和造假!

科研绝技
2026-07-18 22:28:45
真维斯关掉90%的门店后,线上卖了100亿

真维斯关掉90%的门店后,线上卖了100亿

经济观察报
2026-07-20 21:44:23
幸好西班牙赢了!如果阿根廷点球大战赢西班牙,世界杯决赛将蒙羞?

幸好西班牙赢了!如果阿根廷点球大战赢西班牙,世界杯决赛将蒙羞?

陈錈爱体育
2026-07-20 06:47:47
极目深度|内衣商家被诉商标侵权索赔1800万元,一审判赔90万元,商家:店铺已关闭,主要收入来源已中断

极目深度|内衣商家被诉商标侵权索赔1800万元,一审判赔90万元,商家:店铺已关闭,主要收入来源已中断

极目新闻
2026-07-20 22:17:57
男子凌晨点塔斯汀外卖 封签上竟被店员拼出“SB”!

男子凌晨点塔斯汀外卖 封签上竟被店员拼出“SB”!

闪电新闻
2026-07-20 15:11:26
西蒙尼:阿根廷欠迪马利亚一个历史地位,没有他梅西难圆世界杯梦!

西蒙尼:阿根廷欠迪马利亚一个历史地位,没有他梅西难圆世界杯梦!

体育闲话说
2026-07-21 06:05:36
阿根廷队拒绝混采,记者吐槽等了2小时等得怒火中烧;赛后冲突原因公布:阿根廷后卫莫利纳率先拉扯西班牙中场,双方爆发激烈对峙

阿根廷队拒绝混采,记者吐槽等了2小时等得怒火中烧;赛后冲突原因公布:阿根廷后卫莫利纳率先拉扯西班牙中场,双方爆发激烈对峙

扬子晚报
2026-07-20 11:12:13
青春飞扬!亚马尔绽放出朝阳的光芒

青春飞扬!亚马尔绽放出朝阳的光芒

澎湃新闻
2026-07-20 10:08:28
国足有机会吗?南美足联主席提前泄密,2030世界杯确定扩军64队

国足有机会吗?南美足联主席提前泄密,2030世界杯确定扩军64队

全景体育V
2026-07-21 06:55:53
体坛丑闻!嗜赌只是冰山一角,婚内出轨睡有妇之夫,太毁三观

体坛丑闻!嗜赌只是冰山一角,婚内出轨睡有妇之夫,太毁三观

橙星文娱
2026-04-25 11:14:17
一个很脏但有效,能让房子永远归子女的办法

一个很脏但有效,能让房子永远归子女的办法

坠入二次元的海洋
2026-07-18 03:06:40
6000万救命钱流向一家2人公司?韩红基金会这次怕是有点说不清了

6000万救命钱流向一家2人公司?韩红基金会这次怕是有点说不清了

苗苗情感说
2026-07-21 01:00:51
世界杯决赛惨败,功勋主帅突然坦白:我干到12月就走,不想再装下去了

世界杯决赛惨败,功勋主帅突然坦白:我干到12月就走,不想再装下去了

赛场名场面
2026-07-21 00:27:37
消费降级实锤了?华山游客锐减,一家三口光门票索道就花1500

消费降级实锤了?华山游客锐减,一家三口光门票索道就花1500

离离言几许
2026-07-21 04:57:18
美军连续第10晚袭击伊朗

美军连续第10晚袭击伊朗

界面新闻
2026-07-21 07:16:34
英国新首相上任即承诺100%支持泽连斯基,伦敦援乌路线不变

英国新首相上任即承诺100%支持泽连斯基,伦敦援乌路线不变

桂系007
2026-07-20 23:32:20
身家百亿穿99元优衣库?奚梦瑶世界杯晒夫妻合照,这是真·松弛感

身家百亿穿99元优衣库?奚梦瑶世界杯晒夫妻合照,这是真·松弛感

小椰的奶奶
2026-07-20 16:18:41
2026-07-21 08:52:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4139471文章数 8915关注度
往期回顾 全部

科技要闻

智谱暴跌,Kimi只是导火索

头条要闻

成龙3年间发文悼念超10位挚友 曾透露已制作"告别歌"

头条要闻

成龙3年间发文悼念超10位挚友 曾透露已制作"告别歌"

体育要闻

65岁肌肉男,世界杯最年长冠军主帅

娱乐要闻

谢霆锋发文确认父亲谢贤去世 享年89岁

财经要闻

AI开始挤泡沫

汽车要闻

首台量产车下线 奕境X9内饰官图发布/配华为乾崑解决方案

态度原创

本地
家居
手机
数码
公开课

本地新闻

2026暑期旅行新灵感:跟着影视去旅行

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

苹果iOS 27 Beta 4更新汇总:国行Siri AI暂未上线

数码要闻

Windows 11最低4GB内存要求形同虚设!微软自家8GB笔记本都跑不动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版