网易首页 > 网易号 > 正文 申请入驻

音频-视觉全模态的未来预测,FutureOmni给出了首份答卷

0
分享至

复旦大学、上海创智学院与新加坡国立大学联合推出首个全模态未来预测评测基准 FutureOmni,要求模型从音频 - 视觉线索中预测未来事件,实现跨模态因果和时间推理。包含919个视频和1,034个多选题问答对,在13 个全模态模型和7 个纯视频模型上的评估显示,当前系统在预测未来事件方面存在显著困难,最佳准确率仅为 64.8%。

在日常生活中,人类不仅能理解「发生了什么」,更重要的是能够预测「将会发生什么」。看到乌云密布、听到雷声渐近,我们会主动关窗收衣;看到老师眉头紧皱,反复强调某个知识点(听),我们知道接下来可能会有提问;看到球员起跳的动作和听到观众的惊呼,我们能够预判这是一个精彩的扣篮。

然而,现有的多模态大语言模型(MLLMs)虽然在全方位感知方面展现出强大的能力,但它们从音频 - 视觉线索中预测未来事件的能力仍然很大程度上未被探索。现有的音视频模态基准主要关注回顾性理解 ⸺ 「视频中发生了什么」,而非前瞻性预测 ⸺ 「接下来会发生什么」。

现在,这一空白终于被填补了!复旦大学、上海创智学院与新加坡国立大学联合发布FutureOmni,不仅重新定义了多模态模型的「未来预测」评测范式,更通过精心设计的全模态因果推理任务,首次系统评估模型通过「融合视觉观察与听觉线索」来「预测未来」的能力。

  • 论文标题:FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
  • 论文地址: https://arxiv.org/pdf/2601.13836
  • 代码地址: https://github.com/OpenMOSS/FutureOmni
  • 数据集地址: https://huggingface.co/datasets/OpenMOSS-Team/FutureOmni
  • 项目主页: https://openmoss.github.io/FutureOmni

评测范式革命:从回顾理解到未来预测

图 1:FutureOmni 数据示例。模型需要基于给定的前提事件(premise event),从多个选项中选择最可能的未来事件(future event)。

当前主流的 MLLMs 评测基准存在两大局限:(1)现有基准大多关注「发生了什么」,要求模型描述、理解或分析已经发生的事件,无法评估模型预测未来事件的能力。(2)现有方法严重依赖于视觉信息,即便使用音频,也往往作为辅助信息,未能充分挖掘音频 - 视觉之间的因果关系对预测未来事件的关键作用。

这意味着,过去的多模态模型是一个擅长「事后分析」的观察者,而非一个能未卜先知的智能伙伴。

FutureOmni 提出的全模态未来预测(omni-modal future forecasting)新范式,旨在彻底改变这一现状。它要求模型能像人类一样,主动融合音频对话、环境声音和视觉观察,从多模态上下文中推断出未来最可能发生的事件。

从回顾到预测: 不再是回答「视频中发生了什么」,而是预测「接下来最可能发生什么」。

从单模态到全模态: 同时理解音频中的语义信息(如语音内容、说话人身份、情感倾向)、环境声音(如门铃、警报、音乐)以及视觉观察(画面中的物体状态和人物关系)的因果关系。

这不再是简单的视频理解,而是让模型具备了真正的未来预测能力。它就像一个贴心的智能助手,能够从一段对话、一个动作和周围的环境中读懂「潜台词」,预测未来最可能的发展。

FutureOmni 数据集:为「未来预测认知」量身打造的大规模评测基准

图 2:FutureOmni 评测结果。评估了 13 个全模态模型和 7 个视频模型。

研究团队构建了FutureOmni⸺ 首个大规模全模态未来预测评测基准,包含基于音频 - 视觉因果关系、日常序列、主题蒙太奇的未来事件预测任务。

海量规模与丰富多样性

图 3:FutureOmni 数据统计分布。

  • 919个视频,1,034个多选题问答对
  • 8个主要领域:教育、紧急情况、监控、日常生活、纪录片、电影、游戏、卡通
  • 100% 原创视频率,确保零污染,所有视频均为首次收集
  • 3 种音频类型:语音(Speech)、声音(Sound)、音乐(Music)

八大视频领域:精心设计的「预测考题」

图 4:FutureOmni 数据构建流程。

为确保数据的真实性与高质量,研究团队采用三阶段流程:

  • 阶段一:视频收集与筛选。从多个来源收集原始视频,确保 100% 原创,避免数据污染。
  • 阶段二:因果对构建。使用 LLM 辅助识别具有明确因果关系的视频片段,生成高质量的前提 - 结论对。
  • 阶段三:问题生成与审核。人工和大模型审核质量,确保每个问题都测试模型的未来预测能力。

实验结果:当前模型在「预测未来」上仍面临巨大挑战

研究团队在13 个全模态模型和7 个视频模型上进行了广泛评估,揭示了当前系统在未来预测任务上的显著不足。

整体性能:SOTA 模型依然不合格

图 5:FutureOmni 评测结果。

结论:即便是最强的 Gemini 3 Flash,准确率也仅为64.8%。开源最强模型 Qwen3-Omni 表现不及格,仅为53.05%。视觉大模型 GPT-4o 也只达到49.70%。这表明,现有的多模态大模型在面对复杂的全模态未来预测任务时,距离人类水平仍有不小差距。

细粒度分析:语音场景最具挑战性

图 6:不同音频类型(语音、声音、音乐)对模型性能的影响。

结果显示: -语音场景最具挑战性,模型表现普遍较低(最佳模型 Gemini 3 Flash 仅 60.52%) -音乐场景相对容易,模型表现较好(Gemini 3 Flash 达到 68.31%) -声音场景处于中等难度(Gemini 3 Flash 达到 67.13%)

图 7:不同视频时长对模型性能的影响。

模态消融研究:音频信息至关重要

图 8:模态消融实验结果。评估不同模态组合对性能的影响。

关键发现:

  • 音频 + 视频的组合显著优于单独使用视频。
  • 音频信息对于未来预测至关重要,缺失音频会导致性能大幅下降。
  • 跨模态融合能力是成功预测未来的关键。

这证明了 FutureOmni 设计的合理性:未来预测需要同时理解音频和视觉信息之间的因果关系。

OFF 训练策略:让模型真正「学会预测未来」

为了缓解当前模型的局限性,研究团队提出了全模态未来预测(OFF)策略,并精心策划了一个7K 样本的指令微调数据集。

核心思想

OFF 策略的核心在于:通过专门的未来预测训练,让模型不仅提升未来预测能力,还增强通用感知能力。这与传统的视频理解训练不同,它要求模型学习音频 - 视觉之间的因果关系,并利用这些关系预测未来事件。

训练效果:显著提升未来预测和通用能力

图 9:使用 OFF 策略训练后,模型在不同音频类型上的性能提升。

图 10:使用 OFF 策略训练后,模型在不同视频类别上的性能提升。

图 11: OFF 策略在通用能力基准上的泛化效果。证明未来预测训练不仅提升了预测能力,还增强了模型的通用感知能力。

关键发现:在FutureOmni和流行的音频 - 视觉(如 WorldSense、DailyOmni)以及纯视频(如 Video-MME)基准上的评估表明,OFF策略显著提升了未来预测和通用感知能力。

关键帧差异分析

图 12: 关键帧选择对未来预测的影响分析。

研究团队利用注意力可视化技术进一步分析OFF泛化的原因,发现该策略显著增强了模型在深层网络中对关键关键帧的聚焦能力。 如图所示,与基线相比,OFF 模型(蓝线)在网络的深层表现出大幅提升的注意力分数差值。这意味着模型学会锁定包含未来事件线索的关键时刻,即使在最终输出层之前仍能保持对关键信息的高度关注。

未来展望:让 AI 真正「未卜先知」

FutureOmni 为多模态大语言模型的未来预测能力提供了首个系统性评估基准。我们期待:

  1. 更多模型参与,希望更多研究团队在 FutureOmni 上评估他们的模型,共同推动多模态场景下未来预测能力的发展。
  2. 方法改进,基于研究团队的发现,开发更强大的未来预测方法,特别是针对语音场景和跨模态因果推理的改进。
  3. 应用拓展,将未来预测能力应用到实际场景中,如智能助手、自动驾驶、机器人等,让 AI 真正具备「未卜先知」的能力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李金羽:哪怕在马路上碰到我的球员喝酒,我也不会去管

李金羽:哪怕在马路上碰到我的球员喝酒,我也不会去管

懂球帝
2026-09-30 12:39:59
重磅:乌克兰摧毁北克里米亚大桥!俄占卢甘斯克起火

重磅:乌克兰摧毁北克里米亚大桥!俄占卢甘斯克起火

项鹏飞
2026-09-30 19:27:32
霍尔木兹海峡突然静了:伊朗只提一个条件,美国为啥死活不接

霍尔木兹海峡突然静了:伊朗只提一个条件,美国为啥死活不接

纪史行者
2026-09-30 09:07:04
工行、农行、中行、建行、交行、邮储银行同日发布公告

工行、农行、中行、建行、交行、邮储银行同日发布公告

极目新闻
2026-09-30 14:45:08
动真格了,广州救市最狠一刀

动真格了,广州救市最狠一刀

大川东山再起
2026-09-30 16:51:47
为什么建议你多做深蹲?坚持深蹲的人,这些好处会找上你

为什么建议你多做深蹲?坚持深蹲的人,这些好处会找上你

增肌减脂
2026-09-30 16:28:19
日本右翼狂欢:高市早苗外交“大胜”中国,日本国内泼了一盆冷水

日本右翼狂欢:高市早苗外交“大胜”中国,日本国内泼了一盆冷水

闻识
2026-09-29 03:43:59
米饭被点名!医生直言:米饭冷冻12小时,抗性淀粉翻倍控糖护肠

米饭被点名!医生直言:米饭冷冻12小时,抗性淀粉翻倍控糖护肠

健康科普365
2026-09-30 09:04:21
何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

何猷君够不着蛋糕顶层,奚梦瑶一个动作出圈,豪门媳妇不是一般人

感恩每一刻
2026-09-30 06:07:27
东方甄选公开道歉:所有在直播间购买了“溜溜凳”的用户,全面退款不退货,退款金额为货价的二倍;此前“交个朋友”也已道歉

东方甄选公开道歉:所有在直播间购买了“溜溜凳”的用户,全面退款不退货,退款金额为货价的二倍;此前“交个朋友”也已道歉

都市快报橙柿互动
2026-09-30 15:27:15
陈治珍主任:煮一碗苹果水,一清内热,二养脾胃,三补津液,鼻炎、咳嗽、不长个的孩子,越早喝越好!

陈治珍主任:煮一碗苹果水,一清内热,二养脾胃,三补津液,鼻炎、咳嗽、不长个的孩子,越早喝越好!

蜡笔小小子
2026-07-23 13:48:08
教师要资格证,校长要资格证,为什么近六成基层教育局长未上过讲台?

教师要资格证,校长要资格证,为什么近六成基层教育局长未上过讲台?

行者殷涛
2026-09-28 20:49:40
月薪8万?!被全网销号一年后,争议网红「户晨风」开始找工作了

月薪8万?!被全网销号一年后,争议网红「户晨风」开始找工作了

雷科技
2026-09-30 12:10:36
30天30队·火箭:乌度卡的控制欲

30天30队·火箭:乌度卡的控制欲

张佳玮写字的地方
2026-09-30 13:22:09
中央批准,王云鹏履新职

中央批准,王云鹏履新职

新京报
2026-09-30 11:00:07
胡歌低调现身游本昌遗体告别仪式,含泪送别爷叔最后一程。

胡歌低调现身游本昌遗体告别仪式,含泪送别爷叔最后一程。

徐醇老表哥
2026-09-30 15:24:42
裁判为什么不看VAR?张玉宁:我们可以在亚洲与强队抗衡

裁判为什么不看VAR?张玉宁:我们可以在亚洲与强队抗衡

澎湃新闻
2026-09-30 17:54:05
余承东改口,徐直军上位!

余承东改口,徐直军上位!

量子派
2026-09-30 17:53:57
邓亚萍回应评价全红婵被网暴,检讨自己称“我为什么说无知者无畏呢,不可以换个词么?”

邓亚萍回应评价全红婵被网暴,检讨自己称“我为什么说无知者无畏呢,不可以换个词么?”

韩小娱
2026-09-30 13:58:49
开国中将李作鹏去世后由六人抬棺,为何他的葬礼却被突然取消?

开国中将李作鹏去世后由六人抬棺,为何他的葬礼却被突然取消?

舆图看世界
2026-09-30 15:10:07
2026-09-30 21:16:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14113文章数 142740关注度
往期回顾 全部

科技要闻

OpenAI凌晨大上新!新助手dots迎战Muse

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

头条要闻

7旬兄弟抢母亲20万遗产 哥哥把弟弟打进ICU终身瘫痪

体育要闻

30天30队·火箭:乌度卡的控制欲

娱乐要闻

胡歌现身游本昌遗体告别仪式

财经要闻

“杭州六小龙”迎来价值重估

汽车要闻

燃油车的最佳平替 长城大狗HEV简单好开更经济

态度原创

本地
游戏
艺术
数码
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

PS三款经典老游戏突遭下架 无提前说明 或迎重制版

艺术要闻

一位被忽略的晚明禅僧书家,意趣直追兰亭,启功称五百年来无此君!

数码要闻

Marshall发布Bromley 150派对音箱:售价3999元

军事要闻

美军最后2500人撤离伊拉克

无障碍浏览 进入关怀版