网易首页 > 网易号 > 正文 申请入驻

开源即爆火!英伟达重磅推出OmniVinci全模态大模型

0
分享至

全模态智能,英伟达的下一步

你是否想过,未来的 AI 将会是什么样子?

是只会打字的 Chat Bot,只会看图的 VLM,还是只能分辨声音的 ALM?

都不是! 真正的智能,应该像我们人类一样,能够同时看、听、说、写,既能看懂世界的五彩斑斓,也能听懂万物的声音。

在不久前结束的英伟达华盛顿 GTC 大会上,老黄再三强调 “研究人员需要开源。开发者依赖开源。全球的公司,包括我们都离不开开源模型。开源非常,非常,重要。” 在老黄的号召下,全模态理解模型迎来重量级新玩家 —— 英伟达(NVIDIA)开源了 OmniVinci, 一款能理解多模态世界的全模态大语言模型(Omni-Modal LLM)。该模型实现了视觉、音频、语言在同一潜空间(latent space)中的统一理解, 让 AI 不仅能识别图像、听懂语音,还能推理、对话、生成内容。这个 9B 的视觉 - 语音理解全模态模型刚上线就爆火,一周时间 Huggingface 模型权重目前已经有超过10000次下载量!

  • 论文标题:OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
  • 项目地址:https://github.com/NVlabs/OmniVinci
  • 论文地址:https://arxiv.org/abs/2510.15870
  • 开源模型:https://huggingface.co/nvidia/omnivinci

秀翻全场!多模态理解性能全面超越

和相近尺寸的全模态模型竞品相比,OmniVinci 在多项常用多模态基准测试榜单中取得了显著优势,包括视频 - 音频跨模态理解任务(DailyOmni +19.05),音频理解 (MMAR + 1.7),和视频理解 (Video-MME +3.9),展现出卓越的全模态理解能力。更重要的是,OmniVinci 少用了近 6 倍的数据量实现了超越,展现了其架构和数据引擎的卓越效率。

三大架构创新:让视觉与听觉在同一空间共鸣



OmniVinci 不仅具备炸裂的榜单性能,其论文中通过大量科学实验探索最优全模态模型架构的方法,而不是粗暴堆叠训练数据,这种做法显然更值得借鉴。想象一下,AI 看视频时,画面(视觉)和声音(音频)是两条独立的信息流。如果模型架构对此处理不好,AI 就会 “精神分裂”。而 OmniVinci 的目标就是让它们完美同步,通过三项核心创新设计来实现:

OmniAlignNet:跨模态语义对齐网络

这就像一个 “超级翻译器”,让模型在同一空间中 “看得见声音,听得懂画面”。它创建了一个共享空间,通过对比学习 ,让视觉信号和音频信号能在这里用同一种 “语言” 无障碍交流,实现跨模态深度对齐。

Temporal Embedding Grouping (TEG):时间嵌入分组机制

将视觉帧与音频信号按时间戳重组,使模型能跨模态感知事件的相对先后关系。AI 终于能搞清楚,是 “先开枪再有枪声”,还是 “先有闪电再有雷声”。它通过按时间戳分组,让 AI 理解事件的先后顺序 。

Constrained Rotary Time Embedding (CRTE):受约束旋转时间嵌入

通过时间旋转编码,模型获得绝对时间感知能力。AI 不仅知道 “先” 和 “后”,还知道这件事发生在视频的第 5 秒,还是第 50 秒。

有了这三板斧,OmniVinci 才真正拥有了准确感知视觉,音频和时间流逝的能力。

数据引擎:24M 多模态对话的背后



模型强度离不开数据支撑。OmniVinci 团队构建了一个庞大的全模态数据引擎(Omni-Modal Data Engine),共涵盖2400 万条多模态对话样本,覆盖图像、视频、音频、语音四大领域。数据分布中,图像占 36%、音频与语音共占 38%、视频 11%、全模态数据 15%。其中包括两种创新的全模态学习方式:

  • 隐式全模态学习(Implicit Learning)

直接利用现有视频自带音频的问答数据,让模型在 “看视频” 的同时 “听声音”。

  • 显式全模态学习(Explicit Learning)

通过 AI 单独生成视觉和音频模态专属的描述,再由 LLM 进行交叉修正与融合,解决了单模态模型常见的 “幻觉”(如只看画面误判语义)。

实验:打造全模态模型的关键洞察


[关键洞察 1] 单一模态打标 = 不靠谱!告别 “模态幻觉”

团队发现,很多 AI 模型都有 “模态幻觉”: 只看图(视觉):AI 看到一个深海机器人,可能会 “脑补” 说这是人类高科技的胜利 。只听声(音频):AI 听到旁白说 “地球最深处”,可能会 “瞎猜” 说这是关于地心的纪录片 。因此一个集成了两种模态的联合字幕方法对于全面理解至关重要。

[关键洞察 2] 1 + 1 > 2!当听觉 “点亮” 视觉

加上音频,模型真的变强了吗?答案是肯定的! 团队发现,声音为视觉提供了全新的信息维度,音视频联合学习能显著提高视频的理解能力 。只用视觉 (Visual Alone) 视觉 + 音频 (隐式学习 IL) 视觉 + 音频 + 全模态数据引擎 (显式学习 EL) 结果显示 (见下表),每增加一步,性能都在飙升!特别是加入了数据引擎的 “显式学习” 后,模型性能在多个基准上都实现了巨大飞跃。

[关键洞察 3] 王牌对王牌:当 OmniVinci 遇上 “强化学习”

基础模型已经这么强了,还能再进化吗? 能!通过强化学习 (RL)!

音频,让强化学习 “如虎添翼”! 团队在使用 GRPO 强化学习框架时发现了一个 “隐藏 Buff”: 只给 AI 看视频(视觉)去训练,远不如 “边看边听”(视听结合)的效果好! 如图所示,加入音频后,模型的收敛速度更快。

强强对决,OmniVinci 更胜一筹! 在这个多模态 RL 框架下,OmniVinci 和 Qwen2.5-Omni 都能获益 。但是,OmniVinci 凭借更强的基础性能和指令跟随能力,在 15 步内就超越了 Qwen2.5-Omni 的准确率,并且格式奖励收敛速度快了 2.7 倍 ! 最终,经过 RL 训练的 OmniVinci+RL,在所有全模态基准上再次实现全面提升!

不止是 SOTA,是全能 Agent

跑分只是基础,真正的全模态 AI,必须能在真实世界 “大显身手”。

OmniVinci 做到了。研究团队用它测试了 N 个真实场景,效果非常好 :

场景一:联合视听感知

你给它一段播客视频,它不仅能看懂主持人和嘉宾的外形,更能 “听懂” 他们讨论的复杂话题。

场景二:语音转录 + 翻译

你对它说话,它能瞬间转录成文字。

场景三:全语音交互

你用语音问:“这个演讲者的公司使命是啥?”

它立刻用语音答:“他的公司使命是在火星上建立一个自我维持的文明。”

场景四:指挥机器人,直接 “张嘴说”!

OmniVinci 能直接听懂你的语音指令(比如 “进入卧室,在床脚站住” ),然后规划下一步行动。这才是真正实用的人机交互!

场景五:AI 看懂 “专家会诊”!

医生一边滚动查看 CT 影像,一边用嘴说出诊断(“这里我们看到一些肺大疱和相关的纤维化改变...” ) 。OmniVinci 能同时 “看” CT 影像的动态变化 ,并 “听” 懂医生的专业解说 ,准确回答 “肺部纹理随时间如何变化?” 这类高难度问题,在医疗 AI 上大展身手 !

场景六:AI “全能解说” 体育比赛!

看网球比赛,AI 不再是 “睁眼瞎”。OmniVinci 能同步理解激烈的视觉动作(谁在发球、谁赢了这一分)和解说员的评论。在预测得分结果和回合长度上,它完胜 Qwen2.5-Omni。更重要的是,量化后在消费级显卡 GeForce RTX 4090 上它延迟极低,完全可以用于电视直播!

这不就是贾维斯吗?

OmniVinci 的出现,可能不仅仅是一个新 SOTA 9B 全模态模型的诞生,它更代表了一种全新的 AI 范式。

未来,AI 不再是割裂的 “视觉模型” 或 “音频模型”,而是统一的 “全模态感知系统”。

更低的训练成本,意味着更快的迭代和更广泛的应用。从能听懂指令的机器人,到能理解医生口述和 CT 影像的医疗 AI,再到监控异常声音和画面的智能工厂,一个更智能的未来,正在加速到来。

英伟达这次,又交出了一份惊艳的答卷。

对于 OmniVinci,你怎么看?你最期待它被用在什么地方?欢迎在评论区留下你的 “神预言”!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
货车撞飞限高杆,杆子直接砸穿路过小车!苏州警方回应:无人伤亡

货车撞飞限高杆,杆子直接砸穿路过小车!苏州警方回应:无人伤亡

福建第一帮帮团
2026-07-27 15:45:10
43岁演员王凯离世,前一天还在拍戏,今天就离世,死因曝光让人泪目

43岁演员王凯离世,前一天还在拍戏,今天就离世,死因曝光让人泪目

洲洲影视娱评
2026-07-27 14:44:57
倒闭几万家,销量暴跌75%!被中产疯抢20年的钢琴,没人学了?

倒闭几万家,销量暴跌75%!被中产疯抢20年的钢琴,没人学了?

青眼财经
2026-07-26 19:39:25
76人正式签下詹姆斯!两年800万+15%交易保证金 夺冠赔率排第三

76人正式签下詹姆斯!两年800万+15%交易保证金 夺冠赔率排第三

罗说NBA
2026-07-27 06:11:26
震惊!王虹一身价值五六万的轻奢穿搭被扒,网友:幸好她在法国工作,要是在国内,会被大家喷死的

震惊!王虹一身价值五六万的轻奢穿搭被扒,网友:幸好她在法国工作,要是在国内,会被大家喷死的

火山詩话
2026-07-27 11:18:43
蔚来1.58亿元战略入股长鑫科技,李斌现身答谢晚宴

蔚来1.58亿元战略入股长鑫科技,李斌现身答谢晚宴

凤凰网科技
2026-07-27 14:54:26
日本国民女神代言比亚迪惨遭网暴!日本网友:不爱国,她甚至穿上了中国红!

日本国民女神代言比亚迪惨遭网暴!日本网友:不爱国,她甚至穿上了中国红!

大白聊IT
2026-07-27 00:02:32
拒绝4年8000万美金!接受1年650万美金!沃特森疯了吧

拒绝4年8000万美金!接受1年650万美金!沃特森疯了吧

世界体育圈
2026-07-27 17:59:43
为什么不说中文?王虹接受央视采访不说中文,全程使用英语被批评:你是中国人,要说中国话!

为什么不说中文?王虹接受央视采访不说中文,全程使用英语被批评:你是中国人,要说中国话!

谭谈社会
2026-07-26 15:08:32
最新全球AI大模型调用量排名出炉,小米MiMo-V2.5升至第一

最新全球AI大模型调用量排名出炉,小米MiMo-V2.5升至第一

IT之家
2026-07-27 12:23:36
印度裔比华人更容易当上大公司高管,只因他们更敢表达争取,而华人总是避免冲突

印度裔比华人更容易当上大公司高管,只因他们更敢表达争取,而华人总是避免冲突

可达鸭面面观
2026-07-27 12:34:34
安徽阜阳一对双胞胎兄弟分别被北大清华录取:不是天赋异禀,日日夜夜持续努力才会蜕变

安徽阜阳一对双胞胎兄弟分别被北大清华录取:不是天赋异禀,日日夜夜持续努力才会蜕变

极目新闻
2026-07-27 17:36:05
长鑫科技半日飙涨531%,市值超越英特尔、腾讯!相当于两个贵州茅台

长鑫科技半日飙涨531%,市值超越英特尔、腾讯!相当于两个贵州茅台

中国基金报
2026-07-27 12:44:27
迪马济奥:迫于政治压力,意大利足协主席叫停皮尔洛上任

迪马济奥:迫于政治压力,意大利足协主席叫停皮尔洛上任

懂球帝
2026-07-27 07:10:21
刚坐完C919,实话实说:与波音737的差距,根本不是你想的那样

刚坐完C919,实话实说:与波音737的差距,根本不是你想的那样

普陀动物世界
2026-07-27 10:48:03
26岁健美网红之死,健身圈最讽刺的悲剧!

26岁健美网红之死,健身圈最讽刺的悲剧!

健身厨屋
2026-07-26 13:06:47
泽连斯基收到最新情报,普京这次找东方盟友借兵,数量十分惊人

泽连斯基收到最新情报,普京这次找东方盟友借兵,数量十分惊人

共工之锚
2026-07-27 00:06:07
越南为什么要感谢中方?菲律宾最好听听!

越南为什么要感谢中方?菲律宾最好听听!

新民周刊
2026-07-27 12:20:29
47亿美元大桥通车,美国人却被告知“别来”,加拿大市长心酸:有点冷清,但没关系

47亿美元大桥通车,美国人却被告知“别来”,加拿大市长心酸:有点冷清,但没关系

红星新闻
2026-07-27 14:45:10
世界大混战!据泽连斯基称,俄罗斯将卫星数据传递给伊朗,伊朗谴责“乌克兰的袭击”

世界大混战!据泽连斯基称,俄罗斯将卫星数据传递给伊朗,伊朗谴责“乌克兰的袭击”

一种观点
2026-07-26 07:46:54
2026-07-27 18:24:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13612文章数 142703关注度
往期回顾 全部

科技要闻

长鑫科技上市首日收涨465%,市值3.28万亿

头条要闻

媒体:伊朗和阿曼没谈拢 特朗普在3个选项里举棋未定

头条要闻

媒体:伊朗和阿曼没谈拢 特朗普在3个选项里举棋未定

体育要闻

说过不会再回NBA的男人,又回来了

娱乐要闻

佟丽娅离婚不离家,绝非恋爱脑

财经要闻

破产德企如何托起长鑫科技的逆袭之路

汽车要闻

燃油车跑长途也能更放松 全新瑞虎9/艾瑞泽8 PRO智驾体验报告

态度原创

数码
艺术
健康
房产
手机

数码要闻

荣耀手环11系列官宣:支持专业羽毛球模式,Pro版升级26天续航

艺术要闻

溥仪卖给日本的王羲之真迹,5000字清晰无损

教你三步快速识别中风

房产要闻

最新成交量猛跌22.9%!海南楼市,还没熬出头!

手机要闻

一加15:165Hz高刷性能Ultra旗舰,现在入手还值吗?

无障碍浏览 进入关怀版