网易首页 > 网易号 > 正文 申请入驻

牛津、微软等发布音视频智能综述:梳理大模型时代的AVI研究全景

0
分享至



GPT-4o 一边看屏幕一边和你语音对话;Veo-3、MovieGen、Seedance 2.0 直接把原生音轨纳入视频生成链路;HappyHorse 这类近期模型也开始探索音视频联合生成;OpenVLA 让机器人” 听音辨物”—— 音视频大模型,正在从” 加在视觉模型旁边的一个 ASR”,进化成 omni-modal 基础模型的核心能力之一。

NUS 联合牛津、多伦多、UTD、HKUST、QMUL、微软研究院、罗切斯特大学等共 9 家机构最近推出据作者所知第一份系统的音视频智能(AVI)大模型综述,用一张演化树串起十年发展,给出统一 taxonomy、三条主线与六大未来研究轴,把 AVI 在大模型时代的角色与待解问题摆到了同一张地图上。



一、9 机构、首份” 音视频大模型” 综述

近年来,AI 圈最显著的变化之一,是” 模型不再只看图”。

2024 年 GPT-4o 把语音、视觉、文本塞进同一个 backbone,2025 年 Google Veo-3、Meta MovieGen 把” 原生带音轨的视频生成” 作为统一目标,2026 年字节 Seedance 2.0 和 HappyHorse 等工作进一步把文本、图像、视频、音频条件与同步音视频输出放进同一代视频生成叙事中;Qwen-Omni 把多模态对话推到流式实时层面,OpenVLA、π0、GR00T 这一线 VLA 模型则开始让机器人同时处理语音指令、视觉、动作甚至环境声响。

但与此同时,整个领域的学术地图却仍然高度分散。ASR、数字人 / 说话头(talking head)、Foley(拟音)合成、视频配音(V2A)、音频驱动视频生成(A2V)、音画编辑、音视频问答(AVQA)、空间音频推理、AV 导航、AV 操作…… 每一个子方向都有自己的范式、benchmark 与评测口径。

正是在这一背景下,新加坡国立大学(NUS)联合牛津大学、多伦多大学、UTD、HKUST、QMUL、微软研究院、罗切斯特大学等机构,推出了据作者所知第一份专门针对” 音视频大模型(AVI in Large Foundation Models)“的系统综述



  • 论文标题:Audio-Visual Intelligence in Large Foundation Models: AComprehensiveSurvey
  • 论文:https://arxiv.org/abs/2605.04045
  • HF Paper:https://huggingface.co/papers/2605.04045
  • GitHub(Awesome-AVI,持续更新):https://github.com/JavisVerse/Awesome-AVI
  • 项目主页:https://javisverse.github.io/

论文把过去十年里散落在十几个子社区的 AV 工作,重新组织成理解世界(Understanding the World)/ 创造世界(Creating the World)/ 与世界交互(Interacting with the World)三条主线,给出统一的 taxonomy、基础技术拆解、应用版图、以及面向未来 1–3 年的六轴研究路线。

论文本身的立意,是把AVI 当作大模型时代下、与单模态语言模型同等重要的一支基础能力来梳理:从音视频对齐、到联合音视频生成、再到实时闭环交互,应该形成一个连贯的研究框架,而不是被 ASR、Foley(拟音)、数字人 / 说话头、AVQA 各自的范式继续切碎。

二、十年 AVI” 进化树”:从” 对得上” 到” 听 - 看 - 说 - 动一体”

打开 paper 第一页,先映入眼帘的就是这张2016–2026 AVI 进化树



论文把整个 AVI 的发展分成 4 个时代:

  • Era 1(2016–2018):AV Alignment——L3-Net、AVTS、Wav2Lip、Audio2Head,加上”ASR + LLM + TTS” 的级联式语音对话。问题集中在” 对得上”。
  • Era 2(2019–2022):Scaled Representations——XDC、AVID、VATT 这些大规模对比学习方法登场,AudioLDM、MusicGen 等单模态生成开始爆发,SpeechGPT、SALMONN、Qwen-Audio 一路走出 audio-native LLM。
  • Era 3(2023–2024):AV Creation——MBT、AV-HuBERT、Diff-Foley、MMAudio、FoleyCrafter、MusicInfuser、AudioGPT、Mini-Omni、NExT-GPT,把” 以一种模态生成另一种模态” 和”AV 控制器” 推到舞台中央。
  • Era 4(2024–2026):Omni / VLA——ImageBind、Qwen-Omni、JavisDiT、MovieGen、Veo-3、Seedance 2.0、HappyHorse、GPT-4o、OpenVLA、Audio-VLA,原生融合的 AV 大模型、同步音视频生成模型与 VLA 一起走上前台。

更重要的是,论文明确指出,从 Era 1 到 Era 4,有6 条瓶颈贯穿始终:音画同步、时序一致性、可控生成、评测体系、实时延迟、安全治理与数据合规。这些问题不会因为模型变大就自动消失,反而会随着场景升级(短视频 → 长视频 → 实时 omni → agentic)反复出现。

三、统一 Taxonomy:感知 / 生成 / 交互三条主线

论文给出的统一 taxonomy 是核心交付物之一,它把 AVI 拆成三条主线:



理解世界(Understanding the World,Perception):包括音视频语音识别(AV-ASR)、唇语识别(lip reading)、活跃说话人检测(ASD)、声源定位与分离、音视频事件理解、跨模态检索、音视频问答(AVQA)这些经典任务,加上越来越多基于 AV-LLM 的长视频理解与因果推理任务。



创造世界(Creating the World,Generation):被进一步拆成” 条件生成 / 跨模态生成 / 联合音视频生成 / 音画编辑” 四类,覆盖视频配音(V2A)、音频驱动视频生成(A2V)、joint AV 生成等代表方向。论文特别指出,真正” 原生联合” 的音视频生成才刚刚开始——MovieGen、Veo-3、Seedance 2.0、JavisDiT,以及 HappyHorse 这类近期模型已经能从文本或多模态条件生成带原生音轨的视频,但跨身份、跨时长、跨场景物理合理性的音画同步生成,以及局部、可控的音画编辑,仍是开放问题。



与世界交互(Interacting with the World,Interaction):包含两条线,一条是” 音视频对话”(从级联 ASR + LLM + TTS,到 audio-native LLM,再到 GPT-4o / Qwen-Omni 这类原生 omni-modal 实时音视频对话),另一条是” 具身智能与机器人”(AV 导航、AV 场景理解、AV 操作,对应 SoundSpaces、AVLMaps、OpenVLA、Audio-VLA)。





论文强调:交互不是一次性输出,而是带状态的闭环 —— 感知 → 推理 → 响应 / 行动,要在延迟、反馈和用户意图的约束下持续运行。这也是为什么 omni-modal 与 VLA 类模型会在 Era 4 同时出现。

四、基础技术:表示、生成、LLM-centric

如果说三条主线组织的是” 做什么”,基础技术这一章组织的就是” 怎么做”。论文把 AVI 的技术栈拆成三块:

  • Representation(表示):音频与视觉特征抽取、VAE / 重建式压缩、离散化 tokenization、跨模态对齐与融合。在大模型语境下,关键问题已从” 特征对不对得上” 升级为” 用哪种 token 把音视信号塞进 LLM 才最高效”。
  • Generation(生成):系统梳理VAE / GAN / Diffusion / 自回归(AR)/ Masked Autoregressive(MAR)五类生成范式各自的能力边界与组合方式,特别覆盖了 diffusion /flow matching 的演化、AR 模型在视觉与音频上的进展、以及 hybrid AR + Diffusion 的最新方向。
  • LLM-centric 系统范式:论文把当前 AV 大模型按结构归成几种典型范式 ——Encoder + LLM、LLM + Generator、统一感知生成模型(unified Encoder + LLM + Decoder)、以及 Agentic 系统与 VLA 模型。这也是工业界搭” 音视频版 GPT-4o” 时最直接对应的架构选择。



对正在搭” 音视频版 GPT-4o” 的工程团队来说,这张图大体相当于一份 AV 大模型架构选型的速查表,可以拿来对照自己当前的 backbone /encoder/decoder 划分。

五、应用版图:从短视频 AIGC 到具身机器人

论文用一整章梳理了 AVI 的下游应用版图:



围绕音视频基础模型展开,作者把应用归纳为6 大方向

1.AIGC 与创意内容:视频配音 / Foley(拟音)合成、跨语言唇形同步、配乐与音画编辑,再到一次性出” 带原生音轨短场景” 的 JavisDiT、Veo-3、Seedance 2.0、HappyHorse 等联合音视频生成模型;

2.数字人与社交交互:从 Wav2Lip 的 2D 唇形同步、到 GaussianTalker 的 3D 神经渲染、再到 EmoGene、EMAGE、Stereo-Talker 的高保真全身数字人;

3.人本服务:以 Qwen-Audio、SALMONN 等 audio LLM 为核心的对话助手 / 会议转写 / AI 教学 / 无障碍辅助;

4.沉浸式体验与 Metaverse:空间音频推理、AV-NeRF、AVLMaps,以及 <20 ms 级别的低延迟硬约束;

5.具身 AI 与机器人:从 SoundSpaces 一脉的 AV 导航,到 OpenVLA / π0 / GR00T / SmolVLA 的统一 VLA 策略;

6.泛在感知与安全治理:智慧城市、工业 IoT、深伪检测、声学异常检测、水印与数据合规、隐私与边缘部署。

六、未来六大研究轴:超越” 更长清单”,给出结构性能力



AVI 发展路线图:前三阶段建立起” 对应 / 感知 / 生成” 的能力基础,当下处于交互式 omni-modal 与具身模型这一前沿,再往后是因果 - 上下文 AVI 与可验证的 agentic AVI—— 下文六大主轴正对应路线图右侧两段需要补齐的关键能力。

论文最后给出六条未来研究主轴,覆盖音画同步、因果事件 grounding、空间音频推理、长程上下文记忆、可控生成、安全治理、水印与数据合规等关键问题,并强调这六轴不是更长的待办清单而是把 AVI 与” 通用多模态学习” 区分开的结构性能力

1.因果事件 - 声源 grounding:建模延迟、遮挡、画外音、多源混合下的源级 / 事件级 / 因果对齐,把音画同步推向因果可解释层面;

2.AV 世界模型:把音视频当作几何、材质、动力学、可供性、用户 / 社交状态的互补证据,并以空间音频推理作为关键能力;

3.长程 AV 上下文记忆:构建流式 / 情景 / 语义多层、可选择、可溯源的 AV 记忆,而不是简单加长上下文窗口;

4.因果 AV 干预与可控生成:让生成与编辑支持对物体、声音、身份、情绪、空间、时间的局部、因果、同步干预;

5.Verifier 与 Reward 生态:超越 FAD / FVD / CLIP / SyncNet 这些代理指标,发展面向 grounding、物理合理性、音频不可替代性、长程一致性、任务效用的验证器;

6.交互式与负责任 AVI:在低延迟、隐私、版权、水印与数据合规等安全治理约束下,把 AV 模型变成可被信任的实时合作者。

这六条主轴,每一条都几乎对应着某条工业界正在追的产品线:

  • 因果事件 - 声源 grounding ↔ 视频理解 / 视频搜索;
  • AV 世界模型 ↔ 世界模型 / Sora 系列;
  • AV 上下文记忆 ↔ 长会议、长直播、长游戏陪伴的 omni assistant;
  • 因果 AV 干预 ↔ AI 视频后期 / 影视特效;
  • Verifier & Reward 生态 ↔ AI 视频质量评估、自动剪辑;
  • 交互式与负责任 AVI ↔ omni 助手 / 实时陪练 / 具身机器人。

七、对行业意味着什么

最后做一个简短的产业向解读:

1. 论文给出了” 音视频大模型” 研发的统一坐标系。不论你是在做视频生成、数字人 / 说话头、omni 助手,还是 AV 智能体或具身机器人,都能在这张全景图里找到自己的位置,进而判断邻接技术栈在哪里、可借鉴的方法是什么。

2. 它明确指出了 omni-modal 模型的下一波竞争点不在” 能不能听 / 能不能看”,而在” 能不能在统一 backbone 或统一生成链路下做长程 AV 上下文推理 + 原生音画同步生成 + 实时闭环交互”。GPT-4o、Veo-3、Seedance 2.0、Qwen-Omni、OpenVLA,以及 HappyHorse 这类近期联合音视频生成尝试,都在从不同侧面推进这一趋势。

3. 评测体系正在重塑。论文对 FAD / FVD / CLIP / SyncNet 这类代理指标在音画同步与音频不可替代性维度上的局限做了系统讨论,并明确把 verifier & reward 生态列为未来主轴之一。可以预期未来一年,AV 评测会从” 主观打分 + 代理指标”,走向” 任务效用 + 物理合理性 + 安全可溯源” 的多维评测体系。

4. 安全治理已经从锦上添花走向基础设施层面。深伪、版权、隐私、水印与数据合规、实时滥用,将成为部署侧不可绕过的硬约束。

对任何在做 AV 大模型、omni-modal 模型、视频生成、数字人 / 说话头、AV 智能体、具身机器人、空间音频或深伪检测的团队,这篇综述长文都值得完整通读一次。

配套的 Awesome-AVI 仓库会持续更新方法、数据集与 benchmark,研究者可以围绕它跟踪最新进展。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
普京表示袭击俄罗斯设施“永远不会造成严重后果”,并称乌克兰的袭击是 “恐怖主义袭击”

普京表示袭击俄罗斯设施“永远不会造成严重后果”,并称乌克兰的袭击是 “恐怖主义袭击”

山河路口
2026-08-20 11:44:00
中方接到消息,又一场战争逼近?朝鲜大军已介入,东北亚暴雷在即

中方接到消息,又一场战争逼近?朝鲜大军已介入,东北亚暴雷在即

梦想的旅途
2026-08-19 21:03:50
特朗普35岁女助理亲笔信曝光:追不上高尔夫球车,自认“丢人现眼”

特朗普35岁女助理亲笔信曝光:追不上高尔夫球车,自认“丢人现眼”

生活观察员啊
2026-08-20 02:12:59
俄乌冲突全面升级!乌炸毁朝援俄军火专列,战火烧到中国家门口?

俄乌冲突全面升级!乌炸毁朝援俄军火专列,战火烧到中国家门口?

棠棣分享
2026-08-21 01:40:24
彻底撕破脸皮!原配再爆男方父亲猛料,上梁不正下梁歪全家颜面无存

彻底撕破脸皮!原配再爆男方父亲猛料,上梁不正下梁歪全家颜面无存

匹夫来搞笑
2026-08-21 01:15:55
台积电AI红利全民共享:台湾每人发314美元现金,GDP增11%出口飙9030亿

台积电AI红利全民共享:台湾每人发314美元现金,GDP增11%出口飙9030亿

灰度测试中
2026-08-20 10:05:24
博主:当年陈戌源和许家印不对付,拖欠里皮工资,被告到FIFA

博主:当年陈戌源和许家印不对付,拖欠里皮工资,被告到FIFA

懂球帝
2026-08-20 20:33:12
杨幂的“大幂幂”绝非浪得虚名!

杨幂的“大幂幂”绝非浪得虚名!

八卦疯叔
2026-08-20 11:40:06
Miu Miu泡泡鞋逆势翻红:细鞋当道下“丑鞋”如何抢占秀场

Miu Miu泡泡鞋逆势翻红:细鞋当道下“丑鞋”如何抢占秀场

晚风寄温柔
2026-08-20 04:44:08
中共中央、国务院、中央军委决定:给张陆、武飞、张洪章同志颁发奖章

中共中央、国务院、中央军委决定:给张陆、武飞、张洪章同志颁发奖章

中国网
2026-08-20 17:09:00
半年报出炉!恒瑞医药、中国卫星、通鼎互联、永鼎股份,后市预期

半年报出炉!恒瑞医药、中国卫星、通鼎互联、永鼎股份,后市预期

长风价值掘金
2026-08-20 17:37:09
2026年德国小学教材:很多中国人没有汽车,出门靠自行车或步行,见面不握手、仅鞠躬。网友吐槽:刻意抹黑中国

2026年德国小学教材:很多中国人没有汽车,出门靠自行车或步行,见面不握手、仅鞠躬。网友吐槽:刻意抹黑中国

谭谈社会
2026-08-20 11:43:49
每个体制内的单位都有自己的守村人,网友:铁饭碗是真铁啊

每个体制内的单位都有自己的守村人,网友:铁饭碗是真铁啊

另子维爱读史
2026-08-20 20:12:14
张维为:在中国“人民”是一种神圣的概念

张维为:在中国“人民”是一种神圣的概念

看看新闻Knews
2026-08-20 23:40:25
2‑1!罗德里亮相诺坎普!7000 万先生罚丢点球,巴萨主场艰难拿下胜利

2‑1!罗德里亮相诺坎普!7000 万先生罚丢点球,巴萨主场艰难拿下胜利

天镜云生m
2026-08-20 07:34:20
冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

冯巩现状:全家住北京老破小,68岁满脸褶子,儿子已是公司高管

揽星河的笔记
2026-08-20 14:35:02
上海优化房地产政策措施,精准施策促进合理购房需求积极释放

上海优化房地产政策措施,精准施策促进合理购房需求积极释放

界面新闻
2026-08-20 12:51:19
气炸了!乌克兰留学生“拉眼角”,疑似公然歧视中国,被批评后称是“娱乐”,网友不买账:开除学籍,驱逐出境!

气炸了!乌克兰留学生“拉眼角”,疑似公然歧视中国,被批评后称是“娱乐”,网友不买账:开除学籍,驱逐出境!

谭谈社会
2026-08-20 12:48:35
德约科维奇妻子打破沉默:不认同丈夫疫苗立场,发帖后“地狱之门打开”

德约科维奇妻子打破沉默:不认同丈夫疫苗立场,发帖后“地狱之门打开”

慢享生活集
2026-08-20 19:40:45
董毓民已任杭州市委常委、余杭区委书记

董毓民已任杭州市委常委、余杭区委书记

上观新闻
2026-08-20 07:48:09
2026-08-21 07:51:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13803文章数 142724关注度
往期回顾 全部

科技要闻

快手Q2研发狂烧45亿:如何面对双面夹击

头条要闻

很多人用过他的表情包 千万粉丝博主宣布退网一段时间

头条要闻

很多人用过他的表情包 千万粉丝博主宣布退网一段时间

体育要闻

46岁小罗抵达意大利 将为拉文纳征战意丙

娱乐要闻

任重晒全家福官宣二胎喜讯

财经要闻

许家印被判处无期 恒大集团被罚88.2亿

汽车要闻

比总部还大?比亚迪藏在上海虹桥的巨无霸闪充站!

态度原创

时尚
房产
数码
手机
军事航空

真丝专场|| 我穿了一整个夏天,终于给你们磨到好价格!

房产要闻

265亿资产甩出!三亚老牌地产巨头,正在集体退场!

数码要闻

AMD Zen 6低功耗核心藏不住了!Linux 7.3提前打补丁:Intel/AMD核心类型终于统一

手机要闻

华为首创阔直板手机!Pura X View定价有惊喜:爆款预定

军事要闻

知情人士称美国“林肯”号航母开始返航

无障碍浏览 进入关怀版