网易首页 > 网易号 > 正文 申请入驻

复旦等发布AnyGPT:任意模态输入输出,图像、文本、语音都支持

0
分享至

机器之心报道

机器之心编辑部

最近,OpenAI 的视频生成模型 Sora 爆火,生成式 AI 模型在多模态方面的能力再次引起广泛关注。

现实世界本质上是多模态的,生物体通过不同的渠道感知和交换信息,包括视觉、语言、声音和触觉。开发多模态系统的一个有望方向是增强 LLM 的多模态感知能力,主要涉及多模态编码器与语言模型的集成,从而使其能够跨各种模态处理信息,并利用 LLM 的文本处理能力来产生连贯的响应。

然而,该策略仅限于文本生成,不包含多模态输出。一些开创性工作通过在语言模型中实现多模态理解和生成取得了重大进展,但这些模型仅包含单一的非文本模态,例如图像或音频。

为了解决上述问题,复旦大学邱锡鹏团队联合 Multimodal Art Projection(MAP)、上海人工智能实验室的研究者提出了一种名为 AnyGPT 的多模态语言模型,该模型能够以任意的模态组合来理解和推理各种模态的内容。具体来说,AnyGPT 可以理解文本、语音、图像、音乐等多种模态交织的指令,并能熟练地选择合适的多模态组合进行响应。

例如给出一段语音 prompt,AnyGPT 能够生成语音、图像、音乐形式的综合响应:

给出文本 + 图像形式的 prompt,AnyGPT 能够按照 prompt 要求生成音乐:

  • 论文地址:https://arxiv.org/pdf/2402.12226.pdf
  • 项目主页:https://junzhan2000.github.io/AnyGPT.github.io/

方法简介

AnyGPT 利用离散表征来统一处理各种模态,包括语音、文本、图像和音乐。

为了完成任意模态到任意模态的生成任务,该研究提出了一个可以统一训练的综合框架。如下图 1 所示,该框架由三个主要组件组成,包括:

  • 多模态 tokenizer
  • 作为主干网络的多模态语言模型
  • 多模态 de-tokenizer

其中,tokenizer 将连续的非文本模态转换为离散的 token,随后将其排列成多模态交错序列。然后,语言模型使用下一个 token 预测训练目标进行训练。在推理过程中,多模态 token 被相关的 de-tokenizer 解码回其原始表征。为了丰富生成的质量,可以部署多模态增强模块来对生成的结果进行后处理,包括语音克隆或图像超分辨率等应用。

AnyGPT 可以稳定地训练,无需对当前的大型语言模型(LLM)架构或训练范式进行任何改变。相反,它完全依赖于数据级预处理,使得新模态无缝集成到 LLM 中,类似于添加新语言。

这项研究的一个关键挑战是缺乏多模态交错指令跟踪数据。为了完成多模态对齐预训练,研究团队利用生成模型合成了第一个大规模「任意对任意」多模态指令数据集 ——AnyInstruct-108k。它由 108k 多轮对话样本组成,这些对话错综复杂地交织着各种模态,从而使模型能够处理多模态输入和输出的任意组合。

这些数据通常需要大量比特才能准确表征,从而导致序列较长,这对语言模型的要求特别高,因为计算复杂度随着序列长度呈指数级增加。为了解决这个问题,该研究采用了两阶段的高保真生成框架,包括语义信息建模和感知信息建模。首先,语言模型的任务是生成在语义层面经过融合和对齐的内容。然后,非自回归模型在感知层面将多模态语义 token 转换为高保真多模态内容,在性能和效率之间取得平衡。

实验

实验结果表明,AnyGPT 能够完成任意模态对任意模态的对话任务,同时在所有模态中实现与专用模型相当的性能,证明离散表征可以有效且方便地统一语言模型中的多种模态。

该研究评估了预训练基础 AnyGPT 的基本功能,涵盖所有模态的多模态理解和生成任务。该评估旨在测试预训练过程中不同模态之间的一致性,具体来说是测试了每种模态的 text-to-X 和 X-to-text 任务,其中 X 分别是图像、音乐和语音。

为了模拟真实场景,所有评估均以零样本模式进行。这意味着 AnyGPT 在评估过程中不会对下游训练样本进行微调或预训练。这种具有挑战性的评估设置要求模型泛化到未知的测试分布。

评估结果表明,AnyGPT 作为一种通用的多模态语言模型,在各种多模态理解和生成任务上取得了令人称赞的性能。

图像

该研究评估了 AnyGPT 在图像描述任务上的图像理解能力,结果如表 2 所示。

文本到图像生成任务的结果如表 3 所示。

语音

该研究通过计算 LibriSpeech 数据集的测试子集上的词错误率 (WER) 来评估 AnyGPT 在自动语音识别 (ASR) 任务上的性能,并使用 Wav2vec 2.0 和 Whisper Large V2 作为基线,评估结果如表 5 所示。

音乐

该研究在 MusicCaps 基准上评估了 AnyGPT 在音乐理解和生成任务方面的表现,采用 CLAP_score 分数作为客观指标,衡量生成的音乐和文本描述之间的相似度,评估结果如表 6 所示。

感兴趣的读者可以阅读论文原文,了解更多研究内容。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘涛去上海出差,想着好久没见孙俪,发微信约晚饭。孙俪回得很快:见面可以,只能中午,四点前必须散

刘涛去上海出差,想着好久没见孙俪,发微信约晚饭。孙俪回得很快:见面可以,只能中午,四点前必须散

LULU生活家
2026-06-28 09:20:29
3-2险胜!韦世豪一战封神:补时绝杀,梅开二度,踢爆深圳新鹏城

3-2险胜!韦世豪一战封神:补时绝杀,梅开二度,踢爆深圳新鹏城

足球狗说
2026-06-27 21:42:11
割牛草女孩,代表北大回母校招生!

割牛草女孩,代表北大回母校招生!

环球网资讯
2026-06-28 09:34:17
委内瑞拉地震中国公民遇难人数升至8人;强震已致当地1430人死亡,3238人受伤;676万人生存或受影响

委内瑞拉地震中国公民遇难人数升至8人;强震已致当地1430人死亡,3238人受伤;676万人生存或受影响

极目新闻
2026-06-28 07:26:55
医生发现:不易患阿尔茨海默病的老人,一般都有这4个习惯,赶紧看看

医生发现:不易患阿尔茨海默病的老人,一般都有这4个习惯,赶紧看看

健康科普365
2026-06-28 04:35:06
7月1日起,上海将调整最低生活保障等社会救助相关标准、失业保险金支付标准、职工医保统筹基金最高支付限额

7月1日起,上海将调整最低生活保障等社会救助相关标准、失业保险金支付标准、职工医保统筹基金最高支付限额

上海嘉定
2026-06-26 23:42:55
00后相亲节目全网催更,不是因为甜,是因为毒

00后相亲节目全网催更,不是因为甜,是因为毒

酷玩实验室
2026-06-27 09:30:26
俄罗斯令中国心凉?真正可怕的不是西方围堵,而是我们低估了自己

俄罗斯令中国心凉?真正可怕的不是西方围堵,而是我们低估了自己

探索新高度
2026-06-28 03:46:06
比国足输得还窝囊?韩国世界杯另有隐情,责任不能全怪孙兴慜一人

比国足输得还窝囊?韩国世界杯另有隐情,责任不能全怪孙兴慜一人

最新声音
2026-06-27 23:30:31
美国再次就台湾问题表态!

美国再次就台湾问题表态!

叶葉夜
2026-06-26 16:51:22
身高猛涨!12岁乔治王子身高齐平凯特王妃,创下温莎家族新纪录

身高猛涨!12岁乔治王子身高齐平凯特王妃,创下温莎家族新纪录

墨印斋
2026-06-28 00:09:15
2.8亿暴跌到910万 两位全明星遇冷 东部格局要变天

2.8亿暴跌到910万 两位全明星遇冷 东部格局要变天

林子说事
2026-06-28 12:46:34
千亿婴儿卫生市场崩坏:21款湿巾20款含毒,9成产品沦陷背后代工模式自噬

千亿婴儿卫生市场崩坏:21款湿巾20款含毒,9成产品沦陷背后代工模式自噬

薛定谔的BUG
2026-06-27 03:57:07
程序员的下一代,谁来培养?

程序员的下一代,谁来培养?

钛媒体APP
2026-06-28 09:13:20
河南省提级调查处理驻马店市泌阳县等地“查扣冻品”问题

河南省提级调查处理驻马店市泌阳县等地“查扣冻品”问题

环球网资讯
2026-06-27 18:01:27
为什么说不体面的小生意往往赚大钱?网友:一天三千都算少的

为什么说不体面的小生意往往赚大钱?网友:一天三千都算少的

康富贵碎碎念
2026-06-28 11:22:01
6月28日,关于2026年上调基本养老金通知发布了吗?

6月28日,关于2026年上调基本养老金通知发布了吗?

小谈食刻美食
2026-06-28 09:00:34
黄牛掏空退休金买了500份《GTA6》!自信一定会血赚

黄牛掏空退休金买了500份《GTA6》!自信一定会血赚

游民星空
2026-06-26 23:06:18
白玉兰奖落幕,3人口碑暴涨,2人升咖,1人镀金失败,唯她被骂惨

白玉兰奖落幕,3人口碑暴涨,2人升咖,1人镀金失败,唯她被骂惨

深析古今
2026-06-28 09:35:31
中美俄人均智商差距太大:美国99.74,俄罗斯103.16,中国多少?

中美俄人均智商差距太大:美国99.74,俄罗斯103.16,中国多少?

蜉蝣说
2026-06-27 17:14:15
2026-06-28 14:04:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13373文章数 142681关注度
往期回顾 全部

科技要闻

DeepSeek最新论文:如何让大模型跑得更快

头条要闻

三队出线世界杯32强席位正式落定 伊朗在最后一刻出局

头条要闻

三队出线世界杯32强席位正式落定 伊朗在最后一刻出局

体育要闻

世界杯最火门将,站到了阿根廷和梅西面前

娱乐要闻

白玉兰奖落幕,唯她被骂惨

财经要闻

两只股票撑起的韩国股市,半年熔断 33 次

汽车要闻

蔚来ES大五座体验 全场景行李舱让你带着生活出发

态度原创

时尚
手机
房产
本地
数码

今天的脸不想营业,但墨镜想

手机要闻

vivo X Fold6折叠屏手机维修备件价格公布

房产要闻

全国高考大放水,300分就能上本科!论上岸率,海南没输过!

本地新闻

世界杯球迷节:比球赛更好玩的派对

数码要闻

从RGB-Mini LED到全球首发RGBX!海信引领下一代显示全新色彩赛道

无障碍浏览 进入关怀版