网易首页 > 网易号 > 正文 申请入驻

Ming-Flash-Omni:全模态统一大模型的关键技术与实践

0
分享至


作者 | 郭清沛,蚂蚁集团高级算法专家

审核 | 罗燕珊

策划 | QCon 全球软件开发大会

在大型语言模型向多模态方向持续演进的今天,业界正经历从“语言模型 + 多模态外挂”到“原生全模态统一”的范式迁移。本文整理自蚂蚁集团高级算法专家郭清沛QCon 全球软件开发大会 2026 北京站的分享《Ming-Flash-Omni:全模态统一大模型的关键技术与实践》。

郭清沛系统阐述了 Ming-flash-omni 全模态统一大模型的技术架构与研发实践,从模态统一、任务统一到工程优化三个维度,揭开了一个千亿参数全模态模型从理论到落地的完整技术路径。

以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。

1 多模态大模型发展趋势

我们对于多模态大模型发展趋势的整体判断,可以用一句话来总结:这个模型会越来越像人。从感知层面来看,它会引入视觉感知和听觉感知。从能力层面来看,它会把人的认知、表达、理解和生成这些能力都统一起来。所以我们从模态维度和任务维度这两个坐标出发来观察大模型的演化方向,结论是一致的——模型正在变得更加类人化,感知上拥有更多模态的感知能力,能力上逐渐实现理解与表达的一体化,实现生成和理解的统一。

基于这个趋势判断,Ming 模型从立项之初的定位,就是做一个统一的多模态大模型。但是在深入技术细节之前,我们需要先厘清几个核心概念。这几个概念在当前的技术讨论中频繁出现,但各自的边界和内涵往往被混用。只有把概念定义清楚,才能真正理解我们在全模态统一大模型上做了哪些工作。

首先是原生多模态。原生多模态要解决的核心问题是模态统一中“怎么统一”的路径选择。在模态统一这个目标下,我们有两条路可以走。一条路是基于已有的语言模型,通过桥接的方式去拓展多模态能力,先训好一个语言模型,再把视觉、音频的 encoder 加上去,让这些模态往语言模型的空间对齐。另一条路是在训练语言模型的同时,直接用多模态序列来训练,也就是在 LM 预训练阶段就把多模态序列引入进来,训出来的模型天然就是一个多模态模型。所谓原生多模态,指的就是后一条路径,它是模态统一的一种具体实现方式。

第二个概念是全模态大模型。全模态大模型强调的是模型能够理解更多模态,把音频、视频、图片、文本这些模态全部放在一个模型里,实现全模态的理解。这个概念的侧重点在于“模态的广度”,它不涉及生成任务,只关注理解能力能否覆盖所有主流模态。

第三个概念是理解与生成统一。这个强调的是任务层面的统一,是让模型既能做理解任务,又能做生成任务,实现感知和表达的闭环。这是从能力维度的统一,而不是模态维度的统一。

搞清楚这三个概念之后,今天我们要讨论的主题——全模态统一大模型,它的内涵就非常清楚了。全模态统一大模型包含两个维度:首先,它要能够实现音频、视频、图片、文本这种全模态的理解;其次,它要实现任务的统一,能够把理解任务和生成任务统一在一个模型里。也就是说,全模态统一大模型等于全模态大模型加上理解与生成统一。而原生多模态,是实现模态拓展的一种具体路径选择,是实现全模态大模型的其中一条技术路线。

把这些概念界定清楚之后,我们再来看构建一个全模态统一大模型到底面临哪些核心挑战。

2 构建全模态统一大模型的核心挑战

如果要做一个全模态统一大模型,我们面临的核心挑战可以归纳为三个维度。


第一个挑战是模态统一。这里的模态统一,指的是我们怎么基于一个统一的架构,实现音视图文这种全模态的协同理解。这个问题又包含了两个层面。在基础技术层面,我们需要在模型架构和训练策略上做出设计,让各个模态在一个模型里能够协同工作,而不是互相干扰。在训练范式层面,我们需要回答那个路线选择的问题:是走桥接路线,在已有的语言模型上拓展多模态能力;还是走原生路线,在 LM 训练一开始就直接融入多模态序列。

第二个挑战是任务统一。任务统一要解决的核心问题,是基于统一的架构来实现感知和表达的闭环。理解任务和生成任务在表征的要求上存在着天然的冲突。对于理解任务而言,它的核心操作是去噪,从海量的输入信息中提取高层的语义表达,把那些无关的细节过滤掉。对于生成任务而言,它的核心操作恰恰相反,一个是还原细节,另一个是发散创造。生成需要细粒度的表征来做精确的像素级输出,需要发散的能力来做创意表达。这两个任务的目标和表征需求可以说是背道而驰的。所以在任务统一这个挑战上,我们要解决的核心矛盾,就是理解与生成在表征层面的冲突。

第三个挑战是数据异构性和模型异构性。当我们真正把音频、视频、图片、文本这些多模态序列放在一个训练框架里时,各个模态本身的数据异构性就暴露出来了。不同模态的序列长度差异巨大,文本 token 很短,一张图片的 token 就长得多,视频的 token 更长。同时,不同模态和不同任务之间的收敛速度也是不一致的,简单感知任务收敛得非常快,复杂推理任务则需要更多的训练步数。这种数据异构和模型异构的问题,在统一的训练框架中必须得到系统性的解决。

值得一提的是,在全模态统一大模型这个方向上,上述三个挑战中的任意一个如果取得突破性进展,都可能带来整个业界范式的一次更新。比如说,如果我们在模态统一上突破了原生统一方案,那么在语言大模型训练的时候,视觉感知能力就会成为语言大模型的标配,业界就不会再去区分语言大模型和多模态大模型了。事实上,从今年年初 k2.5、qwen3.5 等模型发布之后,我们可以看到,后续大部分厂家在发布大模型的时候,视觉感知能力基本上已经成为标配。同样,如果在任务统一上取得突破,那么大模型就不会再去区分理解大模型和生成大模型,而是真正实现多模态在感知和创造上的闭环。

3Ming-flash-omni 全模态统一大模型的解决方案

我们把模态统一的挑战进一步分解为两块。第一块是基础问题,包含两个核心子问题:一是怎么设计一个跨模态融合的模型架构,让各个模态放在一起之后不会出现任务冲突,并且联合训练的效果要好于各个模态独立训练;二是在训练策略上,怎么把各个模态真正放在一起实现任务协同,保证在训练结束时每个模态都能达到各自的最佳效果。第二块是训练范式的迁移问题,也就是我们刚才反复讨论的路线选择——桥接还是原生。

我们先来看跨模态融合架构这个基础问题。现在大模型的主流架构是 MOE,它有很好的 scaling law 特性,而且推理时成本更低。但当前的 MOE 架构主要是基于语言模型来设计的。当我们把音频、视频、图片、文本这些多模态序列都放进去的时候,会面临两个具体的挑战。

第一个挑战是,MOE 的 router 在多模态场景下会出现模态分化的问题。不同模态的特征表征天然存在差异,那么在语言模型上已经训练好的 router,是否能够很好地泛化到其他模态上?为了验证这个问题,我们做了一个 preliminary study。结果发现,用语言模型上训练好的 router 去路由视觉模态(包括图片和视频)和音频模态时,专家分布的概率分布与原始语言模型的分布基本上是一致的。这意味着原来的 router 没有能力很好地区分语言模态和其他模态——它把所有的 token 都按照语言模型的习惯来分配专家了。

基于这个观察,我们设计了一个 multi-router 的方案。核心做法是,针对每一个模态,我们都单独设计一个 router,每个 router 也有自己独立的均衡策略。这样,视觉 tokens 走视觉的 router,音频 tokens 走音频的 router,文本 tokens 走文本的 router。从右侧展示的实验报告来看,如果我们只用单个 router 去处理所有模态,各个模态的总体指标都不如各自独立训练的 baseline。但当我们切换到 multi-router 方案之后,各个模态合在一起的效果全面超越了独立训练的 baseline。这说明 multi-router 确实能够兼顾模态间的差异,实现了专家按模态分化,同时保留了各模态自身的特征。


第二个挑战是,传统 MOE 架构中每个 token 分配的专家数是固定的,比如固定激活 6 个或 8 个专家。对于文本 token 来说,这是合理的,因为每个文本 token 的语义丰富度都比较高。但当我们引入图片和视频这类冗余度非常高的模态时,情况就不同了。图片中大量的背景区域 token 其实没有太多信息量,视频中相邻帧之间也存在大量的信息冗余。给这些冗余 token 分配同样数量的专家,会带来严重的训练效率瓶颈。

我们的核心思考是,应该根据 token 的重要程度来动态决定分配多少专家。对语义上比较重要的 token,我们希望能分配更多的专家,但整体的专家预算应该保持恒定。具体的实现方式是在 MOE 的路由层增加一个 token 重要性判断模块:当我们检测到某个 token 比较重要,这个 token 可能来自文本、图像、视频或者音频中的任何一个模态,就在给定的专家预算下给这个 token 尽可能多地分配专家。而对于被判定为冗余的 token,我们就大幅减少分配给它的专家数。我们把这个方案称为 AnyExperts。它的优势是,在相同的专家预算总量下,AnyExperts 能取得比固定 k 个专家更好的效果。同时,因为一些 token 分配的专家数更少,推理速度也会更快。

在工程实现上,为了保证推理过程中的矩阵运算规整性,我们做了一个处理:即使给某个 token 实际分配的专家只有两个,也会给它配上六个“空专家”。这些空专家实际上就是一个恒等变换,不会对特征做任何实质性的操作,只是为了让整个矩阵运算的 shape 保持一致。我们也通过可视化来验证 AnyExperts 是否真的能够识别各模态中的重要 token。右下角的可视化结果给出了一个直观的例子。在一个视频画面中,当那个接电话的男人出现在画面中时,这两帧的 token 重要程度评分,明显比男人没有出现的帧更高。这验证了 AnyExperts 方案确实能够有效识别各个模态中的关键 token,并给它们分配更多的专家。


有了跨模态融合架构作为基础,我们还远没有完成模态统一。只有架构是不够的,还需要配合一套完整的训练策略。这就是我们设计的全模态协同训练策略。当我们把音频、视频、图片、文本这些模态全部放在一起训练时,面临两个核心挑战。

第一个挑战是各模态的数据量差异悬殊。音频方面,我们可能有海量的音频文本对,但这些数据相对来说都比较短。视频方面,视频数据的总量要少得多,但单条视频的序列长度往往非常长。各个模态在数据量、序列长度、数据分布上都有各自的特性。第二个挑战是,即使是同一个模态,内部不同任务的复杂度也不一样。简单的感知任务,比如图像识别、grounding 或者 OCR,收敛得非常快,而复杂的推理任务则需要更长的训练才能收敛。不同任务在不同时间点的收敛状态是不一致的。

针对这两个问题,我们的解决方案也分为两块。第一块是数据配比和训练阶段规划。我们把整个多模态大模型的能力拆解为四个核心维度:感知力、知识力、推理力和行动力。这四个能力对应着不同的训练阶段,每个训练阶段会集中去优化其中某一个能力。划分好训练阶段之后,我们根据当前阶段要优化的能力目标,去搜索一个最优的音频、视频、图片、文本的配比。然后根据手上已有的训练语料和各个模态在这个阶段的配比要求,算出当前阶段大概需要消耗多少个 token。对于那些 token 数达标的模态,就按计划进行训练;对于 token 数没有达标的模态,我们会对重要 token 做上采样,或者启动数据补采。通过这种方式,即使各个模态的原始数据量并不均衡,我们也能把它们贯穿在一个完整的训练流程中,确保在训练结束的时候,各个模态的数据刚好消耗完,各个模态的效果也都得到了保证。


第二块是基于收敛速度的动态均衡策略。我们在训练过程中动态评估每个任务的收敛速度,评估方式是通过 validation loss curve 来监控。当某个任务在 validation 上 loss 下降得比较快的时候,说明当前这个任务正处于快速收敛期,我们会适当增大它的学习率,让它在这段时间内多学一些。当某个任务的 validation loss curve 趋于平缓、不怎么下降的时候,说明这个任务已经接近收敛了,我们会调低它的学习率,避免过拟合或者对别的任务造成干扰。通过这种动态调节学习率的方式,我们能保证在所有的训练阶段结束之后,不管是简单任务还是复杂任务,都能达到各自的最佳效果。

接下来要讨论的是模态统一中的范式迁移问题,也就是原生多模态方案。业界现在已经形成了一些共识性的结论。第一个结论是,当多模态序列更早地介入 LM 训练过程时,在消耗相同多模态 token 数量的情况下,模型的多模态效果是更好的。第二个结论更加令人印象深刻:如果在训练早期就引入多模态序列,可以把多模态数据的比例压得非常低。比如说,用百分之二十的多模态序列加百分之八十的纯语言 token 在训练早期引入,最终的多模态效果,会比在训练晚期用百分之八十的多模态 token 加百分之二十纯语言 token 的效果还要好得多。这背后的原理是,越早引入多模态序列,多模态的表征空间就能在更早的阶段与语言模型的表征空间做对齐,两者是在共同寻找一个表征空间。而传统的桥接模式,是在已经训练好的 LM 上,尝试把视觉和音频的表征空间硬生生往 LM 的语言表征空间迁移。这两种表征对齐方式带来的效果差异是巨大的。目前关于原生训练方案的收益,在业界已经形成了广泛共识,我们也看到了越来越多原生多模态模型的发布。

总结一下 Ming-flash-omni 在模态统一这一块的解决方案。我们重点解决了三个问题。第一是统一的跨模态融合架构,其中 multi-router 解决了不同模态的专家分化问题,AnyExperts 解决了不同模态专家冗余度不同的问题。第二是全模态协同训练策略,通过训练阶段的划分、数据配比和动态评估收敛速度,解决了多模态联合训练中数据异构和收敛速度不一致的问题。第三是原生多模态训练范式的迁移,通过把多模态与语言的对齐前置到 LM 训练过程,让语言模型和多模态共同寻找相同的表征空间,大幅提升了多模态的效果上限。

4 任务统一:理解与生成的模型级统一实践

任务统一要解决的核心问题,是基于统一架构实现理解任务和生成任务的协同。前面已经分析过,理解任务需要提取高层语义,具有去噪的性质;生成任务需要还原细节、发散创造,两者的表征需求和任务目标是存在本质冲突的。目前业界的解决方案大致分为两种。一种是模型级统一,不同模态可能有不同的表征方式,但在输出端用统一的模态特定 decoder 来实现解码。另一种是表征级统一,直接在表征层面就把各个模态打通,这是更彻底的一种方案,也是目前业界发展的趋势。

Ming-flash-omni 目前在模型级统一上做了系统性的实践,同时在表征级统一上也做了一些前沿探索,我们先来看模型级统一的实现方案。在完成了模态统一的工作之后,我们已经把音频、视频、图片、文本放在了一个模型里,但这个模型目前还只能做理解任务,不具备生成能力。接下来我们要在这个理解框架之上,给它加上图像生成和语音合成能力。


这里有两条必须守住的原则。第一,在集成生成任务的同时,不能影响理解任务本身的效果。第二,如果可能的话,理解任务应该反过来促进图像生成的效果提升。基于这两条原则,我们的具体实现方案是:基于 meta x 的思路,训练好一个全模态理解的 MOE backbone 之后,把它固定住不动。然后在 backbone 的输入端引入一组可学习的 query,这些 query 会从多模态序列的 context 中提取与生成任务相关的控制条件,再基于这些控制条件来做图像生成。这种方案的优点在于,理解任务的 backbone 被冻结了,所以生成任务的加入不会反过来损害理解能力。在语音生成这一块,我们借鉴了 qwen omi 的思路,把语音合成拆成两个阶段:先在大脑里生成文本草稿,再把草稿转化成语音输出。

但是,基于 meta x 方案来实现理解和生成的统一,真的没有问题吗?实际上存在着明显的缺陷。核心的问题在于,理解任务输出的 token 已经是高层语义的表达了。高层语义表达在提取过程中,已经过滤掉了大量的细粒度信息——包括图像的纹理细节、空间结构信息、精确的文字信息等等。这些信息的缺失,会导致生成模型在三个具体场景中面临能力不足的问题。第一,缺乏细粒度的视觉知识,使得图像生成和编辑任务没有办法做到非常精细的控制和修改。第二,在做图像编辑尤其是人物编辑时,参考图中的人体结构、人物 ID 难以保持,编辑后的人容易变形或丢失身份特征。第三,在文字生成场景中,由于高层语义已经把文字本身的精确字形信息模糊掉了,表达相同语义时可以采用不同的文字甚至近义词,但图像生成要求输出的是那个精准的汉字或单词,底层字形特征的缺失会直接导致生成的文字变成乱码。

要解决这些问题,核心思路是在当前 meta x 方案的基础上进一步拓展,让图像生成能够获得细粒度语义。坦白说,我们目前的解决方案还谈不上彻底。虽然基于 meta x 这个方案,我们能够在一个全模态理解的基座上加上图像生成和语音合成的能力,但图像生成这一侧还需要额外打一些补丁,补充细粒度的理解能力,才能让生成模型真正达到工业可落地水平。

为了补充模型在生成侧的细粒度知识,我们采取的核心思路是构造理解与生成的统一训练目标。我们的洞察是,图像编辑任务和指代分割这类理解任务,在任务本质上其实密切相关。如果你能在分割任务上做到非常细粒度的前景背景分离,那么在编辑任务上就能做到精准的局部编辑——只修改中间这个人,而完全不动背景或其他前景物体。基于这个洞察,我们的实验方案是引入生成式分割训练,作为生成侧的一个预训练任务。具体做法是把分割任务转化为图着色任务:给定一张图片和一个指代目标,模型需要用指定的颜色把目标区域涂上色,而不是输出多边形坐标。这样,分割任务和编辑任务在形式上统一了起来,都是用生成的方式去输出一张图。我们通过实验验证了两者之间的相互促进关系。在去年春节发版的 Ming-flash-omni 上,指代分割任务达到了业界 SOTA,同一时间图像编辑任务也达到了业界 SOTA。


在解决了生成侧细粒度感知问题之后,还有两个遗留问题需要处理。一个是人物编辑时 ID 难保持的问题,本质上是参考图的结构化信息在高层语义中丢失了。另一个是生成文字乱码的问题,本质上是底层字形特征在语义压缩中被丢弃了。

针对 ID 保持问题,我们设计了一个双信息流的方案。核心思路是在图像生成过程中,额外引入参考图的结构性信息流。具体实现方式是把参考图像通过单独的编码后,直接拼接到扩散模型的噪声变量中,让生成过程始终携带着参考图的结构信息。


针对文字生成问题,思路是类似的。文字的高层语义实际上已经把字形信息模糊掉了,但生成任务要求输出的是那个精确的字符。所以我们会专门提取文字生成的底层视觉特征,并把这个底层特征拼接到 meta query 中作为控制条件,用这种方式来引导文字的精确生成。

在这些补丁都打完之后,我们的生成任务在学术指标上达到了业界 SOTA,同时也达到了业界可落地应用的效果。

接下来是语音部分。语音理解和生成的统一方案也是类似的思路:基于全模态理解的 backbone,在上面增加扩散模型的 head。但我们与传统方案的一个核心区别在于,我们把语音的信息划分成了三个通道。第一个通道是 speech,承载具体的文字和语义信息,这些是可以通过 ASR 转化为文字的。第二个通道是 sound,承载背景环境音,比如风声、雨声、街道的噪音,这些信息没有办法通过 ASR 转写成文字来表达。第三个通道是 music,承载音乐信息。这三种不同类型的音频信息,我们在同一个扩散 head 里直接解码,这样生成的语音就能真正做到“声临其境”——不仅有人说话的声音,还有环境背景音和音乐。


在这个架构基础上,我们针对语音生成重点优化了三个方面的能力。第一个是方言控制,根据一段指定的语音样本,把说话人的音色直接克隆出来,说出地道的粤语和四川话,让他能够表达任何我们想要的语音内容,而不仅仅是原样本中的那句话。第二个是情感控制,可以通过指令的方式让语音表达带有喜怒哀乐等不同的情感色彩。第三个是自定义音色设计,用户可以用一个三岁小孩的声音表达,也可以用一个中年大叔的声音,或者一个老人的声音来表达,我们内置了超过一百种可定制的音色,都可以通过指令来控制。在这三个特色能力之下,是我们在基础能力上的突破——语音合成过程中同时生成 speech、sound 和 music,把氛围音、人声和背景音融合在一起输出。

把上述这些全部整合到一起,全模态理解框架加上任务统一的理解与生成能力,就是我们名系列的完整模型。它是业界首个在模态覆盖上能够全面对标 GPT-4o 的开源模型,能看、能听、能说、能画。在各个模态的理解能力上,我们的统一模型对标的是各模态单独训练的专业模型效果。在生成效果上,也同样能与业界专门的生成模型做对标。


沿着 scaling 的思路,我们进一步思考了一个问题。语言模型上的 scaling law 已经被广泛验证了,但在当前这个统一的多模态架构下,我们是不是能通过把 MOE 做得更大,让全模态的理解和生成效果同步提升?基于这个想法,我们研发了 Ming-flash-omni,它是业界首个开源千亿参数规模的全模态统一大模型。实验结果验证了我们的判断,把模型进一步 scale 之后,很多指标上都出现了非常快速的提升。我们的百 B 模型在理解任务上,跟 GPT-4o 和各个专家模型的效果都是可比的。这意味着我们完全可以只用一个统一的模型,就能实现多个专家模型才能覆盖的能力范围,并没有因为要做全模态统一而在任何一个专业能力上做出妥协。


5 表征级统一:从模型级到表征级的范式探索

在模型级统一之外,我们有一个坚定的技术判断:任务统一的未来方向,一定是走向表征级统一。在表征级统一这一块,我们也做了初步的探索和开源工作。这项工作的结果在去年十月份就已经开源了,分别是 MingTok 和 MingTok-Audio 这两个项目。


有意思的是,这两个项目在技术范式上高度一致。我们首先在图像生成上验证了一个基于统一 token learner 的方案,发现它的确能够实现理解与生成在表征层面的统一。然后,我们把这个在图像生成上验证成功的范式,迁移到了语音生成领域,发现它竟然也是 work 的。这个结果对于我们来说意义重大,因为它意味着语音和图像可以使用完全相同的范式来实现统一表征。

这个范式的核心可以归纳为三个要点。第一,我们坚持用连续表征来对理解任务和生成任务统一建模。如果用离散表征,理解任务会有信息损失,生成任务的效果也会受到影响。所以连续表征是前提。第二,在统一 token learner 中,我们链接了两种不同层级的表征,高维的语义表征和低维的隐空间表征。低维的隐空间表征用来做模型生成端的自回归输出,高维的语义表征用来做模型的输入。第三,我们设计了一个变换模块来做桥梁,实现 latent 表征和 semantic 表征之间的互相迁移。通过这种范式,我们用同一个框架,把音频和图像的理解与生成任务全部都统一了起来,而且在效果上都达到了学术 SOTA。

这个工作的意义在于,它证明了一个统一的表征框架是可以同时覆盖音频和图像两个模态的理解与生成任务的。目前我们正在持续推进这项工作在 model scaling 和 data scaling 两个方向上的进展,期望未来能从根本上解决理解与生成在表征层面的冲突。

6 全模态训练工程优化

全模态统一大模型的第三个核心挑战,是工程层面的。当我们真正把音频、视频、图片、文本这些模态放在一起训练时,数据异构和模型异构带来的工程问题非常突出。

数据异构方面,不同模态的序列长度差异巨大。模型异构方面,各类 encoder、decoder 与 MOE 本体在计算量上的不匹配,会导致在 pipeline 并行的训练过程中产生大量的计算 bubble,严重影响训练效率。针对这两个问题,我们做了系统性的工程优化。

针对数据异构,我们构建了一套全模态序列 packing 方案。核心思想是,每个模态的数据经过各自的 encoder 之后,我们把所有模态的表征全部拼接在一起,最终输送给 MOE 模型的都是一段规整的、长度统一的序列。不同模态之间通过 cross-attention mask 等方式来实现隔离,确保信息不会跨模态混淆。

针对模型异构,核心痛苦在于 encoder、decoder 和 MOE 三者的计算量差异导致 pipeline bubble。encoder 的一次前向计算和反向计算,与 MOE 的一次前向反向计算,它们最优的并行策略是不一样的。如果强制所有组件使用同一种并行布局,就会在 pipeline 的不同位置产生大量的等待时间。我们的解决方案是把 encoder 前向、encoder 反向、MOE 这三段设置为三种不同的并行方式,然后给定一个线性规划的目标函数来求解最优的分布和并行布局。通过这种灵活并行策略,我们最终把全模态的训练效率在原有基础上提升了百分之六十七。此外,我们还做了一些常规的算子融合优化,配合灵活的并行策略,让三种组件的并行方式在约束条件下全局最优。


在模态统一、任务统一和工程优化三个维度的挑战都得到系统性解决之后,Ming-flash-omni 从去年开源至今,在社区受到了广泛关注。从 light 版本到 flash 版本的多个迭代,每个版本在 Hugging Face 上开源发布后,基本上在一周之内都会登上 Hugging Face trending 榜的榜首。

7 能力展示与应用生态

接下来通过几个具体的 demo 来展示一下模型的实际能力。

在语音合成方面,第一个能力是方言转换,通过文本指令就能让模型生成不同方言的语音表达。第二个是情感控制,模型能够在输出语音时带有细粒度的情感色彩。第三个是音色设计,给定一段文本,可以让模型用任意的音色来表达,比如用东北中年大叔的声音来演绎指定的内容。

在开源生态方面,我们也做了一些有趣的工作。我们开源了 Ming-flash-omni 相关的 skill,让 OpenClaw 能看、能听、能说、能画。实际上只需要在 OpenClaw 中加入 Ming-flash-omni 这一个 skill,就能把纯文本的个人助理升级为一个多模态助理。比如说,可以让 AI 管家用自然语言和用户互动,描述自己的旅行见闻,还能实时生成配图。我们也开放了 Ming-flash-omni 的 API,开发者可以直接用 OpenClaw 的 skill creator 去读 API 文档,生成自定义的 skill 部署到 OpenClaw 里面。我们还实现了一个 AI 相册美化 skill,核心流程是给定一张图片,模型生成多张编辑候选图,然后用 Ming-flash-omni 作为评判模型去评估每张图的美感,最终筛选出最具美感的图片。整个 skill 的代码实现,都是通过 Claude Code 来完成的。


以上就是这次分享的全部内容。我们系统介绍了构建全模态统一大模型过程中面临的模态统一、任务统一和工程优化三大核心挑战,以及 Ming-flash-omni 在各个维度上的解决方案和实践成果。

作者介绍

郭清沛,蚂蚁集团高级算法专家,负责蚂蚁百灵 Ming 系列全模态模型(https://huggingface.co/inclusionAI/Ming-flash-omni-2.0 )研发,在多模态领域有丰富研发经验,发表 CVPR/ICCV/ICML/NIPS 等顶会议发表文章近 30 篇,授权国内外专利近 40 项。

会议推荐

2026 年 AICon 人工智能开发与应用大会 · 深圳站将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。大会限时 9 折优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
李在明下令:将当前情况视为“国家灾难状态”

李在明下令:将当前情况视为“国家灾难状态”

新京报
2026-08-04 13:00:25
李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

李连杰一家三口拜见仁波切,64岁利智许久不见,颜值回春如昔日!

娱乐团长
2026-06-02 15:09:12
梅赛德斯CEO康林松亲自回应车内大屏争议

梅赛德斯CEO康林松亲自回应车内大屏争议

晚风知我意21
2026-08-04 21:43:07
英超:拉什福德的最后机会?卡里克态度明显

英超:拉什福德的最后机会?卡里克态度明显

消保宣教
2026-08-05 00:05:05
南华大学两任校长25天相继落马,高校"一把手"权力边界在哪?

南华大学两任校长25天相继落马,高校"一把手"权力边界在哪?

智胜律法
2026-08-03 20:38:53
29 岁郑州小伙凌晨自杀,独子遗言曝光,全网泪崩!

29 岁郑州小伙凌晨自杀,独子遗言曝光,全网泪崩!

骑着蜗牛追导弹85
2025-04-12 12:06:33
丧天良!赖清德叫嚣:台日台风地震不可怕,可怕是大陆侵扰与胁迫

丧天良!赖清德叫嚣:台日台风地震不可怕,可怕是大陆侵扰与胁迫

阿天爱旅行
2026-08-05 04:22:08
48天停战假象彻底粉碎!伊朗打破百年战争潜规则:不打美军,专盯美国高层全家

48天停战假象彻底粉碎!伊朗打破百年战争潜规则:不打美军,专盯美国高层全家

浪子的烟火人间
2026-08-03 10:58:16
《智能网联汽车 自动驾驶系统安全要求》强制性国家标准正式发布

《智能网联汽车 自动驾驶系统安全要求》强制性国家标准正式发布

界面新闻
2026-08-04 16:32:04
建行试行午休,12:30~14点人工休息,每天仅对外工作6.5小时,评论区:把钱取出来,让它倒闭算了!

建行试行午休,12:30~14点人工休息,每天仅对外工作6.5小时,评论区:把钱取出来,让它倒闭算了!

谭谈社会
2026-08-04 08:19:10
田永明今天被执行死刑 强奸大嫂出狱后又杀人

田永明今天被执行死刑 强奸大嫂出狱后又杀人

看看新闻Knews
2026-04-28 15:44:15
钱再多有啥用?女排教父袁伟民的现状,给所有中老年人提了个醒

钱再多有啥用?女排教父袁伟民的现状,给所有中老年人提了个醒

皮皮电影
2026-07-27 13:35:53
知名歌手54岁再当爸,中年得子喜获二胎

知名歌手54岁再当爸,中年得子喜获二胎

暖心萌阿菇凉
2026-08-04 22:36:55
苏州又一家“胖东来模式”超市开业!实地逛超市的好日子来了

苏州又一家“胖东来模式”超市开业!实地逛超市的好日子来了

椰青美食分享
2026-08-04 15:34:13
恐惧笑声的巨物,容不下一只竹知了……

恐惧笑声的巨物,容不下一只竹知了……

家传编辑部
2026-08-05 01:56:16
马斯克拿下豆包,震惊全网!

马斯克拿下豆包,震惊全网!

财经三分钟pro
2026-08-03 11:22:30
明孝宗朱佑樘:中国五千年帝王史的唯一奇迹!仅此一人再无复刻

明孝宗朱佑樘:中国五千年帝王史的唯一奇迹!仅此一人再无复刻

新车知多少
2026-08-04 05:54:40
银行“反内卷”,建行一家分行火了:员工午休1.5小时,暂停全部人工柜面服务!业内人士:过去几十年大家不午休,是因为谁都不敢第一个休

银行“反内卷”,建行一家分行火了:员工午休1.5小时,暂停全部人工柜面服务!业内人士:过去几十年大家不午休,是因为谁都不敢第一个休

每日经济新闻
2026-08-03 22:40:06
泽连斯基宣布战争结束时间,几个月后,普京将求着停战

泽连斯基宣布战争结束时间,几个月后,普京将求着停战

触摸史迹
2026-08-05 04:57:34
乌克兰之所以能够走到今天,罪魁祸首不是北约,不是欧盟

乌克兰之所以能够走到今天,罪魁祸首不是北约,不是欧盟

安安说
2026-07-31 11:33:50
2026-08-05 05:52:49
InfoQ incentive-icons
InfoQ
有内容的技术社区媒体
12752文章数 52015关注度
往期回顾 全部

科技要闻

Anthropic老板急了:挖来的人,可能只为钱

头条要闻

说出"冯院长挺喜欢你"的局长被停职 涉事冯院长发声

头条要闻

说出"冯院长挺喜欢你"的局长被停职 涉事冯院长发声

体育要闻

斯卢茨基告别申花:1座城市和14亿份难忘的回忆

娱乐要闻

李荣浩《小眼睛》被指抄袭,撤销署名

财经要闻

美国盯上了中国光模块

汽车要闻

方程S系列将于成都车展发布内饰 9月上旬新车上市即交付

态度原创

旅游
教育
亲子
家居
军事航空

旅游要闻

跨越世代的守候,里坎瀑布的传说,读懂边地民族对爱与别离的理解

教育要闻

县城老师 便宜好吃的零食

亲子要闻

小奥特曼明白了要长高高就要好好吃饭

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普威胁对伊朗采取"斩首"行动:这是最后一次机会

无障碍浏览 进入关怀版