网易首页 > 网易号 > 正文 申请入驻

刚刚,小米又开源一大模型,22个公开测评SOTA

0
分享至

智东西8月4日消息,刚刚,小米公司正式开源声音理解大模型MiDashengLM-7B。其声音理解性能在22个公开评测集上刷新多模态大模型最好成绩(SOTA),单样本推理的首Token延迟(TTFT)为业界先进模型的1/4,同等显存下的数据吞吐效率是业界先进模型的20倍以上。

具体来看,MiDashengLM-7B基于Xiaomi Dasheng作为音频编码器Qwen2.5-Omni-7B Thinker作为自回归解码器,通过通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解。

此前小米于2024年首次发布Xiaomi Dasheng声音基座模型,此次开源的7B模型是该模型的扩展。目前该系列模型在小米智能家居、汽车座舱等领域有30多个落地应用。

小米称,音频理解是构建全场景智能生态的关键领域。MiDashengLM通过统一理解语音、环境声与音乐的跨领域能力,不仅能听懂用户周围发生了什么事情,还能分析发现这些事情的隐藏含义,提高用户场景理解的泛化性。

MiDashengLM的训练数据由100%公开数据构成。

GitHub主页:
https://github.com/xiaomi-research/dasheng-lm
技术报告:
https://github.com/xiaomi-research/dasheng-lm/tree/main/technical_report
模型参数(Hugging Face):
https://huggingface.co/mispeech/midashenglm-7b
模型参数(魔搭社区):
https://modelscope.cn/models/midasheng/midashenglm-7b
网页Demo:
https://xiaomi-research.github.io/dasheng-lm
交互Demo:
https://huggingface.co/spaces/mispeech/MiDashengLM

一、支持跨场景音频理解能力,音频编码器多项关键测试超越Whisper

MiDashengLM在音频描述、声音理解、音频问答任务中有比较明显的优势:

▲音频描述任务性能(FENSE指标)

在音频描述任务中,MiDashengLM-7B比Qwen、Kimi同类7B模型性能更强。

▲声音理解任务性能

在声音理解任务中,MiDashengLM-7B除FMA、VoxCeleb-Gender项目均领先于Qwen的7B模型,与Kimi的7B模型相比,仅有VoxCeleb-Gender项目略微落后。

▲语音识别任务性能(WER/CER指标)

在语音识别任务中,MiDashengLM-7B的主要优势在于GigaSpeech 2,在其他两组测试中Qwen和Kimi有一定优势。

▲音频问答任务性能

其中,Xiaomi Dasheng音频编码器是MiDashengLM音频理解能力的重要来源。在用于评估编码器通用能力的X-ARES Benchmark上,Xiaomi Dasheng在多项关键任务上优于作为Qwen2.5-Omni、Kimi-Audio等模型音频编码器的Whisper。

▲音频编码器在X-ARES Benchmark上的分数对比

除了声音理解,Xiaomi Dasheng还可以用于音频生成任务,如语音降噪、提取和增强。

二、推理效率提升,单样本4倍加速与百倍并发支持

MiDashengLM的训练和推理效率是其另一项优势。对于单个样本推理的情形,即batch size为1时,MiDashengLM的首个token预测时间(TTFT)为Qwen2.5-Omni-7B的1/4。

批次处理时,在80GB GPU上处理30秒音频并生成100个token的测试中,MiDashengLM可以把batch size设置为512,而Qwen2.5-omni-7B在batch size设置为16时即出现显存溢出(OOM)。

▲Batch size=1时TTFT和GMACS指标对比

在实际部署中,MiDashengLM在同等硬件条件下可支持更多的并发请求量,降低计算成本。

▲80G显存环境下模型每秒可处理的30s音频个数

这背后,MiDashengLM基于Xiaomi Dasheng架构,在维持音频理解核心性能指标基本持平的前提下,通过优化音频编码器设计,将其输出帧率从Qwen2.5-Omni的25Hz降至5Hz,降幅80%,降低了计算负载并实现了推理效率提升。

三、训练范式改变:从碎片化转录到全局语义刻画

MiDashengLM采用通用音频描述对齐范式,避免了用ASR转录数据对齐仅关注语音内容而丢弃环境声音和音乐信息,且无法捕捉说话人情感、空间混响等关键声学特征的局限,通用描述对齐策略通过非单调的全局语义映射,迫使模型学习音频场景的深层语义关联。

该方法可以使用几乎所有的数据,包括噪声或非语音内容,而基于ASR转录的方法会丢弃非语音数据如环境声或音乐,导致数据利用率低下,基于ASR的对齐方法在ACAV100M-Speech数据集上会损失90%潜在有用数据。

▲MiDashengLM训练框架

MiDashengLM的训练数据通过多专家分析管道生成:首先对原始音频使用各种专家模型作语音、人声、音乐和环境声学的细粒度标注,包括使用Dasheng-CED模型预测2秒粒度的声音事件,再通过DeepSeek-R1推理大模型合成统一描述。

全部训练数据的原始标签在预训练中被弃用,只采用利用上述流程生成的新的丰富文本描述标签,以迫使模型学习更丰富全面的声音信息。

其中,来自ACAV100M的开源数据集经过上述流程重新标注后,形成了新的ACAVCaps训练集和MECAT Benchmark。MECAT Benchmark已于近期开源,ACAVCaps数据集将在ICASSP论文评审后开放下载。

▲ACAVCaps训练数据集构建流程

四、全栈开源,透明可复现

此次MiDashengLM训练数据100%来自公开数据集,涵盖五类110万小时资源,包括语音识别、环境声音、音乐理解、语音副语言和问答任务等多项领域。

MiDashengLM完整公开了77个数据源的详细配比,技术报告公开了从音频编码器预训练到指令微调的全流程。

据官方信息,小米已开始对Xiaomi Dasheng系列模型做计算效率的升级,寻求终端设备上可离线部署。

结语:小米音频大模型再拱一卒,多模态能力拼图日趋完善

作为影响自然语言交互体验的关键技术之一,小米Xiaomi Dasheng系列模型此次的升级,对其提升自家设备的AI交互体验有一定帮助,从智能家居、智能汽车到智能手机,各类产品均能受益。

AI多模态是当下业界主攻的方向之一,小米重心转向造车后,在AI大模型领域发声并不多,小米未来在多模态领域能否带来更多模型创新,值得期待。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上海市第三女子中学原党委书记王悦成因病逝世,享年67岁

上海市第三女子中学原党委书记王悦成因病逝世,享年67岁

澎湃新闻
2026-08-11 11:08:27
5位前首相集体倒戈,痛骂高市早苗:对华无策略,对美只知谄媚

5位前首相集体倒戈,痛骂高市早苗:对华无策略,对美只知谄媚

健身狂人
2026-08-10 00:50:07
宁波公安回应“网红雅典娜遇害”:报道截图系反诈宣传片引用的网络资料 案件非宁波公安办理

宁波公安回应“网红雅典娜遇害”:报道截图系反诈宣传片引用的网络资料 案件非宁波公安办理

红星新闻
2026-08-11 13:43:19
攻击俄炼油厂致近百人死伤!大型军用油库被炸,前线俄军严重缺油

攻击俄炼油厂致近百人死伤!大型军用油库被炸,前线俄军严重缺油

鹰眼Defence
2026-08-11 17:23:43
内蒙古一辆警车价值百万,却贴着国产车标,糊弄谁呢?

内蒙古一辆警车价值百万,却贴着国产车标,糊弄谁呢?

News脑洞
2026-08-11 16:19:41
不装了,百花奖没到手,当场“甩脸”的杨幂,不再顾及所谓的体面

不装了,百花奖没到手,当场“甩脸”的杨幂,不再顾及所谓的体面

阿笎评论哥
2026-08-11 14:06:17
内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

Mr王的饭后茶
2026-08-11 10:55:29
逼走胖东来的幕后人曝光!漫天要价不惯着,于东来一动作让他闭嘴

逼走胖东来的幕后人曝光!漫天要价不惯着,于东来一动作让他闭嘴

皮蛋儿电影
2026-08-11 21:43:02
俄罗斯唯一公开反对俄乌战争的苹果党被禁止参选!引发大规模抗议

俄罗斯唯一公开反对俄乌战争的苹果党被禁止参选!引发大规模抗议

项鹏飞
2026-08-11 20:11:41
8月11俄乌最新:令人不安的曲线

8月11俄乌最新:令人不安的曲线

西楼饮月
2026-08-11 18:30:49
细思极恐!930万人超大型研究证实:99.6%的心脏病发作,都和这4项有关!

细思极恐!930万人超大型研究证实:99.6%的心脏病发作,都和这4项有关!

趣味探索
2026-08-09 23:41:52
风暴眼 | 曾年销超76万的神车,要退场了

风暴眼 | 曾年销超76万的神车,要退场了

凤凰网财经
2026-08-10 18:58:21
科学周刊 | 现代科技如何“解封”2300多年前的战国秦酒?淡蓝色的液体,保存有7斤多,一共检测到了2400多种化合物,味道嘛……

科学周刊 | 现代科技如何“解封”2300多年前的战国秦酒?淡蓝色的液体,保存有7斤多,一共检测到了2400多种化合物,味道嘛……

大风新闻
2026-08-11 20:12:05
WTT瑞典大满贯:男单头号种子一轮游!莫雷加德0-3惨败止步64强

WTT瑞典大满贯:男单头号种子一轮游!莫雷加德0-3惨败止步64强

全言作品
2026-08-12 01:56:03
特朗普下令斩首哈梅内伊时,绝对想不到,会因恐惧躲在食品卡车里

特朗普下令斩首哈梅内伊时,绝对想不到,会因恐惧躲在食品卡车里

西楼知趣杂谈
2026-08-11 20:37:48
斯诺克中国公开赛太残酷:随着赵心童5-6,已有6大名将遭遇一轮游

斯诺克中国公开赛太残酷:随着赵心童5-6,已有6大名将遭遇一轮游

侧身凌空斩
2026-08-12 00:06:40
广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

米果说识
2026-08-11 10:12:53
上海暴雨,浇醒的不只是房价,更是“伪中产”的体面

上海暴雨,浇醒的不只是房价,更是“伪中产”的体面

茶韵浮生
2026-08-11 18:47:10
雅典娜容貌出众,绑匪为何宁愿撕票,也不倒卖牟利?

雅典娜容貌出众,绑匪为何宁愿撕票,也不倒卖牟利?

社会日日鲜
2026-08-11 16:15:26
GDP增速狂飙30.2%,“下一个深圳”要来了?

GDP增速狂飙30.2%,“下一个深圳”要来了?

智谷趋势
2026-08-11 16:03:06
2026-08-12 04:56:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12412文章数 117149关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

头条要闻

网红"雅典娜"失踪3年 好友:她被李姓女网友诱骗至境外

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

时尚
家居
亲子
数码
本地

时速60公里,“慢”车去南非

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

一定要让孩子知道,朋友是流动的!

数码要闻

苹果Apple Arcade下月新增两款益智游戏

本地新闻

黄州一夜,苏轼写给普通人的月光

无障碍浏览 进入关怀版