网易首页 > 网易号 > 正文 申请入驻

超过1B参数都是浪费?多模态情感模型进入「小」时代 | ACM MM'26

0
分享至


新智元报道


多模态大语言模型正在改变情感识别的研究范式。

与传统方法只输出「高兴」「悲伤」或「愤怒」等预定义标签不同,新一代生成式多模态情感识别模型能够联合理解视频、音频和文本,并用自然语言解释人物的情感状态及其判断依据。

但这种能力通常建立在更大的模型规模之上。现有代表性方法大多依赖至少7B参数的语言模型,不仅需要较高的显存和计算资源,也带来了更长的推理延迟,难以部署到机器人、移动设备和其他边缘平台。

这引出了一个根本问题:

为了实现高质量的多模态情感理解与识别,我们真的需要参数规模超过1B的模型吗?

来自格拉斯哥大学、山东大学和中国科学院计算技术研究所的研究者在论文Light-MER中对这一假设提出了挑战,他们将8B教师模型的多模态情感理解能力迁移至参数规模低于1B的学生模型,并通过隐藏状态蒸馏与多奖励强化学习,在显著降低计算开销的同时,实现了超过教师模型的平均性能。

论文已被ACM Multimedia 2026(ACM MM 2026)主会接收


论文链接:https://arxiv.org/pdf/2607.12787

代码链接:https://github.com/GAIR-Lab/Light-MER

该论文主要包含以下三个亮点:

  1. 构建参数规模低于1B的生成式多模态情感模型。Light-MER将大规模教师模型压缩为总参数量约854.93M的学生模型,在参数量与FLOPs均降低约11倍的情况下,平均性能超过8B教师模型。

  2. 提出基于切片Wasserstein距离的隐藏状态蒸馏方法SWD-H。与只对齐输出概率或逐点拟合隐藏状态不同,SWD-H从分布几何的角度迁移教师模型内部的多模态情感表示。

  3. 提出面向生成质量与推理效率的多奖励优化方法M-GRPO。该方法同时考虑情感识别准确性、回答长度、情感信息密度、句子完整性和重复程度,使学生模型生成更简洁、更流畅的情感描述,并进一步降低推理延迟。


为什么要把多模态情感模型做小?

多模态情感识别的许多应用并不发生在云端服务器,而是机器人、智能座舱、移动终端等需要即时交互的设备。这些系统需要持续处理人脸、声音和文本,并在较短时间内作出判断。

7B以上的模型虽然具备较强的情感理解和生成能力,但也需要更多显存和计算资源。若每次识别都依赖高端GPU或将视音频上传至云端,不仅会增加响应延迟,也容易受到设备算力和网络条件的限制。

因此,小模型的意义不只是「节省计算量」,而是让多模态情感识别能够更接近实际使用场景:降低硬件门槛、缩短交互等待时间,并为弱网或本地处理提供可能。

Light-MER并不要求训练阶段完全放弃大模型,而是将大模型保留为知识来源,最终只部署低于1B参数的学生模型。它真正想回答的是:能否在大幅降低部署成本的同时,保留生成式多模态情感理解能力?


Light-MER如何保留多模态情感理解能力?

Light-MER采用教师—学生框架。

8B教师模型只在训练阶段使用,负责提供较强的多模态情感理解能力;真正用于推理和部署的是参数规模约854M的学生模型。

知识迁移分为两步。

第一步是SWD-H

常见蒸馏方法主要让学生模仿教师的最终输出,但对于情感识别而言,真正重要的不只是「答案是什么」,还有模型如何组织表情、声音和文本中的情感线索。

SWD-H使用切片Wasserstein距离对齐教师与学生的隐藏状态分布,让学生学习教师模型内部的情感表示结构,而不是只复制最终答案。

第二步是M-GRPO

蒸馏后的学生虽然会判断情绪,但也可能继承教师模型过于冗长的表达方式。M-GRPO同时考虑情感准确性、回答长度、情感信息密度、句子完整性和重复程度,让输出更简洁,也减少不必要的生成时间。


Light-MER的核心思路:大模型只负责提供知识,低于1B参数的学生模型负责实际部署。


为什么选择SWD-H

常见的知识蒸馏方法通常让学生模型模仿教师模型的输出概率。但论文发现,这种方法在生成式情感识别中存在一个问题:教师模型的输出分布非常集中,排名第一的token已经占据约98%的概率。

在这种情况下,学生从输出概率中获得的信息与普通标签监督相差不大。它能学到教师给出了什么答案,却很难学到教师如何综合表情、声音和文本中的情感线索。

相比之下,隐藏状态保留了更丰富的多模态信息。但如果直接使用均方误差逐点对齐,又容易忽略教师与学生在表示空间中的整体分布差异。

因此,Light-MER提出了SWD-H。它将教师和学生的高维隐藏状态投影到多个一维方向,再通过排序计算Wasserstein距离,使学生学习教师隐藏状态的整体分布形状。

换句话说,普通蒸馏主要让学生模仿教师的答案,而SWD-H进一步让学生学习教师组织多模态情感信息的方式。


SWD-H蒸馏前后的隐藏状态分布。蒸馏前,教师与学生模型的分布位置存在明显差异;加入SWD-H后,两者的主要分布模式更加接近,表明学生模型有效学习了教师模型内部的情感表示结构。


为什么还需要M-GRPO

SWD-H能够迁移教师模型的情感理解能力,但也可能把教师模型过于冗长的表达方式一并迁移给学生。

对于生成式情感识别而言,回答越长并不一定越好。模型可能反复描述相同线索,或者生成大量与最终判断关系不大的内容。这不仅影响信息密度,也会增加推理时间。

如果只以情感识别准确率作为优化目标,模型还可能通过罗列大量情感词来获得更高分数,却无法保证回答是否简洁、完整和自然。

因此,Light-MER在完成SWD-H蒸馏后,进一步引入了M-GRPO。对于同一个样本,模型生成多个候选回答,再根据综合奖励比较这些回答的质量。奖励同时考虑五个方面:

  • 情感判断是否准确;

  • 回答长度是否合理;

  • 情感信息是否足够集中;

  • 句子表达是否完整;

  • 内容是否存在重复。

M-GRPO的目标并不是简单地让模型「少说」,而是让它在保留关键情感信息的同时,减少冗余内容。

从训练曲线可以看到,总奖励在训练前期快速提升并逐渐稳定;与此同时,情感分析部分的生成长度持续下降,并在训练后期收敛至约53个英文单词。这说明模型正在逐步学习更加集中、高效的表达方式。


M-GRPO的训练过程。随着训练推进,总奖励逐渐提升并趋于稳定,情感分析的生成长度则持续下降,说明模型在保持情感判断质量的同时,学会了更加简洁的表达。

因此,两个阶段解决了不同的问题:SWD-H负责迁移大模型内部的多模态情感表示,M-GRPO则进一步优化学生模型的生成质量和推理效率。


<1B对决8B小模型真的能超过老师吗?

论文在九个公开数据集上进行了实验,覆盖基础情感识别、情感倾向分析和开放词汇细粒度情感识别。

最主要的结论是:在完整的视频、音频和文本输入下,Light-MER的九数据集平均分达到74.61,超过8B教师模型的73.93,并在其中七个数据集上取得更好的结果。

在「音频+文本」和「视频+文本」两种输入设置下,Light-MER 的平均性能同样超过教师模型。这说明其效果并不依赖某一种固定的模态组合。


Light-MER在三种模态设置下均超过8B教师模型的平均性能


学生不必止步于老师知识蒸馏也能实现性能反超

知识蒸馏常被理解为一种性能妥协:学生模型更小、更快,但通常只能尽可能接近教师模型。

Light-MER的实验结果展示了另一种可能性。

学生模型并不是机械地复制教师的输出,而是通过SWD-H学习教师模型隐藏状态中的分布结构,再通过M-GRPO对生成行为进行重新优化。

因此,学生模型一方面继承了教师模型的多模态情感理解能力,另一方面也修正了教师模型输出过长、信息密度不足的问题。

从这个角度看,教师模型更像是能力来源,而不是学生模型性能的上限。

只要知识迁移目标设计合理,小模型不仅可以接近大模型,还可能在特定任务和部署目标下超过大模型。

从性能到部署:Light-MER有多轻量?

相比教师模型,Light-MER的参数量和FLOPs均减少约11倍,峰值显存从20.04GB降至2.54GB

在论文的测试环境下,模型直接输出情感标签约需0.52秒/样本;如果生成完整的情感解释,约需3.11秒/样本。

这两个数字可以这样理解:

  • 直接识别模式已经达到亚秒级响应,适合对短视频片段进行交互式情感判断;

  • 描述生成模式属于秒级响应,可以用于机器人对话、人机交互等对延迟相对宽容的场景;

从2.54GB的峰值显存来看,Light-MER已经不再依赖20GB级高端GPU。理论上,具备约4GB显存的设备已有运行空间;考虑系统和推理框架的额外开销,使用6GB及以上显存的消费级GPU或嵌入式边缘计算平台会更稳妥。

从20.04GB到2.54GB:Light-MER将生成式多模态情感识别从高端GPU推向了更轻量的边缘计算平台。

过去几年,多模态情感识别不断受益于更大的语言模型。模型规模从7B、8B继续增长,似乎已经成为获得更强生成和推理能力的自然路径。

Light-MER则重新审视了这一默认前提。

通过SWD-H,模型将8B教师模型内部的多模态情感表示迁移到低于1B参数的学生模型;通过M-GRPO,模型进一步学会生成更加简洁、流畅且忠于情感判断的描述。

最终,Light-MER在九个基准数据集上的平均性能超过8B教师模型,同时将参数量和FLOPs减少约11倍,将峰值显存从20.04GB降低至2.54GB。

因此,对于文章开头提出的问题——

我们真的需要超过1B参数的模型,才能实现高质量的多模态情感识别吗?

Light-MER给出的答案是:

不一定。与单纯扩大模型规模相比,如何有效迁移和优化模型内部的多模态知识,可能更加关键。

参考资料:

https://arxiv.org/pdf/2607.12787

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上亿身家一夜归零

上亿身家一夜归零

梳子姐
2026-08-01 20:55:28
赞达亚戴3000年历史耳环为《奥德赛》站台,引考古界批评

赞达亚戴3000年历史耳环为《奥德赛》站台,引考古界批评

澎湃新闻
2026-08-01 16:42:27
特朗普赞叹:伊朗确实挺硬气

特朗普赞叹:伊朗确实挺硬气

扬子晚报
2026-08-01 18:53:49
华尔街00后“AI股神”高杠杆爆仓出局,亏损超2800亿元!抛售后第二天就暴涨,原定本周末结婚

华尔街00后“AI股神”高杠杆爆仓出局,亏损超2800亿元!抛售后第二天就暴涨,原定本周末结婚

都市快报橙柿互动
2026-08-01 10:51:09
千年难遇的美人,太漂亮了,没有一点毛病,太完美了

千年难遇的美人,太漂亮了,没有一点毛病,太完美了

手工制作阿歼
2026-08-02 03:16:29
德国、意大利、比利时、捷克、丹麦、希腊、立陶宛、荷兰、瑞典等22国领导人,签联名信

德国、意大利、比利时、捷克、丹麦、希腊、立陶宛、荷兰、瑞典等22国领导人,签联名信

扬子晚报
2026-08-01 21:37:42
又蠢又坏,恨国党拿出了王炸

又蠢又坏,恨国党拿出了王炸

一个坏土豆
2026-08-01 19:13:31
房贷余额暴减7163亿,一场无声的楼市逃亡

房贷余额暴减7163亿,一场无声的楼市逃亡

谢晖说房
2026-08-01 21:24:32
果然很“精神”!山西一医院精神科主任医师公示照片刷屏!网友调侃:一时分不清谁是医生,谁是患者了

果然很“精神”!山西一医院精神科主任医师公示照片刷屏!网友调侃:一时分不清谁是医生,谁是患者了

火山詩话
2026-08-01 10:47:18
40岁演员周瑞聊横店现状:去年日薪3万,今年80块抢戏还要靠运气

40岁演员周瑞聊横店现状:去年日薪3万,今年80块抢戏还要靠运气

艺能八卦局
2026-07-31 22:45:50
王虹的“神仙同事”圈震惊全网!整个研究所仅7人,全是世界级大师,韦神只能作“小弟”

王虹的“神仙同事”圈震惊全网!整个研究所仅7人,全是世界级大师,韦神只能作“小弟”

火山詩话
2026-08-01 21:22:16
航空公司不满携程返还天价退票,如此霸道的底气何来?

航空公司不满携程返还天价退票,如此霸道的底气何来?

极目新闻
2026-08-01 15:16:23
出入境管理新规,透露了什么信号!

出入境管理新规,透露了什么信号!

凤眼论
2026-08-01 14:50:05
明面上没有任何违规,却惹得全民反感,养老金这事撕开了现实痛点

明面上没有任何违规,却惹得全民反感,养老金这事撕开了现实痛点

小嵩
2026-08-01 17:04:01
湖南一公职人员停车受阻撬他人停车位地锁,警方等部门介入调查

湖南一公职人员停车受阻撬他人停车位地锁,警方等部门介入调查

上游新闻
2026-08-01 21:42:05
连云港火灾母亲重伤女儿身亡,消防回应3条质疑,每条都让人沉默

连云港火灾母亲重伤女儿身亡,消防回应3条质疑,每条都让人沉默

阿裤趣闻君
2026-08-01 15:40:18
张宇祥任上海市嘉定区代区长 高香辞去区长职务

张宇祥任上海市嘉定区代区长 高香辞去区长职务

中国经济网
2026-07-30 09:40:41
这条新闻在今天看来,讽刺至极!

这条新闻在今天看来,讽刺至极!

胖胖说他不胖
2026-08-01 09:55:15
深夜利好!11家A股业绩增长,6家直接翻倍最高979%,高盛抄底3家

深夜利好!11家A股业绩增长,6家直接翻倍最高979%,高盛抄底3家

长风价值掘金
2026-08-01 21:52:19
两球领先都不赢,皇马遭意甲劲旅2-2逼平,63岁穆帅无缘上任2连胜

两球领先都不赢,皇马遭意甲劲旅2-2逼平,63岁穆帅无缘上任2连胜

侧身凌空斩
2026-08-02 01:50:09
2026-08-02 07:36:49
呼呼历史论
呼呼历史论
分享有趣的历史
854文章数 17703关注度
往期回顾 全部

科技要闻

特斯拉拆不掉中国制造

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

头条要闻

德意等22国领导人紧急签联名信 西班牙首相反怼:自私

体育要闻

1米76的他,为什么是史上最强中卫之一?

娱乐要闻

韩路批董宇辉“又当又立”?

财经要闻

长鑫科技四万亿市值背后的资本与周期

汽车要闻

历史性里程碑时刻 零跑7月交付达101267台

态度原创

教育
艺术
数码
手机
公开课

教育要闻

国网信通招计算机科学与技术、通信工程!专科+专升本+央企..

艺术要闻

这真的是素描?不是黑白照片?每一根毛发都在呼吸,放大一百倍都找不到一条废线!

数码要闻

PC涨价停不下来!宏碁高管:第三季度再涨5%

手机要闻

曝小米手机今晚涨价300元起,影响小米17系列、K90、Turbo 5

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版