![]()
新智元报道
![]()
多模态大语言模型正在改变情感识别的研究范式。
与传统方法只输出「高兴」「悲伤」或「愤怒」等预定义标签不同,新一代生成式多模态情感识别模型能够联合理解视频、音频和文本,并用自然语言解释人物的情感状态及其判断依据。
但这种能力通常建立在更大的模型规模之上。现有代表性方法大多依赖至少7B参数的语言模型,不仅需要较高的显存和计算资源,也带来了更长的推理延迟,难以部署到机器人、移动设备和其他边缘平台。
这引出了一个根本问题:
为了实现高质量的多模态情感理解与识别,我们真的需要参数规模超过1B的模型吗?
来自格拉斯哥大学、山东大学和中国科学院计算技术研究所的研究者在论文Light-MER中对这一假设提出了挑战,他们将8B教师模型的多模态情感理解能力迁移至参数规模低于1B的学生模型,并通过隐藏状态蒸馏与多奖励强化学习,在显著降低计算开销的同时,实现了超过教师模型的平均性能。
论文已被ACM Multimedia 2026(ACM MM 2026)主会接收。
![]()
论文链接:https://arxiv.org/pdf/2607.12787
代码链接:https://github.com/GAIR-Lab/Light-MER
该论文主要包含以下三个亮点:
构建参数规模低于1B的生成式多模态情感模型。Light-MER将大规模教师模型压缩为总参数量约854.93M的学生模型,在参数量与FLOPs均降低约11倍的情况下,平均性能超过8B教师模型。
提出基于切片Wasserstein距离的隐藏状态蒸馏方法SWD-H。与只对齐输出概率或逐点拟合隐藏状态不同,SWD-H从分布几何的角度迁移教师模型内部的多模态情感表示。
提出面向生成质量与推理效率的多奖励优化方法M-GRPO。该方法同时考虑情感识别准确性、回答长度、情感信息密度、句子完整性和重复程度,使学生模型生成更简洁、更流畅的情感描述,并进一步降低推理延迟。
为什么要把多模态情感模型做小?
多模态情感识别的许多应用并不发生在云端服务器,而是机器人、智能座舱、移动终端等需要即时交互的设备。这些系统需要持续处理人脸、声音和文本,并在较短时间内作出判断。
7B以上的模型虽然具备较强的情感理解和生成能力,但也需要更多显存和计算资源。若每次识别都依赖高端GPU或将视音频上传至云端,不仅会增加响应延迟,也容易受到设备算力和网络条件的限制。
因此,小模型的意义不只是「节省计算量」,而是让多模态情感识别能够更接近实际使用场景:降低硬件门槛、缩短交互等待时间,并为弱网或本地处理提供可能。
Light-MER并不要求训练阶段完全放弃大模型,而是将大模型保留为知识来源,最终只部署低于1B参数的学生模型。它真正想回答的是:能否在大幅降低部署成本的同时,保留生成式多模态情感理解能力?
Light-MER如何保留多模态情感理解能力?
Light-MER采用教师—学生框架。
8B教师模型只在训练阶段使用,负责提供较强的多模态情感理解能力;真正用于推理和部署的是参数规模约854M的学生模型。
知识迁移分为两步。
第一步是SWD-H。
常见蒸馏方法主要让学生模仿教师的最终输出,但对于情感识别而言,真正重要的不只是「答案是什么」,还有模型如何组织表情、声音和文本中的情感线索。
SWD-H使用切片Wasserstein距离对齐教师与学生的隐藏状态分布,让学生学习教师模型内部的情感表示结构,而不是只复制最终答案。
第二步是M-GRPO。
蒸馏后的学生虽然会判断情绪,但也可能继承教师模型过于冗长的表达方式。M-GRPO同时考虑情感准确性、回答长度、情感信息密度、句子完整性和重复程度,让输出更简洁,也减少不必要的生成时间。
![]()
Light-MER的核心思路:大模型只负责提供知识,低于1B参数的学生模型负责实际部署。
为什么选择SWD-H
常见的知识蒸馏方法通常让学生模型模仿教师模型的输出概率。但论文发现,这种方法在生成式情感识别中存在一个问题:教师模型的输出分布非常集中,排名第一的token已经占据约98%的概率。
在这种情况下,学生从输出概率中获得的信息与普通标签监督相差不大。它能学到教师给出了什么答案,却很难学到教师如何综合表情、声音和文本中的情感线索。
相比之下,隐藏状态保留了更丰富的多模态信息。但如果直接使用均方误差逐点对齐,又容易忽略教师与学生在表示空间中的整体分布差异。
因此,Light-MER提出了SWD-H。它将教师和学生的高维隐藏状态投影到多个一维方向,再通过排序计算Wasserstein距离,使学生学习教师隐藏状态的整体分布形状。
换句话说,普通蒸馏主要让学生模仿教师的答案,而SWD-H进一步让学生学习教师组织多模态情感信息的方式。
![]()
SWD-H蒸馏前后的隐藏状态分布。蒸馏前,教师与学生模型的分布位置存在明显差异;加入SWD-H后,两者的主要分布模式更加接近,表明学生模型有效学习了教师模型内部的情感表示结构。
为什么还需要M-GRPO
SWD-H能够迁移教师模型的情感理解能力,但也可能把教师模型过于冗长的表达方式一并迁移给学生。
对于生成式情感识别而言,回答越长并不一定越好。模型可能反复描述相同线索,或者生成大量与最终判断关系不大的内容。这不仅影响信息密度,也会增加推理时间。
如果只以情感识别准确率作为优化目标,模型还可能通过罗列大量情感词来获得更高分数,却无法保证回答是否简洁、完整和自然。
因此,Light-MER在完成SWD-H蒸馏后,进一步引入了M-GRPO。对于同一个样本,模型生成多个候选回答,再根据综合奖励比较这些回答的质量。奖励同时考虑五个方面:
情感判断是否准确;
回答长度是否合理;
情感信息是否足够集中;
句子表达是否完整;
内容是否存在重复。
M-GRPO的目标并不是简单地让模型「少说」,而是让它在保留关键情感信息的同时,减少冗余内容。
从训练曲线可以看到,总奖励在训练前期快速提升并逐渐稳定;与此同时,情感分析部分的生成长度持续下降,并在训练后期收敛至约53个英文单词。这说明模型正在逐步学习更加集中、高效的表达方式。
![]()
M-GRPO的训练过程。随着训练推进,总奖励逐渐提升并趋于稳定,情感分析的生成长度则持续下降,说明模型在保持情感判断质量的同时,学会了更加简洁的表达。
因此,两个阶段解决了不同的问题:SWD-H负责迁移大模型内部的多模态情感表示,M-GRPO则进一步优化学生模型的生成质量和推理效率。
<1B对决8B小模型真的能超过老师吗?
论文在九个公开数据集上进行了实验,覆盖基础情感识别、情感倾向分析和开放词汇细粒度情感识别。
最主要的结论是:在完整的视频、音频和文本输入下,Light-MER的九数据集平均分达到74.61,超过8B教师模型的73.93,并在其中七个数据集上取得更好的结果。
在「音频+文本」和「视频+文本」两种输入设置下,Light-MER 的平均性能同样超过教师模型。这说明其效果并不依赖某一种固定的模态组合。
![]()
Light-MER在三种模态设置下均超过8B教师模型的平均性能
学生不必止步于老师知识蒸馏也能实现性能反超
知识蒸馏常被理解为一种性能妥协:学生模型更小、更快,但通常只能尽可能接近教师模型。
Light-MER的实验结果展示了另一种可能性。
学生模型并不是机械地复制教师的输出,而是通过SWD-H学习教师模型隐藏状态中的分布结构,再通过M-GRPO对生成行为进行重新优化。
因此,学生模型一方面继承了教师模型的多模态情感理解能力,另一方面也修正了教师模型输出过长、信息密度不足的问题。
从这个角度看,教师模型更像是能力来源,而不是学生模型性能的上限。
只要知识迁移目标设计合理,小模型不仅可以接近大模型,还可能在特定任务和部署目标下超过大模型。
从性能到部署:Light-MER有多轻量?
相比教师模型,Light-MER的参数量和FLOPs均减少约11倍,峰值显存从20.04GB降至2.54GB。
在论文的测试环境下,模型直接输出情感标签约需0.52秒/样本;如果生成完整的情感解释,约需3.11秒/样本。
这两个数字可以这样理解:
直接识别模式已经达到亚秒级响应,适合对短视频片段进行交互式情感判断;
描述生成模式属于秒级响应,可以用于机器人对话、人机交互等对延迟相对宽容的场景;
从2.54GB的峰值显存来看,Light-MER已经不再依赖20GB级高端GPU。理论上,具备约4GB显存的设备已有运行空间;考虑系统和推理框架的额外开销,使用6GB及以上显存的消费级GPU或嵌入式边缘计算平台会更稳妥。
从20.04GB到2.54GB:Light-MER将生成式多模态情感识别从高端GPU推向了更轻量的边缘计算平台。
过去几年,多模态情感识别不断受益于更大的语言模型。模型规模从7B、8B继续增长,似乎已经成为获得更强生成和推理能力的自然路径。
Light-MER则重新审视了这一默认前提。
通过SWD-H,模型将8B教师模型内部的多模态情感表示迁移到低于1B参数的学生模型;通过M-GRPO,模型进一步学会生成更加简洁、流畅且忠于情感判断的描述。
最终,Light-MER在九个基准数据集上的平均性能超过8B教师模型,同时将参数量和FLOPs减少约11倍,将峰值显存从20.04GB降低至2.54GB。
因此,对于文章开头提出的问题——
我们真的需要超过1B参数的模型,才能实现高质量的多模态情感识别吗?
Light-MER给出的答案是:
不一定。与单纯扩大模型规模相比,如何有效迁移和优化模型内部的多模态知识,可能更加关键。
参考资料:
https://arxiv.org/pdf/2607.12787
编辑:LRST
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.