网易首页 > 网易号 > 正文 申请入驻

多模态大模型真的理解情绪吗?MME-Emotion给出了系统答案

0
分享至



近年来,多模态大模型(Multimodal Large Language Models, MLLMs)正在迅速改变人工智能的能力边界。从图像理解到视频分析,从语音对话到复杂推理,大模型正在逐步具备类似人类的综合感知能力。但一个关键问题仍然没有得到充分回答:这些模型真的能够理解人类情绪吗?

在真实世界中,人类的情绪往往通过多个模态共同表达。例如,一个人可能通过面部表情传递紧张情绪,同时语音语调也在变化,而语言内容可能只提供部分线索。对于人工智能系统而言,仅依赖单一信息来源往往难以准确判断情绪状态。因此,情感智能(Emotional Intelligence)逐渐成为衡量多模态大模型能力的重要指标之一。

然而,目前学界仍然缺乏一个系统性的评测框架来衡量多模态大模型的情感智能水平。已有情感数据集通常规模较小,场景覆盖有限,而且大多只关注情绪分类准确率。模型是否真正理解情绪产生的原因,以及能否在不同场景中稳定工作,往往没有得到充分评估。

为了解决这一问题,来自香港中文大学和阿里通义实验室的团队共同提出了MME-Emotion,一个面向多模态大模型情感智能的综合评测基准。该工作已被 ICLR 2026 接收。



  • 论文标题:MME-Emotion: A Holistic Evaluation Benchmark For Emotional Intelligence in Multimodal Large Language Models
  • 项目主页:https://mme-emotion.github.io
  • 论文代码:https://github.com/FunAudioLLM/MME-Emotion
  • 论文数据:https://huggingface.co/datasets/Karl28/MME-Emotion

MME-Emotion 是目前规模最大的多模态情感智能评测基准之一,包含约 6500 段视频片段及对应问答数据,覆盖 27 类真实场景,并设计了 8 类不同情感任务。相比传统数据集,这一基准强调真实环境中的多模态信息融合能力,使模型必须同时理解视觉、语音和语言信息。



这些任务包括实验室环境情绪识别、真实场景情绪识别、噪声条件下情绪识别、细粒度情绪识别、多标签情绪识别、情感倾向分析、细粒度情感分析以及意图识别等多个方向。不同任务之间保持相对均衡的数据分布,使评测结果更加稳定可靠。

与以往工作相比,MME-Emotion 的一个重要特点是同时评测情绪识别能力和情绪推理能力。在许多已有数据集中,只要模型预测正确的情绪标签即可获得高分,但这种评测方式无法区分「猜对答案」和「真正理解情绪」的差别。

例如,在一个视频中,如果人物表现出恐惧情绪,模型不仅需要给出 “恐惧” 这一标签,还需要能够指出支撑这一判断的线索,例如面部表情变化、语音颤抖或者语速变化等。只有在这种情况下,我们才认为模型具备一定程度的情感理解能力。



为此,MME-Emotion 提出了一套统一的评测指标体系,包括情绪识别得分(Recognition Score)、推理得分(Reasoning Score)以及综合思维链得分(Chain-of-Thought Score)。其中识别得分用于衡量情绪预测准确率,推理得分用于衡量模型推理过程的合理性,而综合得分则同时反映识别能力与推理能力。

为了支持大规模自动评测,研究团队设计了一套基于多智能体系统的评测流程。系统首先获取模型对问题的回答,然后自动提取回答中的关键推理步骤,并结合视频帧信息和语音线索进行评分。这种方法避免了传统评测中大量人工标注推理过程的成本问题。

为了验证自动评测的可靠性,研究团队还邀请了多位专家对部分样本进行了人工评测。结果表明,自动评分与人工评分之间具有较高一致性,说明这一评测方法在实际使用中具有较好的稳定性。





在 MME-Emotion 基准上,研究团队评测了 20 个当前主流多模态大模型,包括多个开源模型以及闭源模型,如 GPT-4o、Gemini 系列以及 Qwen 系列模型。

实验结果显示,即使是当前最先进的模型,在情感智能方面仍然存在明显不足。表现最好的模型情绪识别得分不到 40%,综合思维链得分也只有约 56%。从整体平均结果来看,各模型在情绪识别任务上的表现仍然处于较低水平。

这些结果说明,多模态大模型虽然在视觉理解和语言推理方面取得了显著进展,但情感理解仍然是一个具有挑战性的方向。



进一步分析发现,目前模型在情感任务中主要存在几类典型问题。

首先是细粒度视觉理解能力不足。在许多错误案例中,模型难以区分相似情绪,例如恐惧与惊讶之间的差别。这类错误通常源于对面部表情和细微动作变化理解不足。

其次是多模态信息融合能力有限。一些模型在仅使用视觉信息时表现尚可,但当需要同时结合语音和视觉信息时反而出现性能下降。这说明当前模型在处理多模态情感线索时仍然存在困难。



此外,研究还发现模型推理能力与情绪识别能力之间存在明显相关性。通常来说,能够给出更完整推理过程的模型,其整体情感智能表现也更好。这一现象表明,推动模型进行更深入的推理可能是提升情感智能的一条重要路径。

整体来看,MME-Emotion 提供了一个更加全面的评测框架,使研究者能够系统分析多模态大模型在情感理解方面的能力边界。

研究团队认为,未来多模态情感智能的发展可能依赖几个关键方向,包括更高精度的视觉细节建模、更有效的语音与视觉信息融合方法,以及能够解释情绪产生原因的推理机制。

随着多模态大模型不断发展,情感智能有望成为人工智能系统的重要能力之一。在教育、人机交互和医疗辅助等应用场景中,能够理解人类情绪的智能系统将具有重要价值。

MME-Emotion 的发布为这一研究方向提供了统一评测标准,也为后续模型改进提供了清晰的参考基线。

作者介绍

章帆,香港中文大学计算机科学与工程系博士生,导师为 Pheng-Ann Heng 教授。主要研究方向为多模态大模型与 Agent 系统,关注多模态理解、推理能力评测以及面向复杂任务的智能体工作流设计。近年来在 ICLR、CVPR、NeurIPS 等国际会议发表多篇论文,相关研究工作涵盖多模态大模型评测基准构建、后训练以及深度研究型智能体(Deep Research Agents)。目前致力于探索多模态 Agent 系统在复杂真实任务中的能力边界与应用潜力。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国急得跳脚,西班牙摊牌了:中国这次建厂,不允许出任何问题

美国急得跳脚,西班牙摊牌了:中国这次建厂,不允许出任何问题

麓谷隐士
2026-08-14 05:20:03
美国急得跳脚,西班牙表态了:中国这次建厂,不允许出任何问题

美国急得跳脚,西班牙表态了:中国这次建厂,不允许出任何问题

共工之锚
2026-08-14 00:16:14
这样打扮的阿姨,确实给人眼前一亮的感觉

这样打扮的阿姨,确实给人眼前一亮的感觉

美女穿搭分享
2026-08-10 12:22:14
风波升级!为抢遗产赶母亲出门后,王骁更多黑料被扒,张译没说谎

风波升级!为抢遗产赶母亲出门后,王骁更多黑料被扒,张译没说谎

兵卒史
2026-08-14 02:44:27
华为Mate90屏幕全系双层OLED,标准版也配,Pro用户咋想?

华为Mate90屏幕全系双层OLED,标准版也配,Pro用户咋想?

小柱解说游戏
2026-08-14 01:58:52
贪污上亿、假慈善、被人身控制?54岁韩红的私生活谣言离谱至极

贪污上亿、假慈善、被人身控制?54岁韩红的私生活谣言离谱至极

春之韵
2026-08-14 01:50:55
纳指收涨0.8% 闪迪大涨超13%

纳指收涨0.8% 闪迪大涨超13%

财联社
2026-08-14 04:13:05
不留活口!乌军下死命令:要么救出巴西西班牙雇佣兵,要么消灭

不留活口!乌军下死命令:要么救出巴西西班牙雇佣兵,要么消灭

真的好爱你
2026-08-12 22:53:15
比亚迪秦MAX上市:9.99万起的B级车,2370km续航能否颠覆市场?

比亚迪秦MAX上市:9.99万起的B级车,2370km续航能否颠覆市场?

像素与芯片
2026-08-13 20:21:28
婚外胚胎案最新消息!曹三姐反诉原配倒打一耙,让人大开眼界

婚外胚胎案最新消息!曹三姐反诉原配倒打一耙,让人大开眼界

坠入二次元的海洋
2026-08-13 10:42:52
定了!森林狼将在明年3月1日退役加内特球衣 主场对阵绿军意义非凡

定了!森林狼将在明年3月1日退役加内特球衣 主场对阵绿军意义非凡

罗说NBA
2026-08-14 06:08:36
弹劾案迎来反转,马科斯要把莎拉送进监狱,杜特尔特家族启用后手

弹劾案迎来反转,马科斯要把莎拉送进监狱,杜特尔特家族启用后手

让生活充满温暖
2026-08-14 01:50:21
我72年的,今年54岁,没存款没退休金,在家歇了半年,越闲越心慌

我72年的,今年54岁,没存款没退休金,在家歇了半年,越闲越心慌

荷兰豆爱健康
2026-07-17 04:29:18
事情闹大了?网传同济大学取消长期聘任,遭教职工公开信抵制...

事情闹大了?网传同济大学取消长期聘任,遭教职工公开信抵制...

慧翔百科
2026-08-13 08:36:47
警惕!阿托伐他汀不可和下列药物合用,否则不治病还致命

警惕!阿托伐他汀不可和下列药物合用,否则不治病还致命

荆医生科普
2026-08-13 18:00:12
哈兰德调侃23岁新援为“假摔者”,安德森幽默回应

哈兰德调侃23岁新援为“假摔者”,安德森幽默回应

体育硬核说
2026-08-13 05:08:44
“当年挤破头,如今想出手”:中产家庭,集体撤离海南?

“当年挤破头,如今想出手”:中产家庭,集体撤离海南?

阿振观点
2026-08-06 05:33:06
1分钟破1000万元,ALO在华正式开售,定价整体高于lululemon,有人吐槽“娇贵次抛衣”

1分钟破1000万元,ALO在华正式开售,定价整体高于lululemon,有人吐槽“娇贵次抛衣”

封面新闻
2026-08-13 18:59:03
重庆市退休人员8月重要提醒!养老金两件关键事,认准官方信息

重庆市退休人员8月重要提醒!养老金两件关键事,认准官方信息

阿芒娱乐说
2026-08-14 02:30:54
张颖颖怒揭汪小菲老底,频繁飞台北原因不简单,官媒下场怒批

张颖颖怒揭汪小菲老底,频繁飞台北原因不简单,官媒下场怒批

随意吃瓜
2026-08-13 11:06:53
2026-08-14 07:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13751文章数 142718关注度
往期回顾 全部

科技要闻

一切皆插件!DeepSeek Harness正式发布

头条要闻

冉莹颖被指称"输了换老公有保险" 邹市明深夜回应

头条要闻

冉莹颖被指称"输了换老公有保险" 邹市明深夜回应

体育要闻

负债十几亿的联赛,还在疯狂买球星

娱乐要闻

篡改红歌已立案,郭德纲大祸临头

财经要闻

可治疗癌症?神话破灭的片仔癀 陷入争议

汽车要闻

全新红旗H7到底新在哪儿?

态度原创

健康
时尚
房产
本地
数码

孩子高低肩,是不是脊柱侧弯了?!

HYROX赛场上的美照怎么拍出来的?

房产要闻

投资暴跌90%!文昌楼市,正在停摆!

本地新闻

黄州一夜,苏轼写给普通人的月光

数码要闻

英伟达GeForce NOW原生Linux应用发布:结束Beta测试

无障碍浏览 进入关怀版