幻觉问题是多模态大型语言模型(MLLMs)普遍面临的挑战,现有的方法通过训练特定设计的数据或在推理时借助其他来源的外部知识来缓解这一问题,但这无疑会增加额外的成本。在本文中,研究者提出了一个名为OPERA的新解码方法,该方法基于过度信任惩罚和回顾分配策略,无需额外数据、知识或训练即可减轻幻觉问题。
论文题目: OPERA: Alleviating Hallucination in Multi-Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation 论文链接: https://arxiv.org/abs/2311.17911 代码链接: https://github.com/shikiw/OPERA一、介绍
幻觉(Hallucination)作为多模态大模型的一个非常严重的问题,一直受到广泛的关注。具体来说,大多数多模态大模型(MLLMs)有时会对用户提供的图像和提示给出错误的回答,例如说出与图像无关或荒谬的事物,识别出与图像上物体的颜色、数量和位置不符的对象。这种现象在多模态大模型生成较长回答时尤其常见。
为了缓解多模态大模型的幻觉问题,许多工作提出了不同类型的方法。他们有的构造额外的训练数据,有的求助于外部知识与模型作为辅助,但是都引入了大量的额外开销。那么有没有一种方法可以在不需要额外的知识与训练的情况下,就可以无痛缓解多模态大模型幻觉这一个“老大难”问题呢?
答案是肯定的。为此,中科大和上海 AI Lab 的研究者们最近提出了一种基于注意力惩罚与回退策略的解码方法 OPERA,有效缓解多模态大模型幻觉!
研究者们从一个有趣的发现入手,他们发现多模态大模型在生成幻觉内容时,其自注意力权重上通常具有“过度信赖”的现象。具体来说,当我们将多模态大模型最后一层的自注意力权重进行可视化,会很容易在模型给出幻觉句子之前看到一个明显的“柱状”特征。这里以多模态大模型 InstructBLIP 来举个栗子:
可以很明显地看到在幻觉句子出现之前会有一个 token 对后续所有的 token 都具有很高的注意力权值。通常这是不符合常理的,因为从输出的回答上来看这一个词并不具有那么丰富的信息量。对此,研究者们分析称这种现象可能是多模态大模型在输出较长语句时存在的一种“自动总结”的本能。
就如同人类一样,在输出的内容不断增长的情况下,为了减小负荷且提升效率可能会进行阶段性的总结,而后续的所有回答会基于这些总结来给出。同时,这种阶段性总结也可能导致之前的一些具体信息的丢失,后续的 token 由于“过度信赖”这些总结而忽视先前的信息,从而出现幻觉内容。研究者们把这样的现象称为“partial over-trust”,发现大模型的这种阶段性总结可能是真正导致幻觉问题的“元凶”!
同时,研究者进行了数值上的统计,他们在不同模型中都观察到了这一现象与幻觉之间的伴生关系:
如图,研究者们随机采样了 100 张图像对不同的多模态大模型进行提问,发现在所有出现幻觉的回答中,有 80%~90% 的部分都表现出“过度信赖”现象与幻觉之间存在的伴生关系。
二、方法
研究者们希望通过改变解码策略来缓解这种“过度信赖”现象的出现,从而来减轻幻觉问题。在经典解码方法 Beam Search 的基础上,他们首先在解码过程中对每个 token 的输出概率引入了一个额外的惩罚项,来惩罚其出现“过度信赖”的注意力特征。
具体来说,他们首先在自注意力的权重图上划分出一个局部窗口,然后将这些权重在数值进行放大,同时使用列乘法得到一个得分向量,最后选择得分向量中的最大得分作为惩罚得分。这个惩罚得分越大说明出现生成句子中存在“过度信赖”的特征越明显,越可能出现幻觉。最后,这个惩罚得分的作用会体现在每个序列的 Beam 得分上,得分较低的序列最后将被淘汰。
由于这种“过度信赖”的特征具有“滞后性”,即只有在解码的过程中输出了若干 token 之后才能发现这样的特征。为了解决这种滞后带来的局限性,研究者们还提出了“回退-再分配”的策略。具体来说,可以计算最近几个 token 的得分向量的最大值下标,并检查该下标连续出现的次数是否大于一定阈值。如果高于阈值,则将当前序列的解码过程回退到这一下标所在 token 的位置,并重新选择词表中概率次高的词(除了之前已经选择的词之外)。
结合所提出的“过度信赖”惩罚与“回退-再分配”策略,研究者们提出一个新的多模态大模型解码方法 OPERA,极大地缓解了模型的尤其是在生成长文的幻觉现象。
三、实验
研究者们在 InstructBLIP,MiniGPT-4,LLaVA-1.5 以及 Shikra 等多种多模态大模型上进行了测试,在不同维度上进行了统计验证。相比于之前的解码方法,所提出的 OPERA 解码方法在缓解幻觉上均表现出优越的性能。
此外,研究者们还引入了 GPT-4 和 GPT-4V 进行打分测试,在生成内容的准确程度与具体程度上,OPERA 同样也表现出优越的性能。
研究者们还给出了 OP ERA 的一些具体表现的实例:
总体而言,OPERA 作为一个从解码策略上改善多模态大模型幻觉的方法,能够非常容易地部署到不同的模型与架构上,同时也启发了更多研究者从机制上去研究并解决多模态大模型的幻觉问题。
Illustration From IconScout By Delesign Graphics
-The End-
本周上新!
扫码观看!
“AI技术流”原创投稿计划
TechBeat是由将门创投建立的AI学习社区(www.techbeat.net)。社区上线500+期talk视频,3000+篇技术干货文章,方向覆盖CV/NLP/ML/Robotis等;每月定期举办顶会及其他线上交流活动,不定期举办技术人线下聚会交流活动。我们正在努力成为AI人才喜爱的高质量、知识型交流平台,希望为AI人才打造更专业的服务和体验,加速并陪伴其成长。
投稿内容
// 最新技术解读/系统性知识分享 //
// 前沿资讯解说/心得经历讲述 //
投稿须知
稿件需要为原创文章,并标明作者信息。
我们会选择部分在深度技术解析及科研心得方向,对用户启发更大的文章,做原创性内容奖励
投稿方式
发送邮件到
chenhongyuan@thejiangmen.com
或添加工作人员微信(chemn493)投稿,沟通投稿详情;还可以关注“将门创投”公众号,后台回复“投稿”二字,获得投稿说明。
关于我“门”
将门是一家以专注于数智核心科技领域的新型创投机构,也是北京市标杆型孵化器。 公司致力于通过连接技术与商业,发掘和培育具有全球影响力的科技创新企业,推动企业创新发展与产业升级。
将门成立于2015年底,创始团队由微软创投在中国的创始团队原班人马构建而成,曾为微软优选和深度孵化了126家创新的技术型创业公司。
如果您是技术领域的初创企业,不仅想获得投资,还希望获得一系列持续性、有价值的投后服务,欢迎发送或者推荐项目给我“门”:
bp@thejiangmen.com
点击右上角,把文章分享到朋友圈
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.