来源:市场资讯
(来源:小白小白学视觉)
各位老师同学们大家好,今天给大家讲解一篇有关于计算机视觉领域最新研究成果的文章。该篇发表在顶级期刊上的文章提出了一个叫做MambaDif的新方法来解决光学遥感图像显著目标检测这个经典的难题。
光学遥感图像中船舶、飞机、建筑等目标,在复杂的背景之下怎样才能被准确地识别出来呢?这既是对学术上的一个挑战,也是关系到农业监测、国防安全等重要领域的应用问题。传统的做法大都采用语义分割的方式,但是逐像素独立预测带来的硬伤使得模型在一些地方表现出过度自信的现象,造成严重的错误判断。
论文信息
题目: Mamba-Driven Diffusion Model for Salient Object Detection in Optical Remote Sensing Images
基于Mamba驱动的扩散模型用于光学遥感图像显著目标检测
作者:Jinsheng Yang, Bineng Zhong, Qihua Liang, Yufei Tan, Haiying Xia, Shuxiang Song
传统范式的困境与扩散模型的曙光
我们来比较一下两张图片。图1 明确地表示了两种不同的技术路线。左边为传统的语义分割范式,即依靠一个强大的骨干网络来提取特征,并用解码器产生最终的分割掩码。该方法的预测过程是逐像素、独立完成的。
图1:两种范式对比
问题就出在这一点上。如图2所示,在复杂的遥感场景下,该独立预测的方式很容易失败。模型会把一些背景区域预测为前景,并且把前景物体边缘预测得很模糊。过度自信所造成的错误对分割精度以及鲁棒性都有很大的影响。
![]()
图2:传统方法的过度自信误判示例
那么有没有办法使模型变得谦虚一些,在面对各种可能的时候能够做出选择呢?答案是肯定的,这就是扩散模型所带来的一线希望。扩散模型的主要思想就是用一个加噪和去噪的过程来从数据的概率分布中抽取样本。这就意味着对于同一个输入,模型会产生出很多合理的预测结果来减轻过自信的问题。
但是目前的扩散模型在用到这样的任务的时候,它的条件特征提取网络一般会选用Transformer或者CNN。虽然Transformer可以做全局建模,但是它的计算复杂度和图像大小成平方关系,在处理高分辨率遥感图像的时候压力很大。CNN由于受到局部感受野的限制,不能够很好地捕捉到图像中大量的远距离相关性,例如分布在画面各个地方的小目标之间存在的联系。
MambaDif:一种全新的融合架构
为了解决过度自信和长期依赖这两个问题,本文提出了一种新的MambaDif模型来解决这些问题。它的主要思想很巧妙,就是把显著目标检测的任务重新定义为条件掩码生成的问题,并且第一次使用了在自然语言处理领域崭露头角的Mamba模型来充当扩散模型的条件引导者。
Mamba是新的状态空间模型,它的优点就是可以以线性的复杂度来高效地处理长序列的数据,并且还具有很强的全局建模的能力。这就正好适合于处理大尺寸、含有大量全局信息的遥感图像。
![]()
图3:MambaDif模型整体架构图
上图显示了MambaDif的整体结构,使用了比较直观的双流设计。上面为用Mamba建立起来的条件网络,用来从输入图像中抽取包含全局语义信息的特征。下面是用U-Net搭建起来的扩散去噪网络,在条件网络给出的语义指引之下,对噪声掩码做迭代式的去噪处理,从而逐渐恢复出目标轮廓。
整个工作流程可以总结为:第一步是Mamba编码器作为一位高瞻远瞩的指挥官来快速地浏览整幅图片,并且理解到整体结构以及语义关系。接着把这些全局的信息传送给去噪网络这个精心打造的匠人。工匠按照指挥官的要求,从一片空白开始,在不断的修改中逐渐完善目标掩码。
核心创新:全局与局部的精妙协同
仅仅把Mamba和扩散模型简单地拼接起来,并不能体现出我们所作的深入思考。本文另外一个重要的贡献就是提出了一种巧妙的全局-局部特征协同补全模块。
该模块设计的理念是具有辩证法思想。我们认为Mamba编码器给出的全局特征可以抓住大势,但是缺少细节纹理。去噪网络中CNN编码器在每一层下采样的时候会损失掉一些全局的信息,但是对于局部细节很敏感。
![]()
图6:全局-局部特征协同补全模块结构
如图6所示,该模块用两根并行的通道来实现特征互补。对于CNN提取出的局部特征,模块加入自注意力机制给它带来对长距离依赖的理解能力。对于Mamba提取出来的全局特征用卷积的方式做局部细化来提高它的细节表征能力。最后两者融合在一起,得到既具有全局一致性又具有局部精细度的增强特征,从而大大提高了去噪以及分割的效果。
实验验证:全面领先的性能表现
即使理论很美,也必须有实验来作坚强的支持。我们对三个权威的遥感显著目标检测数据集进行了全面的测试,即ORSSD、EORSSD和最大的ORSI-4199数据集。
实验结果显示,MambaDif在所有的评价标准上都优于目前存在的28个先进的方法,其中包括使用CNN、Transformer等技术的各种模型。比如在最困难的ORSI-4199数据集上,MambaDif在重要的结构相似性指标方面取得了很大的提高。
![]()
图7:视觉对比效果图
视觉对比的结果更具有说服力。如图7所示,在遇到大面积的目标、很多小的目标、有背景干扰物和狭长不规则的目标等情况的时候,以前的方法都会出现漏检、误检或者边界模糊的问题。但是MambaDif的预测结果和真实的标注非常接近,不但能完全识别出目标,并且边界也十分清楚、锐利。
但是扩散模型迭代去噪的特点也会带来更大的计算负担。消融实验也证明了每一个组件的价值,在用Mamba做条件网络的情况下,虽然可以获得更好的效果,但是模型参数量以及计算量却比使用Transformer版本的小。GLM模块的加入使性能得到了更多的稳定提升。
总结与展望
本文给解决复杂的视觉分割问题提供了一个新的角度。它把扩散模型概率生成的优势和Mamba模型高效长距离建模的能力结合起来,并且加上了精妙的特征融合的设计,在遥感显著目标检测的任务中取得了新的进展。
MambaDif之所以能够成功,并不是因为它具有很好的性能指标,而是因为它提供了一条把各种不同的方法结合起来使用的途径。它告诉我们,在解决过度自信、长期依赖等固有的问题的时候,跳出原有的思维模式,向概率生成、序列构建等领域借鉴经验,也许可以开拓出一片新天地。
当然,怎样提高扩散过程的效率、减少推理的时间,就是今后的研究重点了。希望有更多的研究能够沿着这个思路进行下去,并且使视觉感知技术朝着更加精确和稳健的方向发展。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.