来源:市场资讯
(来源:小白 小白学视觉)
伪装是自然界以及人类活动当中的一种非常高明的生存或者反抗的方法。一只蝴蝶的翅膀可以完全融入到枯叶中去,一个士兵穿上迷彩服之后就和周围的环境融为一体了。伪装的目标和它所处的背景之间存在很高的相似度,这对人的视觉系统以及计算机视觉系统来说都是很大的难题。
伪装目标检测就是计算机视觉领域要解决的一个重要问题。它的目的是在复杂的环境中准确地识别和分离出和背景难以区别的物体。该技术对于生态监测、物种发现都非常重要,在医学影像分析、安防监控以及军事等领域也有着无法估量的价值。
但是目前的方法在边界不清、特征融合不够这两个主要的问题上都失败了。过分依靠全局语义信息会使得边缘被忽略掉,而过于重视局部细节则会使目标失去整体感。怎样才能使看到森林和看到树木能够互相配合,而不互相制约呢?
今天我们要分析的文章是《Multi-Scale Local-Global Fusion for Camouflage Object Detection》,其中提出了一种新的方法叫做多尺度局部-全局融合网络。它就像一个老练的猎人一样,既能从整体上把握住猎物的大致形态,又能把注意力集中到一些细微之处去寻找蛛丝马迹。
论文信息
题目: Multi-Scale Local–Global Fusion for Camouflaged Object Detection
基于多尺度局部-全局融合的伪装目标检测
作者:Boran Yang, Min Zhang, Yong Wang, Duoqian Miao
源码:https://github.com/tc-fro/MSLGF
核心思想:局部与全局的交响乐
设想一下,在茂密的雨林里找到一只绿色的树蛙。你会先扫视整个区域,确定大致形状,然后仔细观察树叶的纹理和颜色上的微小差别,最后才确定目标。MSLGF网络就是由此产生的。
它所进行的核心创新就是抛弃了把前景和背景硬性分开的传统做法,转而创建出一种自上而下的合作模式。在该机制下,局部边缘细节和全局语义信息不是对手而是多级配合、互相校正的伙伴。
为达到上述目的,我们设计了两个主要的部分:多尺度融合模块以及局部-全局特征融合模块。它们好比交响乐团里的弦乐组和管乐组一样,各有所长而又相辅相成,一起演奏出精确无误的乐曲。
网络总览:一张清晰的作战地图
我们可以通过下面的整体结构图来了解MSLGF网络完整的布局情况。
![]()
图2:MSLGF网络总体架构图
整个网络就相当于一个复杂的流水线。第一,强大的PVT-V2-B3主干网络用作特征提取器,在输入图像上提取出四张不同大小的特征图。这些特征图包含由粗到细的各种视觉信息。
紧接着就是多尺度融合模块上场了。它会把各个层次上的特征逐渐整合在一起,就如同用不同的放大倍数的显微镜来观察同一个物体一样。主要成果是得到一张高质量的边缘特征图,该图可以清楚地描绘出可能存在的目标形状,并且给后面的工作提供了一个明确的方向。
另外,一个轻量级的边缘引导特征模块也被加入进来,在该模块中把边缘图的注意力作用于原始特征之上,并且产生了边界意识更强的局部特征。这就相当于给侦察兵配备了高倍望远镜。
最后就是局部-全局特征融合模块开始起作用了。它是用级联的方式,自顶向下地把具有边缘细节的局部特征、具有整体结构的全局语义特征以及作为桥梁的中间特征进行深层次的三者融合。该过程由上至下逐层进行,保证每一步都得到大势与小节两方面的帮助。
核心模块深度剖析
多尺度融合模块:从模糊到清晰的边缘雕刻家
边界不明确是伪装检测所遇到的第一个问题。MSFM模块的任务就是产生一个正确的、干净的边框图像。
![]()
图3:多尺度融合模块结构图
它的工作流程很明了也很优美。模块由最深层、语义信息最多样的特征开始,经过上采样以及较浅层特征的拼接和卷积融合。该过程逐层推进,最后到达最底层。
浅层特征有很丰富的纹理以及边缘细节,但是没有语义信息,很容易把背景纹理误认为是目标边缘。而深层特征正好相反,它知道目标是什么,但是不知道目标的精细边界在哪里。
MSFM所做的是把深层次的知识不断输入到浅层次中去。它使网络在复杂的背景纹理里只留下目标物体真实边界的部分,并且去掉不相关的干扰。最后,在几层卷积之后就得到了一个精确的边缘图。该图是后面所有的精细检测工作所依赖的基础。
局部-全局特征融合模块:双通道协作的智慧大脑
如果说MSFM给人们提供了一张准确的地图的话,那么LGFFM就是按照这张地图来制定和实施抓捕方案的大脑。它所设计得非常巧妙,这也是本文的一个主要优点。
![]()
图4:局部-全局特征融合模块结构图
LGFFM用的是双通道交叉融合的方式。两个通道用不同的膨胀率的空洞卷积来实现对不同范围信息的感知。
红色框内的局部通道犹如一位专心致志的微雕艺术家。它的膨胀率比较小,并且是逐渐增加感受野的。它以最细小的边缘轮廓为起点,比如昆虫细长的触角、动物毛发的边界等,之后每一处都会得到整个通道提供的语义指导来保证各个部分都朝向正确的形态发展。
蓝色框代表的是全局通道,就像一个总指挥一样。一开始就用大膨胀率来抓住目标整体结构以及语义信息。但是它并不是独断专行,在每一处都会和局部通道进行互动,并把全局认知传递给细节处理的过程当中去,以免只看到树木而看不见森林。
两个通道在每一层都会互相传递信息并加以修正,在最后把各自得到的特征图合并在一起。利用残差连接来保持住原始输入的信息,从而保证了训练过程中的稳定。这样可以使得网络既能够很好地把握住目标的整体性,又可以准确地还原出它复杂多变的边缘细节,从而有效地避免了局部和全局之间的不平衡现象。
实验验证:性能与效率的平衡艺术
即使理论很美,也必须经过实验的考验。我们对MSLGF在CAMO、COD10K以及NC4K这三个著名的公开数据集上做了全面的测试。
定量的结果很可信。从结构相似性的指标以及加权F度量的角度来看,在各种数据集上MSLGF都取得了最好的成绩。特别是对于边界准确度的E度量来说,它的表现最好。这就说明了它能够解决边界模糊的问题。
定性的比较就更加直观了。如上图所示,在鱼和松鼠等物体被水草、岩石或者树皮遮挡的情况下,目前的方法很容易出现漏检或者误检的情况。
![]()
图5:MSLGF与其它方法的定性对比
但是MSLGF可以得到最完整的、最精确的分割结果,目标边界分明,形态完好。很好地表现出了它所具备的特征融合的能力。
消融实验就相当于对每一个小部件进行仔细地拆卸,并且检验出每个部分的作用。结果表明,在加入MSFM之后各项指标都有所提高,在此基础上再加入LGFFM,则可以进一步改善性能。这就说明了论文中提到的两个主要模块并不是可有可无的,而是在于性能上的突飞猛进。
当然,更强的功能一般会带来更多的计算。MSLGF采用多尺度融合以及复杂的双通道交互,在参数量、计算量方面都比一些简单的模型要大一些。但是它很好地达到了精度和效率之间的平衡。推理的速度仍然处于可以接受的范围之内,但是所获得的性能提高却是巨大的。对于需要高精度的实际应用来说,这无疑是一个合理的并且有价值的方案选择。
总结与展望
MSLGF网络给伪装目标检测问题提供了一个新的角度。它不强求把前景和背景分开来处理,而是在设计上采用了多层次局部-全局融合的方式,在复杂的视觉信息里,网络可以同时使用各种层次的信息来完成对伪装目标的识别,并且使得伪装目标无处可藏。
该工作所具有的价值并不仅仅体现在它的优秀性能上,更重要的是给人们带来了一种新的研究思路。它展示的是怎样用架构来使模型中的各个部分能够有效地交流和合作,进而解决单个层面特征无法解决的复杂的视觉问题。
但是探索是没有尽头的。我们还坦率地承认,在对蝴蝶触角这样的非常纤细的部分进行检测时仍然存在着困难。今后的研究还可以尝试加入跨模态的信息、或者使用频域分析等方式来提高对细微之处的认识水平。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.