来源:市场资讯
(来源:小白 小白学视觉)
一幅被雨水打湿的画面,在电脑看来就是一片模糊不清的像素点,但是在人的眼中,则代表了重要的信息被破坏了。怎样使机器能够准确地识别出烦人的雨痕,并将其删除掉,但是又不能影响到背景的纹理和细节呢?前沿研究小组的新研究成果——区域信息Transformer给我们的答案是全新的、令人惊叹的。
论文信息
题目: Exploiting Regional Information Transformer for Single Image Deraining
利用区域信息Transformer的单幅图像去雨
作者: Baiang Li, Zhao Zhang, Huan Zheng, Xiaogang Xu, Yanyan Wei, Jingyi Zhang, Jicong Fan, Meng Wang
一、 雨幕下的挑战:当雨水与图像内容难舍难分
单幅图像去雨是计算机视觉领域的一个经典问题。雨水在图片上产生的条纹或者斑点会大大降低图像的质量,并且对于自动驾驶、视频监控、遥感分析等高级视觉任务造成很大的影响。
近几年来由于深度学习技术的进步,在去雨任务中使用卷积神经网络以及Transformer等方法已经取得很大的进展。但是一个根本性的难题一直困扰着研究人员:现有的方法一般都会把整个图像当作一个整体来对待,而没有考虑到受到雨水影响的部分与没有受到雨水影响的部分之间存在的本质区别。
想象一下,在图片里本来很清晰的建筑边沿(高频细节)和被雨水弄模糊了的玻璃反光(雨噪声),它们在特征分布上是不一样的。把它们放在一起进行处理的话,模型就会出现混淆的情况:是要去掉像建筑物一样的雨线,还是要保留像雨线一样的建筑物纹理?眉毛胡子一把抓的方法就是造成很多先进的方法在复杂的实际情况下的效果不好的原因。
![]()
如图1所示,现有的方法和Regformer处理的效果比较。(a) 现有的方法把雨区和背景区一起处理,造成特征混杂、细节损失。(b) Regformer对不同的区域进行单独处理,从而得到更加精确的去雨以及细节恢复。*
如上图所示,在对类似雨线这样的图像内容进行处理的时候,传统的做法往往会把它们误认为是不需要的部分而予以删除,从而导致图像失真。这就是因为它们不能够分辨出要移除的雨水与要保留的物体边沿。
二、 核心思想:分而治之,协同作战
对于上述问题,研究小组提出了一种很直观但是很有见地的想法:把雨线区域与背景区域分开来处理,在模型中使两者的信息互相作用,最后共同完成高质量的图像重建。
该思想产生了一个新的模型框架叫做区域Transformer,简称为Regformer。它所做的是不把图片看作一个整体来提取特征,而是在引导下让模型有意识地去注意哪些地方在下雨、哪些地方不在下雨,并且对于这两者采取不同的处理方式。
为了达到这个目的,在模型结构方面做了三个重要的改进:
区域掩码注意力机制:在Transformer的自注意力计算里给雨区、背景区各自产生独立的注意力掩码来促使模型对不同的区域进行有针对性的关注。 2. 混合门控前向块:提出了一种新的模块,在并行地使用不同的卷积核来感受和提取图像中的局部以及多层次的信息上进行工作,这对于恢复出精细的纹理非常有帮助。 3、区域Transformer级联解码结构:在解码器部分并行地对雨区和背景区的特征流进行处理,然后把它们合并起来,保证生成的特征图包含来自各个区域的信息。
三、 庖丁解牛:Regformer的架构奥秘
我们来探究一下Regformer是如何把分而治之的思想变成现实的。
3.1 整体架构:编码器-解码器下的区域感知流水线
Regformer整体结构上使用了经典的编码器-解码器的设计方式,在此基础上加入了特殊的区域信息处理过程。
![]()
如图2所示为Regformer整体结构图(a) 表示的是编码器和解码器的过程以及主要的部分RTB(b) 区域掩码注意力RMA的工作原理(c) 混合门控前向块MGFB的组成。*
整个过程是从浅层特征提取卷积开始的。然后特征图被送入由多级区域Transformer块组成的编码器中。在编码的时候,模型还不知道雨区的位置在哪里,所以就用全1的掩码来表示它,也就是平等地对待所有的区域,目的是做一下全局特征的学习。
真正的魔法就发生于解码器这一环节上。加入区域Transformer级联结构。该结构把输入的特征图复制两份,然后分别送到两个不同的RTB里去。主要的区别就是这两个RTB所用到的区域掩码不同:一个是针对雨线区域,另一个是针对背景区域。经过各自独立提取出的特征流被拼接在一起,并且用一个卷积层来合并这两条特征流。最后,没有使用任何掩码的RTB来把三条信息流(雨区、背景区和它们的融合特征)整合在一起,并产生一个完整的综合特征图。
该流程的巧妙之处就是模仿了人认识下雨的过程:首先大致确定出雨的位置以及背景的位置,接着分别对这两个地方进行精细的处理,最后把处理好的两个部分完美地组合在一起形成一幅干净的图片。
3.2 区域掩码注意力:让模型学会看重点
RMA就是Regformer的灵魂。其目的是在自注意力计算的时候给查询和键值对加上一个区域过滤器。
![]()
图3 区域掩码生成的过程。根据浅层特征与深层恢复特征之间的差别来产生雨区、背景区的二值化掩码。*
那么决定模型关注的重点区域掩码又是怎么来的呢?答案就是模型自己推理的过程。研究者用编码器提取出的浅层特征和解码器正在恢复中的特征之差来生成雨区掩码,并且使用一个动态阈值二值化的方法。背景掩码就是雨区掩码的对立面。从数据中学习到掩码的方法使模型可以适应各种不同的雨线密度和形状。
有了掩码之后,在计算注意力权重的时候,属于雨区掩码的查询只和同为雨区掩码的键做高权重交互,背景区也是如此。这就使得模型在雨区里寻找出下雨所需要的特征模式,在背景区里寻找出纹理恢复所需要的特点模式,大大减小了不同区域之间错误信息的影响。
3.3 混合门控前向块:捕捉多尺度细节的利器
RMA可以很好地处理长距离和区域级别的依赖关系,但是对于图像中的微小局部纹理,则需要更加精细的工具来完成。这就是MGFB发挥作用的地方。
MGFB的设计思想就是用混合尺度建模的方法。首先把特征图按照通道维度分成若干个组,在每组内用不同的核大小做深度卷积,并行计算。比如一组用3x3的小卷积核去捕捉细小的边缘信息,另一组则用5x5的大卷积核来感受较大的纹理模式。
并行提取出来的不同尺度的特征之后再用门控的方式进行融合。这样可以使得模型同时获取到小到大范围内的局部上下文信息,进而更好地恢复出图像中的高频细节以及清晰的纹理,并且不会出现去雨后照片会变得非常光滑或者模糊的问题。
四、 效果说话:全面领先的性能表现
不管多么美妙的理论,都必须通过实验来验证。研究人员把Regformer和各种最新的方法放在了多个权威的合成和真实的去雨数据集上进行比较。
4.1 定量分析:指标上的显著提升
在Rain200H、Rain200L、SPA-Data等数据集上,Regformer在峰值信噪比以及结构相似度这两个主要性能指标上都处于领先地位。尤其对于一些困难的数据集而言,它的PSNR值要比最好的方法高出了1分贝以上,这是很大的进步。
![]()
表1 Rain200H、Rain200L数据集上定量结果比较,Regformer表现最好。*
另外一件让人印象深刻的便是Regformer,在去除雨条纹的任务中表现优异,在另外一个更加困难的任务即去除附着于镜头或者玻璃上的雨水时也表现得十分出色,在AGAN-Data数据集中大大超过了其他的比较的方法。
4.2 定性对比:肉眼可见的清晰与自然
虽然数字指标很重要,但是提高视觉效果的效果更直接。
![]()
如图4所示,在类似的雨线图像内容场景下进行去雨的效果比较。其他的办法会把物体边缘也删掉,但是Regformer可以很好地保留下来。*
![]()
如图5所示,在类似的图像内容的雨线噪声场景下进行去雨的效果比较。其他的办法都不能把雨水去掉或者留下虚假的影像,而Regformer做的最好。*
根据上面的对比图可以看出,在真假难分的情况下,Regformer具有很强的判断力。它可以迅速地把和建筑轮廓类似的密集雨线去掉,又可以小心地保留住图片原有的纹理以及边沿,最后得到的效果比其他方法要好得多。
4.3 消融实验:每个组件都不可或缺
为检验每个创新点是否有效果,研究人员做了系统性的消融实验。
![]()
表4消融实验的结果显示了RMA、MGFB等主要部分对于性能的影响。*
实验结果显示完整的区域掩码方式所获得的性能提升最多,这也有力地证明了区分雨区和背景区这个核心思想的有效性。MGFB模块和区域掩码一起使用可以更好地发挥MGFB模块的作用,提高细节恢复的能力。这就说明了RMA和MGFB是相互补充的关系:RMA主要做宏观上的区域划分以及信息引导工作,而MGFB则是在划定好的区域内进行微观上的多层次特征修正。
五、 总结与展望
Regformer的成功表明单幅图像去雨的研究已经由整体优化进入到精细化、区域化的阶段。它用区域先验来使Transformer模型具有类似于人的注意力分配的能力,在图像的不同部分进行有针对性的处理。
这项工作所具有的意义,并不只在于提出了一个高效率的去雨模型,而是在于它展示了处理低级视觉任务的一种通用方法:对于有干扰、退化的图像,把它们分成退化区和清洁区然后单独处理,也许可以达到更好的效果。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.