现代计算机视觉从深度学习中获益匪浅,这在很大程度上归功于卷积神经网络(CNN,Convolutional Neural Network)和大规模 GPU 计算的出现。
然而,尽管 CNN 是很多视觉任务采用的标准方法,但它专注于处理空间局部信息来学习视觉表征,在全局性上存在一定限制。
同时,在视觉识别任务中,ViTs(Vision Transformers,视觉转换器)也表现出良好性能,它可以通过自我注意机制学习全局表征。不过,ViTs 还不够轻量,不太适合移动设备。
而本次三星联合悉尼科技大学的研究人员开发出一种高效、轻型 CNN-ViT 混合架构——XFormer,他们提出交叉特征注意(XFA,Cross Feature Attention),有效结合移动 CNN,使 XFormer 能够成为学习全局和局部表示的通用骨干,并可降低 Transformer 的计算成本。
近日,相关论文以《具有交叉特征注意的轻型视觉 Transformer》()为题提交在 arXiv 上。
根据多种任务和数据集上的结果,相比 CNN 和基于 ViT 的模型,XFormer 体现出不俗的优越性。
“在 ImageNet-1K 数据集上,XFormer 在 550 万参数下达到 78.5% 最高精度,在相似数量参数下,比 EfficientNet-B0(基于 CNN)和 DeiT(基于 ViT)的准确率分别高 2.2% 和 6.3%,”研究者在论文中表示。
“此外,我们的模型在语义分割和目标转移检测任务上也表现良好。在 MSCOCO 数据集 YOLOv3 框架中,在 630 万参数和 3.8G 的 FLOPs 下,XFormer 超过 MobileNetV2 10.5AP(Average Precision,平均精度),AP 由 22.7 提高到 33.2。”其还提到。
而在 Cityscapes 数据集上,只用一个全 MLP(Multi-Layer Perceptron,多层感知机)解码器,XFormer 实现了 78.5 的 mIoU(均交并比,Mean Intersection over Union;语义分割的标准度量)和 15.3FPS(每秒传输帧数,Frames Per Second),这比目前最好的轻量级分割网络还要好。
研究人员在论文中进一步解释到,ViTs 作为表示学习的替代方案出现,已在广泛的视觉性能识别任务上证明了其能力,如图像分类、语义分割和目标检测等任务。ViTs 将图像视为补丁序列,并将其分割成图像标记,使用自注意来模拟它们的长期交互。
与作为众多移动视觉任务通用骨干的轻型 CNN 相比,ViTs 具有全局处理能力的优势。随着数据集规模的进一步增长,ViTs 还表现出良好的可扩展性。
但目前大多数基于 ViT 的模型都是重量级的,难以优化和缩小,需要下游任务价值高昂的解码器辅助。
最近的研究已经证明了为语义分割等特定任务设计轻量级 ViT 模型的可能性,但基于 ViT 的模型远未被认为是移动设备的实际选择。
因此,设计一个高效、轻量级的 ViT 模型,对不同的任务进行推广变得尤为重要。
目前已经提出了几种方法来改进 ViTs。比如结合卷积层和 Transformers,通过在早期阶段使用卷积或交织卷积到每个 Transformer 块。此方法的目的是通过引入空间局部偏差来降低计算成本,使优化更加容易。
另一种方法是优化 Transformer 的自注意操作。原始自注意对令牌数具有二次计算复杂度,这就给向下游任务的转移造成了巨大障碍。以往的工作采用了因数分解、低秩近似或哈希等方法来降低复杂性,但一般会造成显著的性能下降。
而此次研究首先通过提出一种新的交叉特征注意模块来解决 Transformer 的效率瓶颈。XFA 不是通过标记维数进行矩阵乘法,而是通过构建中间上下文和特征维数来处理注意,从而降低了 Transformer 的计算成本,并且只产生线性复杂度。
在 XFA中,研究人员还消除了 softmax 操作,并将其替换为一个可学习的参数,以动态调整不同 Transformer 层的缩放因子。并在 XFA 的基础上,开发出轻量级 CNN-ViT 混合架构 XFormer。
XFormer 结合了高效卷积层的局部处理能力和轻型 Transformer 的全局编码能力,并进一步证明了它作为一个可靠的主干网络的普遍性。
最后,在论文中,研究人员表示:“在各种数据集和任务上的实验结果表明,相比以往的方法,我们的高效设计不仅可以提高性能,还能保持较低的计算成本和较高的效率。”
未来,研究团队还计划探索神经架构搜索、自监督预训练等方向,以继续在算力和推理速度方面优化模型,并帮助将其推广到更多的数据集。
参考资料:
https://arxiv.org/abs/2207.07268#:~:text=Recent%20advances%20in%20vision%20transformers,these%20networks%20are%20spatially%20local.
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.