SegFormer: Simple and Efficient Design for Semantic Segmentation with Transformers
Enze Xie1 Wenhai Wang2 Zhiding Yu3∗Anima Anandkumar3,4 Jose M. Alvarez3 Ping Luo1 1The University of Hong Kong 2Nanjing University 3NVIDIA 4Caltech
35th Conference on Neural Information Processing Systems (NeurIPS 2021)
目录
0 Abstract
SegFormer是一个简单,高效但强大的语义分割框架,它将Transformer与轻量级MLP解码器统一起来。 主要特点: 1)一个新的层次结构的Transformer编码器,它输出多尺度特征。它不需要位置编码,从而避免了位置码的插值,当测试分辨率与训练不同时,会导致性能下降。 2)避免了复杂的解码器。所提出的MLP解码器聚合了来自不同层的信息,从而结合了局部注意和全局注意,呈现出强大的表示能力。

作者证明,这种简单和轻量级的设计是Transformer高效分割的关键。作者对SegFormer进行扩展,获得了从SegFormer-B0到SegFormer-B5的一系列模型,达到了比以前的模型更好的性能和效率。 SegFormer-B4以64M的参数在ADE20K上达到50.3%的mIoU,比之前的最佳方法小5倍,好2.2%。最佳模型SegFormer-B5在CitySpaces验证集上达到了84.0%的mIoU,并在CitySpaces-C上显示出良好的zero-shot鲁棒性。

1 Introduction
Transformer最先在NLP领域取得成功,后来多索维茨基等人开创性地提出了ViT将Transformer用于CV领域,取得了和CNN相当的效果。在语义分割中,Zheng等人提出了SETR来证明使用Transformer的可行性。 SETR采用ViT作为骨干,并合并了几个CNN解码器来扩大特征分辨率。尽管ViT具有良好的性能,但它有两个重要的限制: 1) ViT输出单尺度的低分辨率特征,而不是多尺度的特征; 2)它在大图像上具有非常高的计算成本。SETR架构图如下。

为了解决这些限制,Wang等人提出了一种金字塔视觉Transformer(PVT),这是一种具有金字塔结构的ViT的自然扩展,用于密集预测。PVT在目标检测和语义分割方面比ResNet有相当大的改进。然而,与其他新兴的方法如Swin Transformer和Twins一起,这些方法主要考虑了Transformer编码器的设计,而忽略了解码器对进一步改进的贡献。PVT架构图如下。

本文提出的SegFormer,是一个尖端的语义分割Transformer框架,同时考虑了效率、准确性和鲁棒性。与以前的方法相比,本文的框架重新设计了编码器和解码器。主要创新点如下: 一种新的无位置编码的分层Transformer编码器 一种可以产生一个强大的表示且没有复杂的和计算要求的模块的轻量级的All-MLP解码器设计。

2 Related Work
语义分割


2974

被折叠的 条评论
为什么被折叠?



