Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers
Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Jianfeng Feng, Tao Xiang, Philip H.S. Torr, Li Zhang
近年来大多数语义分割方法采用全卷积网络(FCN)的编码器-解码器架构。编码器逐步降低空间分辨率,并通过更大的感受野学习更抽象/语义的视觉概念。由于上下文建模对分割至关重要,近期的研究重点集中在通过空洞卷积或引入注意力模块来增大感受野,但基于FCN的编码器-解码器架构本身并未改变。
本文从另一个视角出发,将语义分割视为一个序列到序列(sequence-to-sequence)的预测任务。具体而言,作者部署了一个纯Transformer(即不含卷积和分辨率降低操作)将图像编码为一系列图像块(patch)。由于Transformer的每一层都对全局上下文进行了建模,该编码器可以与一个简单解码器结合,构成强大的分割模型——称之为 SEgmentation TRansformer (SETR)。
大量实验表明,SETR在ADE20K(50.28% mIoU)、Pascal Context(55.83% mIoU)上达到了新的最先进水平,在Cityscapes上也取得了有竞争力的结果。特别地,作者在竞争激烈的ADE20K测试服务器排行榜上取得了第一名(44.42% mIoU)。
计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)