OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2012.15840v1

SETR:将语义分割统一为序列到序列的 Transformer 建模

 
  zipper ·  2026-08-22 11:01:18 · 5 次点击  · 0 条评论  

从序列到序列视角用Transformer重新思考语义分割

标题

Rethinking Semantic Segmentation from a Sequence-to-Sequence Perspective with Transformers

作者

Sixiao Zheng, Jiachen Lu, Hengshuang Zhao, Xiatian Zhu, Zekun Luo, Yabiao Wang, Yanwei Fu, Jianfeng Feng, Tao Xiang, Philip H.S. Torr, Li Zhang

摘要

近年来大多数语义分割方法采用全卷积网络(FCN)的编码器-解码器架构。编码器逐步降低空间分辨率,并通过更大的感受野学习更抽象/语义的视觉概念。由于上下文建模对分割至关重要,近期的研究重点集中在通过空洞卷积或引入注意力模块来增大感受野,但基于FCN的编码器-解码器架构本身并未改变。

本文从另一个视角出发,将语义分割视为一个序列到序列(sequence-to-sequence)的预测任务。具体而言,作者部署了一个纯Transformer(即不含卷积和分辨率降低操作)将图像编码为一系列图像块(patch)。由于Transformer的每一层都对全局上下文进行了建模,该编码器可以与一个简单解码器结合,构成强大的分割模型——称之为 SEgmentation TRansformer (SETR)

大量实验表明,SETR在ADE20K(50.28% mIoU)、Pascal Context(55.83% mIoU)上达到了新的最先进水平,在Cityscapes上也取得了有竞争力的结果。特别地,作者在竞争激烈的ADE20K测试服务器排行榜上取得了第一名(44.42% mIoU)。

主题分类

计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)

其他信息

  • 提交时间:2020年12月31日(v1)
  • 项目主页:https://fudan-zvg.github.io/SETR/
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 16 ms
Developed with Cursor