Chaoning Zhang, Dongshen Han, Yu Qiao, Jung Uk Kim, Sung-Ho Bae, Seungkyu Lee, Choong Seon Hong
Segment Anything Model (SAM) 因其出色的零样本迁移性能和高度通用性,在众多视觉应用(如细粒度控制的图像编辑)中引起了广泛关注。然而,许多此类应用需要在资源受限的边缘设备(如手机)上运行。
本研究旨在通过用轻量级图像编码器替换原始 SAM 中的重型图像编码器,使其适用于移动端。研究发现,简单按照原始 SAM 论文的方式训练新模型效果不佳,尤其是在训练数据有限的情况下,其主要原因是图像编码器与掩码解码器的联合优化问题。为此,作者提出了解耦蒸馏(Decoupled Distillation) 方法——将原始 SAM 中重型图像编码器(ViT-H)的知识蒸馏到轻量级图像编码器中,该编码器可与原始 SAM 的掩码解码器自动兼容。
所得到的轻量级模型称为 MobileSAM,其训练可在单张 GPU 上于一天内完成,模型体积比原始 SAM 小 60 倍以上,性能却与原模型相当。