Menglin Jia, Luming Tang, Bor-Chun Chen, Claire Cardie, Serge Belongie, Bharath Hariharan, Ser-Nam Lim
当前适配预训练模型的主流方法是更新所有骨干网络参数,即全量微调(full fine-tuning)。本文提出了一种名为视觉提示调优(Visual Prompt Tuning, VPT)的高效且有效的替代方案,用于视觉领域的大规模 Transformer 模型。VPT 从近期大型语言模型高效调优的研究进展中汲取灵感,仅在输入空间中引入少量(少于模型参数的 1%)可训练参数,同时保持模型骨干网络冻结。通过在多种下游识别任务上的大量实验,作者展示了 VPT 相比其他参数高效调优协议取得了显著的性能提升。最重要的是,在许多情况下,VPT 在模型容量和训练数据规模上的表现甚至超越了全量微调,同时降低了每个任务的存储成本。