OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2203.12119

VPT:通过视觉提示调优高效适配大型视觉模型

 
  rainbow ·  2026-09-02 11:01:14 · 16 次点击  · 0 条评论  

Visual Prompt Tuning

作者

Menglin Jia, Luming Tang, Bor-Chun Chen, Claire Cardie, Serge Belongie, Bharath Hariharan, Ser-Nam Lim

摘要

当前适配预训练模型的主流方法是更新所有骨干网络参数,即全量微调(full fine-tuning)。本文提出了一种名为视觉提示调优(Visual Prompt Tuning, VPT)的高效且有效的替代方案,用于视觉领域的大规模 Transformer 模型。VPT 从近期大型语言模型高效调优的研究进展中汲取灵感,仅在输入空间中引入少量(少于模型参数的 1%)可训练参数,同时保持模型骨干网络冻结。通过在多种下游识别任务上的大量实验,作者展示了 VPT 相比其他参数高效调优协议取得了显著的性能提升。最重要的是,在许多情况下,VPT 在模型容量和训练数据规模上的表现甚至超越了全量微调,同时降低了每个任务的存储成本。

主题/分类

  • 主要分类:计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)

其他信息

  • 评论:ECCV 2022 论文
  • 提交历史:v1 提交于 2022 年 3 月 23 日;v2 最后修订于 2022 年 7 月 20 日
16 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor