Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi
由于大规模模型的端到端训练,视觉-语言预训练的成本已经变得日益高昂。本文提出了 BLIP-2,一种通用且高效的预训练策略,它从现成的冻结预训练图像编码器和冻结大语言模型中引导(bootstrap)视觉-语言预训练。BLIP-2 通过一个轻量级的 Querying Transformer 弥合模态差距,该 Transformer 分两个阶段进行预训练。第一阶段从冻结的图像编码器中引导视觉-语言表示学习,第二阶段从冻结的语言模型中引导视觉到语言的生成式学习。
尽管 BLIP-2 的可训练参数远少于现有方法,它在各种视觉-语言任务上仍达到了最先进的性能。例如,我们的模型在零样本 VQAv2 上以 54 倍更少的可训练参数超越了 Flamingo80B 8.7%。我们还展示了模型展现出的零样本图像到文本生成的涌现能力,其能够遵循自然语言指令。
计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)