OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2301.12597v1

BLIP-2:通过轻量桥接模块高效连接视觉编码器与大语言模型

 
  quiver ·  2026-08-22 11:01:16 · 5 次点击  · 0 条评论  

BLIP-2:基于冻结图像编码器与大语言模型的语言-图像预训练引导

作者

Junnan Li, Dongxu Li, Silvio Savarese, Steven Hoi

摘要

由于大规模模型的端到端训练,视觉-语言预训练的成本已经变得日益高昂。本文提出了 BLIP-2,一种通用且高效的预训练策略,它从现成的冻结预训练图像编码器和冻结大语言模型中引导(bootstrap)视觉-语言预训练。BLIP-2 通过一个轻量级的 Querying Transformer 弥合模态差距,该 Transformer 分两个阶段进行预训练。第一阶段从冻结的图像编码器中引导视觉-语言表示学习,第二阶段从冻结的语言模型中引导视觉到语言的生成式学习。

尽管 BLIP-2 的可训练参数远少于现有方法,它在各种视觉-语言任务上仍达到了最先进的性能。例如,我们的模型在零样本 VQAv2 上以 54 倍更少的可训练参数超越了 Flamingo80B 8.7%。我们还展示了模型展现出的零样本图像到文本生成的涌现能力,其能够遵循自然语言指令。

主题/分类

计算机视觉与模式识别(Computer Vision and Pattern Recognition, cs.CV)

论文信息

  • arXiv 编号:2301.12597v1
  • 提交时间:2023年1月30日
  • DOI:https://doi.org/10.48550/arXiv.2301.12597
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 17 ms
Developed with Cursor