Qwen-VL: 功能强大的前沿视觉语言模型
基本信息
- 论文 ID: arXiv:2308.12966v1
- 提交时间: 2023年8月24日(另有更新版本 v2 和 v3)
- 分类: 计算机视觉与模式识别 (cs.CV); 计算与语言 (cs.CL)
作者
Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, Jingren Zhou
简介
该论文介绍了 Qwen-VL 系列模型,这是一组大规模视觉语言模型,旨在同时感知和理解文本与图像。该系列包括 Qwen-VL 和 Qwen-VL-Chat 两个模型,在图像描述、问答、视觉定位和灵活交互等任务中展现了卓越性能。
主要贡献
- 性能优异: Qwen-VL 在多个任务上超越了现有的大型视觉语言模型 (LVLMs)
- 多任务覆盖: 评估范围广泛,包括零样本图像描述(zero-shot captioning)、视觉问答(visual question answering)、文档视觉问答(document VQA)以及视觉定位(grounding)
- 完整开源: 提供了代码、演示和模型,支持社区复现与研究
评估任务
论文涵盖了以下广泛任务的评估:
- 零样本图像描述
- 视觉问答
- 文档视觉问答
- 视觉定位(Grounding)
资源链接
该研究展示了 Qwen-VL 系列模型在推进多模态人工智能方面的贡献,并介绍了其架构、训练方法、能力和性能表现。