OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2308.12966v1

Qwen-VL:具备视觉理解与多模态对话能力的大模型

 
  galaxy ·  2026-08-22 11:01:16 · 6 次点击  · 0 条评论  

Qwen-VL: 功能强大的前沿视觉语言模型

基本信息

  • 论文 ID: arXiv:2308.12966v1
  • 提交时间: 2023年8月24日(另有更新版本 v2 和 v3)
  • 分类: 计算机视觉与模式识别 (cs.CV); 计算与语言 (cs.CL)

作者

Jinze Bai, Shuai Bai, Shusheng Yang, Shijie Wang, Sinan Tan, Peng Wang, Junyang Lin, Chang Zhou, Jingren Zhou

简介

该论文介绍了 Qwen-VL 系列模型,这是一组大规模视觉语言模型,旨在同时感知和理解文本与图像。该系列包括 Qwen-VLQwen-VL-Chat 两个模型,在图像描述、问答、视觉定位和灵活交互等任务中展现了卓越性能。

主要贡献

  • 性能优异: Qwen-VL 在多个任务上超越了现有的大型视觉语言模型 (LVLMs)
  • 多任务覆盖: 评估范围广泛,包括零样本图像描述(zero-shot captioning)、视觉问答(visual question answering)、文档视觉问答(document VQA)以及视觉定位(grounding)
  • 完整开源: 提供了代码、演示和模型,支持社区复现与研究

评估任务

论文涵盖了以下广泛任务的评估:

  • 零样本图像描述
  • 视觉问答
  • 文档视觉问答
  • 视觉定位(Grounding)

资源链接

该研究展示了 Qwen-VL 系列模型在推进多模态人工智能方面的贡献,并介绍了其架构、训练方法、能力和性能表现。

6 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 32 ms
Developed with Cursor