# Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
## 作者
Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, Junyang Lin
## 简介
本文介绍了 Qwen2-VL 系列模型,这是对先前 Qwen-VL 模型的高级升级,旨在重新定义视觉处理中传统的预定义分辨率方法。该模型引入了一种**朴素动态分辨率**(Naive Dynamic Resolution)机制,能够将不同分辨率的图像动态处理为不同数量的视觉 token,从而生成更高效和准确的视觉表示,更接近人类的感知过程。模型还集成了**多模态旋转位置编码**(Multimodal Rotary Position Embedding, M-RoPE),有助于有效融合文本、图像和视频中的位置信息。此外,模型采用统一的范式处理图像和视频,增强了视觉感知能力。
为了探索大型多模态模型的潜力,Qwen2-VL 研究了大视觉语言模型(Large Vision-Language Models, LVLMs)的缩放定律。通过扩展模型规模(提供 2B、8B 和 72B 参数版本)和训练数据量,Qwen2-VL 系列取得了极具竞争力的性能。其中,Qwen2-VL-72B 模型在各种多模态基准测试中达到了与 GPT-4o 和 Claude3.5-Sonnet 等领先模型相当的结果,并优于其他通用模型。
## 主题/分类
- **主要分类**:计算机视觉与模式识别 (Computer Vision and Pattern Recognition, cs.CV)
- **其他分类**:人工智能 (Artificial Intelligence, cs.AI);计算与语言 (Computation and Language, cs.CL)
## 资源
- **论文地址**:[arXiv:2409.12191](https://arxiv.org/abs/2409.12191)
- **代码仓库**:[GitHub: QwenLM/Qwen2-VL](https://github.com/QwenLM/Qwen2-VL)