Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
基本信息
- 标题:Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models
- 作者:Matt Deitke, Christopher Clark, Sangho Lee, Rohun Tripathi, Yue Yang, Jae Sung Park, Mohammadreza Salehi, Niklas Muennighoff, Kyle Lo, Luca Soldaini, Jiasen Lu, Taira Anderson, Erin Bransom, Kiana Ehsani, Huong Ngo, YenSung Chen, Ajay Patel, Mark Yatskar, Chris Callison-Burch, Andrew Head, Rose Hendrix, Favyen Bastani, Eli VanderBilt, Nathan Lambert, Yvonne Chou, Arnavi Chheda, Jenna Sparks, Sam Skjonsberg, Michael Schmitz, Aaron Sarnat, Byron Bischoff, Pete Walsh, Chris Newell, Piper Wolters, Tanmay Gupta, Kuo-Hao Zeng, Jon Borchardt, Dirk Groeneveld, Crystal Nam, Sophie Lebrecht, Caitlin Wittlif, Carissa Schoenick, Oscar Michel, Ranjay Krishna, Luca Weihs, Noah A. Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, Aniruddha Kembhavi
- 提交日期:2024年9月25日(v1),2024年12月5日修订(v2)
- arXiv 编号:arXiv:2409.17146 [cs.CV]
- DOI:https://doi.org/10.48550/arXiv.2409.17146
摘要
当前最先进的视觉语言模型(Vision-Language Models, VLMs)仍为专有模型。最强的开放权重模型严重依赖专有 VLM 生成的合成数据来取得良好性能,实际上是将闭源 VLM 蒸馏为开源模型。因此,社区一直缺乏关于如何从零构建高性能 VLM 的基础知识。
本文提出了 Molmo,一个新的 VLM 系列,在其开放程度类别中达到最先进水平。核心贡献是一组名为 PixMo 的新数据集,包括:
- 用于预训练的高度详细图像描述数据集
- 用于微调的自由形式图像问答数据集
- 创新的 2D 指向(pointing)数据集
以上所有数据均未使用外部 VLM 进行采集。该方法的成功依赖于精心的建模选择、调优良好的训练流程,以及最关键的一点——新采集数据集的质量。
最佳 72B 模型不仅在开放权重与开放数据模型类别中优于其他模型,还超越了更大的专有模型,包括 Claude 3.5 Sonnet 以及 Gemini 1.5 Pro 和 Flash;在学术基准和大规模人工评估中均仅次于 GPT-4o。
模型权重、新数据集和源代码已在 https://molmo.allenai.org/blog 公开。
主题分类
- 主分类:Computer Vision and Pattern Recognition (cs.CV)
- 其他分类:Computation and Language (cs.CL);Machine Learning (cs.LG)
备注
更新版本包含消融实验和更多技术细节。
链接
- 博客与资源:https://molmo.allenai.org/blog
- PDF:https://arxiv.org/pdf/2409.17146