MMMU:面向专家级 AGI 的大规模多学科多模态理解与推理基准
基本信息
- 论文标题:MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI
- 作者:Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen
- 提交日期:2023年11月27日(v1),2023年12月21日(v3,当前版本),最新版本于2024年6月13日更新(v4)
- 页数/图表:117页,99幅图
- 分类:计算与语言(cs.CL)、人工智能(cs.AI)、计算机视觉与模式识别(cs.CV)
- 引用:arXiv:2311.16502 [cs.CL]
摘要
作者提出了 MMMU,这是一个用于评估多模态模型在需要大学水平学科知识和深思熟虑推理的大规模多学科任务上表现的新基准。MMMU 包含 1.15 万个精心收集的多模态问题,来源涵盖大学考试、测验和教科书,覆盖 6 个核心学科:艺术与设计、商业、科学、健康与医学、人文与社会科学、科技与工程。这些问题横跨 30 个主题和 183 个子领域,包含 30 种高度异构的图像类型,如图表、示意图、地图、表格、乐谱和化学结构。
与现有基准不同,MMMU 侧重于结合领域特定知识的高级感知与推理,挑战模型完成类似专家所面对的任务。作者对 14 个开源 LMM 以及专有的 GPT-4V(ision) 和 Gemini 进行了评估,凸显了 MMMU 带来的显著挑战。即便是最先进的 GPT-4V 和 Gemini Ultra,其准确率也分别仅为 56% 和 59%,表明这一领域仍有较大提升空间。作者认为 MMMU 将激励社区构建下一代多模态基础模型,迈向专家级人工通用智能。
关键词
- 多模态理解
- 推理基准
- 大学水平知识
- 专家级人工通用智能