Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen(共 22 位作者)
本文提出了 MMMU(Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark),一个旨在评估多模态模型在需要大学水平学科知识与深度推理的大规模多学科任务上表现的新基准。MMMU 包含 11.5K 道精心收集的多模态题目,来源于大学考试、测验和教科书,覆盖六大核心学科:艺术与设计、商科、科学、健康与医学、人文与社会科学、技术与工程。这些题目横跨 30 个学科、183 个子领域,包含 30 种高度异构的图像类型,如图表、示意图、地图、表格、乐谱和化学结构等。
与现有基准不同,MMMU 聚焦于需要领域特定知识的高级感知与推理任务,使模型面对类似专家所处理的任务。研究团队对 14 个开源 LMM(大型多模态模型)以及专有的 GPT-4V(ision) 和 Gemini 进行了评估,结果显示 MMMU 具有相当大的挑战性——即便是先进的 GPT-4V 和 Gemini Ultra,准确率也仅为 56% 和 59%,表明仍有显著提升空间。