OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2311.16502v2

MMMU:面向大学水平多学科理解与推理的多模态评测集

 
  migration ·  2026-08-12 11:01:18 · 16 次点击  · 0 条评论  

MMMU:面向专家级 AGI 的大规模多学科多模态理解与推理基准

作者

Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, Cong Wei, Botao Yu, Ruibin Yuan, Renliang Sun, Ming Yin, Boyuan Zheng, Zhenzhu Yang, Yibo Liu, Wenhao Huang, Huan Sun, Yu Su, Wenhu Chen(共 22 位作者)

摘要

本文提出了 MMMU(Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark),一个旨在评估多模态模型在需要大学水平学科知识与深度推理的大规模多学科任务上表现的新基准。MMMU 包含 11.5K 道精心收集的多模态题目,来源于大学考试、测验和教科书,覆盖六大核心学科:艺术与设计、商科、科学、健康与医学、人文与社会科学、技术与工程。这些题目横跨 30 个学科、183 个子领域,包含 30 种高度异构的图像类型,如图表、示意图、地图、表格、乐谱和化学结构等。

与现有基准不同,MMMU 聚焦于需要领域特定知识的高级感知与推理任务,使模型面对类似专家所处理的任务。研究团队对 14 个开源 LMM(大型多模态模型)以及专有的 GPT-4V(ision) 和 Gemini 进行了评估,结果显示 MMMU 具有相当大的挑战性——即便是先进的 GPT-4V 和 Gemini Ultra,准确率也仅为 56%59%,表明仍有显著提升空间。

主题/分类

  • 主要分类:计算与语言(cs.CL)
  • 相关分类:人工智能(cs.AI)、计算机视觉与模式识别(cs.CV)

其他信息

  • 页面:117 页,含 99 张图
  • 提交历史:2023 年 11 月 27 日提交初版(v1),2023 年 12 月 18 日修订为 v2,最新版本为 2024 年 6 月 13 日的 v4
16 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 54 ms
Developed with Cursor