MathVista: Evaluating Math Reasoning in Visual Contexts with GPT-4V, Bard, and Other Large Multimodal Models
Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, Jianfeng Gao
大型语言模型(LLMs)和大型多模态模型(LMMs)在许多任务和领域中展现出令人印象深刻的问题解决能力,但它们在视觉情境中进行数学推理的能力尚未得到系统研究。为填补这一空白,本文提出了 MathVista——一个旨在结合多样化数学与视觉任务挑战的基准测试集。该基准包含 6,141 个示例,来源于 28 个涉及数学的现有多模态数据集,以及 3 个新创建的数据集(即 IQTest、FunctionQA 和 PaperQA)。完成这些任务需要细粒度、深层次的视觉理解与组合推理能力,这对所有最先进的基础模型都具有挑战性。
通过 MathVista,作者对 12 个主流基础模型进行了全面、定量的评估。表现最佳的 GPT-4V 模型实现了 49.9% 的总体准确率,大幅领先第二名 Bard 达 15.1 个百分点。深入分析表明,GPT-4V 的优越性主要归因于其增强的视觉感知和数学推理能力。然而,GPT-4V 仍比人类表现低 10.4 个百分点,因为它常常难以理解复杂图形并进行严格的推理。这一显著差距凸显了 MathVista 在开发能够处理数学密集型且视觉丰富的现实世界任务的通用人工智能代理方面的关键作用。
此外,本文还探索了 GPT-4V 的自验证(self-verification)新能力、自一致性(self-consistency)的应用以及交互式聊天机器人的能力,为其未来研究展示了巨大潜力。