OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2310.02255v2

MathVista:评测多模态模型数学与视觉推理能力的基准

 
  camera ·  2026-08-12 11:01:18 · 14 次点击  · 0 条评论  

MathVista:在视觉情境中评估数学推理能力

标题

MathVista: Evaluating Math Reasoning in Visual Contexts with GPT-4V, Bard, and Other Large Multimodal Models

作者

Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chunyuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, Jianfeng Gao

摘要

大型语言模型(LLMs)和大型多模态模型(LMMs)在许多任务和领域中展现出令人印象深刻的问题解决能力,但它们在视觉情境中进行数学推理的能力尚未得到系统研究。为填补这一空白,本文提出了 MathVista——一个旨在结合多样化数学与视觉任务挑战的基准测试集。该基准包含 6,141 个示例,来源于 28 个涉及数学的现有多模态数据集,以及 3 个新创建的数据集(即 IQTest、FunctionQA 和 PaperQA)。完成这些任务需要细粒度、深层次的视觉理解与组合推理能力,这对所有最先进的基础模型都具有挑战性。

通过 MathVista,作者对 12 个主流基础模型进行了全面、定量的评估。表现最佳的 GPT-4V 模型实现了 49.9% 的总体准确率,大幅领先第二名 Bard 达 15.1 个百分点。深入分析表明,GPT-4V 的优越性主要归因于其增强的视觉感知和数学推理能力。然而,GPT-4V 仍比人类表现低 10.4 个百分点,因为它常常难以理解复杂图形并进行严格的推理。这一显著差距凸显了 MathVista 在开发能够处理数学密集型且视觉丰富的现实世界任务的通用人工智能代理方面的关键作用。

此外,本文还探索了 GPT-4V 的自验证(self-verification)新能力、自一致性(self-consistency)的应用以及交互式聊天机器人的能力,为其未来研究展示了巨大潜力。

主题/分类

  • 主要分类:计算机视觉与模式识别(cs.CV)
  • 相关分类:人工智能(cs.AI)、计算与语言(cs.CL)、机器学习(cs.LG)

备注

  • 共 112 页,包含 117 张图,属于进行中的工作
  • 项目主页:https://mathvista.github.io/

版本历史

  • v1:2023年10月3日提交
  • v2:2023年10月25日修订
  • v3:2024年1月21日(最新版本)
14 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 19 ms
Developed with Cursor