大型视觉语言模型的最新成功展示了其在驱动用户界面(UI)智能体系统方面的巨大潜力。然而,本文认为,像 GPT-4V 这样的多模态模型作为跨不同应用、多操作系统的通用智能体,其能力被大大低估了,原因在于缺少鲁棒的屏幕解析技术。这种技术需要能够:1)可靠地识别用户界面中的可交互图标;2)理解截图中各种元素的语义,并将预期操作与屏幕上的对应区域准确关联起来。
为填补这些空白,本文提出了 OmniParser,一种将用户界面截图解析为结构化元素的综合方法。该方法显著增强了 GPT-4V 生成可精确对应到界面相应区域的操作的能力。研究团队首先利用流行的网页构建了一个可交互图标检测数据集和一个图标描述数据集。利用这些数据集,微调了两个专用模型:一个用于解析屏幕上可交互区域的检测模型,以及一个用于提取检测到的元素功能语义的标题生成模型。
实验结果表明,OmniParser 在 ScreenSpot 基准测试上显著提升了 GPT-4V 的性能。在 Mind2Web 和 AITW 基准测试上,仅使用截图的 OmniParser 输入方式,其表现甚至优于需要额外信息的 GPT-4V 基线方法。