大型语言模型(LLM)的快速发展标志着自主应用在真实世界场景中的新纪元,推动了先进 Web 智能体的创新。然而,现有的 Web 智能体通常只能处理单一输入模态,并且仅在简化的 Web 模拟器或静态网页快照中进行评估,这极大地限制了其在真实场景中的适用性。
为弥补这一差距,本文提出了 WebVoyager——一种由大型多模态模型(LMM)驱动的创新型 Web 智能体,能够通过与真实网站的交互端到端地完成用户指令。此外,作者还构建了一个新的基准测试,汇集了来自 15 个热门网站的真实世界任务,并引入了一种利用 GPT-4V 多模态理解能力的自动评估协议,用于评估开放式 Web 智能体。
实验结果表明,WebVoyager 在基准测试上达到了 59.1% 的任务成功率,显著超越了 GPT-4(All Tools)和仅文本模式的 WebVoyager 设置,展现了其卓越的能力。所提出的自动评估指标与人工判断的一致性达到 85.3%,验证了其在提供可靠、准确 Web 智能体评估方面的有效性。