Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, Dong Yu
大型语言模型(LLMs)的快速发展推动了现实场景中自主应用的开发,促进了先进 Web 代理的创新。然而,现有的 Web 代理通常仅处理单一输入模态,且仅在简化的 Web 模拟器或静态网页快照上进行评估,这极大地限制了其在真实场景中的适用性。
为解决这一问题,本文提出了 WebVoyager,一种由大型多模态模型(LMM)驱动的创新 Web 代理,能够通过与真实网站的交互端到端地完成用户指令。此外,作者从 15 个热门网站收集真实世界任务构建了一个新的基准测试,并引入了一种利用 GPT-4V 多模态理解能力的自动评估协议,用于评估开放式 Web 代理。
实验结果显示,WebVoyager 在该基准上达到了 59.1% 的任务成功率,显著超越了 GPT-4(All Tools)和仅文本版 WebVoyager 的性能,彰显了其卓越能力。所提出的自动评估指标与人工判断的一致率达 85.3%,表明其在提供可靠、准确的 Web 代理评估方面的有效性。