OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2401.13919v3

WebVoyager:评测 LLM 智能体在真实网页环境中的任务执行能力

 
  ancient ·  2026-08-12 11:01:19 · 16 次点击  · 0 条评论  

WebVoyager:构建基于大型多模态模型的端到端 Web 代理

作者

Hongliang He, Wenlin Yao, Kaixin Ma, Wenhao Yu, Yong Dai, Hongming Zhang, Zhenzhong Lan, Dong Yu

摘要

大型语言模型(LLMs)的快速发展推动了现实场景中自主应用的开发,促进了先进 Web 代理的创新。然而,现有的 Web 代理通常仅处理单一输入模态,且仅在简化的 Web 模拟器或静态网页快照上进行评估,这极大地限制了其在真实场景中的适用性。

为解决这一问题,本文提出了 WebVoyager,一种由大型多模态模型(LMM)驱动的创新 Web 代理,能够通过与真实网站的交互端到端地完成用户指令。此外,作者从 15 个热门网站收集真实世界任务构建了一个新的基准测试,并引入了一种利用 GPT-4V 多模态理解能力的自动评估协议,用于评估开放式 Web 代理。

实验结果显示,WebVoyager 在该基准上达到了 59.1% 的任务成功率,显著超越了 GPT-4(All Tools)和仅文本版 WebVoyager 的性能,彰显了其卓越能力。所提出的自动评估指标与人工判断的一致率达 85.3%,表明其在提供可靠、准确的 Web 代理评估方面的有效性。

主题分类

  • 计算与语言(cs.CL)
  • 人工智能(cs.AI)

arXiv 信息

  • 论文编号:arXiv:2401.13919v3 [cs.CL]
  • 提交时间:2024 年 1 月 25 日(v1)
  • 修订时间:2024 年 2 月 29 日(v3)
  • 最新版本:2024 年 6 月 6 日(v4)
  • DOI:https://doi.org/10.48550/arXiv.2401.13919
16 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 48 ms
Developed with Cursor