OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.05930

WEBLINX:面向网页导航与操作的真实世界智能体基准

 
  civil ·  2026-09-15 11:01:20 · 9 次点击  · 0 条评论  

WebLINX: Real-World Website Navigation with Multi-Turn Dialogue

基本信息

  • 标题:WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
  • 作者:Xing Han Lù、Zdeněk Kasner、Siva Reddy
  • 发布平台:arXiv(arXiv:2402.05930)
  • 提交时间:2024年2月8日(v1);最后修订于2024年9月10日(v2)
  • 主题分类:Computation and Language (cs.CL);Computer Vision and Pattern Recognition (cs.CV);Machine Learning (cs.LG)
  • DOI:https://doi.org/10.48550/arXiv.2402.05930
  • 项目主页:https://mcgill-nlp.github.io/weblinx

摘要

本文提出了 对话式网页导航(conversational web navigation) 问题:一个数字智能体控制网页浏览器,以多轮对话的方式遵循用户指令来解决现实世界任务。

为支持该问题,作者构建了 WebLINX——一个大规模基准,包含 2300 个专家演示、共计 10 万次交互。该基准覆盖了 150 多个真实网站上的广泛模式,可用于在多样场景下训练和评估智能体。

由于网页信息量巨大,大语言模型(LLM)无法实时处理完整网页。为解决这一瓶颈,作者设计了一个受检索启发的模型,通过对相关元素排序来高效精简 HTML 页面。随后利用筛选出的元素,结合截图和动作历史,评估多种模型在网页导航中复现人类行为的能力。实验范围涵盖从小型纯文本模型到专有多模态 LLM

主要发现

  • 较小的微调解码器(finetuned decoders)超越了最佳的零样本 LLM(包括 GPT-4V)。
  • 这些较小模型同时也超越了在截图上显式预训练的、更大的微调多模态模型。
  • 然而,所有微调模型都难以泛化到未见过的网站

结论与意义

研究结果凸显了对能够泛化到新场景的大型多模态模型的需求。作者的代码、数据和模型均已开放用于研究。

相关链接

  • 代码与数据:https://mcgill-nlp.github.io/weblinx
  • 许可协议:CC BY-SA 4.0
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor