WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
基本信息
- 标题:WebLINX: Real-World Website Navigation with Multi-Turn Dialogue
- 作者:Xing Han Lù、Zdeněk Kasner、Siva Reddy
- 发布平台:arXiv(arXiv:2402.05930)
- 提交时间:2024年2月8日(v1);最后修订于2024年9月10日(v2)
- 主题分类:Computation and Language (cs.CL);Computer Vision and Pattern Recognition (cs.CV);Machine Learning (cs.LG)
- DOI:https://doi.org/10.48550/arXiv.2402.05930
- 项目主页:https://mcgill-nlp.github.io/weblinx
摘要
本文提出了 对话式网页导航(conversational web navigation) 问题:一个数字智能体控制网页浏览器,以多轮对话的方式遵循用户指令来解决现实世界任务。
为支持该问题,作者构建了 WebLINX——一个大规模基准,包含 2300 个专家演示、共计 10 万次交互。该基准覆盖了 150 多个真实网站上的广泛模式,可用于在多样场景下训练和评估智能体。
由于网页信息量巨大,大语言模型(LLM)无法实时处理完整网页。为解决这一瓶颈,作者设计了一个受检索启发的模型,通过对相关元素排序来高效精简 HTML 页面。随后利用筛选出的元素,结合截图和动作历史,评估多种模型在网页导航中复现人类行为的能力。实验范围涵盖从小型纯文本模型到专有多模态 LLM。
主要发现
- 较小的微调解码器(finetuned decoders)超越了最佳的零样本 LLM(包括 GPT-4V)。
- 这些较小模型同时也超越了在截图上显式预训练的、更大的微调多模态模型。
- 然而,所有微调模型都难以泛化到未见过的网站。
结论与意义
研究结果凸显了对能够泛化到新场景的大型多模态模型的需求。作者的代码、数据和模型均已开放用于研究。
相关链接
- 代码与数据:https://mcgill-nlp.github.io/weblinx
- 许可协议:CC BY-SA 4.0