Mobile-Agent:具备视觉感知能力的自主多模态移动设备代理
基本信息
- 标题:Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception
- 作者:Junyang Wang、Haiyang Xu、Jiabo Ye、Ming Yan、Weizhou Shen、Ji Zhang、Fei Huang、Jitao Sang
- 提交时间:2024年1月29日(v1),2024年4月18日修订(v2)
- 分类:计算与语言(cs.CL);计算机视觉与模式识别(cs.CV)
- 论文编号:arXiv:2401.16158
- 相关链接:代码与模型将开源至 https://github.com/X-PLUG/MobileAgent
简介
基于多模态大语言模型(MLLM)的移动设备代理正成为一种热门应用。本文介绍了 Mobile-Agent,一个自主的多模态移动设备代理系统。Mobile-Agent 首先利用视觉感知工具准确识别和定位应用前端界面中的视觉与文本元素,然后基于感知到的视觉上下文,自主规划并分解复杂的操作任务,逐步引导移动应用完成操作。
核心特点
- 视觉中心化设计:不同于以往依赖应用 XML 文件或移动系统元数据的方案,Mobile-Agent 采用以视觉为核心的方案,能够在多样化的移动操作环境中实现更强的适应性,无需针对特定系统进行定制。
- 自主任务规划与执行:基于感知到的视觉上下文,自动化地规划、分解复杂操作任务,并逐步执行。
评估与结果
为评估 Mobile-Agent 的性能,作者引入了 Mobile-Eval 基准,用于评估移动设备操作。基于该基准进行的综合评估结果显示,Mobile-Agent 在准确率和任务完成率上均表现突出。即使面对具有挑战性的指令(如跨应用操作),Mobile-Agent 仍能完成要求。
备注
该论文已被 ICLR 2024 Workshop in Large Language Model (LLM) Agents 接收。