Raghav Kapoor, Yash Parag Butala, Melisa Russak, Jing Yu Koh, Kiran Kamble, Waseem Alshikh, Ruslan Salakhutdinov
数十年来,人机交互从根本上一直是手动的。即使在今天,计算机上几乎所有生产性工作都需要人类在每一步进行输入。自主虚拟智能体代表了自动化许多琐碎任务的重要一步。虚拟智能体将使技术熟练度有限的用户能够充分利用计算机系统的全部可能性,还能以最少的人为干预高效简化众多计算机任务,从日历管理到复杂的旅行预订。
本文介绍了 OmniACT——首个用于评估智能体生成可执行程序以完成计算机任务能力的数据集和基准。其范围超越了传统的网页自动化,涵盖了多样化的桌面应用程序。数据集包含如“播放下一首歌”等基础任务,以及如“给John Doe发送一封提及会面时间和地点的电子邮件”等长时程任务。
具体而言,给定一对屏幕图像和基于视觉的自然语言任务,目标是生成能够完全执行该任务的脚本。研究团队在基准上运行了多个强基线语言模型智能体。最强的基线模型 GPT-4 在基准上表现最佳,但其性能水平仍仅达到人类生成可执行脚本熟练度的 15%,这表明该任务对传统网页智能体而言具有挑战性。
该基准为衡量和评估语言模型智能体在自动化计算机任务方面的进展提供了平台,并推动未来构建连接大语言模型与计算机屏幕视觉基础的 multimodal 模型的研究。