OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.17553v1

VILA:面向图像与视频理解的视觉语言大模型

 
  glass ·  2026-08-17 11:01:18 · 9 次点击  · 0 条评论  

OmniACT: 面向桌面与网页的多模态通用自主智能体数据集与基准

作者

Raghav Kapoor, Yash Parag Butala, Melisa Russak, Jing Yu Koh, Kiran Kamble, Waseem Alshikh, Ruslan Salakhutdinov

摘要

数十年来,人机交互从根本上一直是手动的。即使在今天,计算机上几乎所有生产性工作都需要人类在每一步进行输入。自主虚拟智能体代表了自动化许多琐碎任务的重要一步。虚拟智能体将使技术熟练度有限的用户能够充分利用计算机系统的全部可能性,还能以最少的人为干预高效简化众多计算机任务,从日历管理到复杂的旅行预订。

本文介绍了 OmniACT——首个用于评估智能体生成可执行程序以完成计算机任务能力的数据集和基准。其范围超越了传统的网页自动化,涵盖了多样化的桌面应用程序。数据集包含如“播放下一首歌”等基础任务,以及如“给John Doe发送一封提及会面时间和地点的电子邮件”等长时程任务。

具体而言,给定一对屏幕图像基于视觉的自然语言任务,目标是生成能够完全执行该任务的脚本。研究团队在基准上运行了多个强基线语言模型智能体。最强的基线模型 GPT-4 在基准上表现最佳,但其性能水平仍仅达到人类生成可执行脚本熟练度的 15%,这表明该任务对传统网页智能体而言具有挑战性。

该基准为衡量和评估语言模型智能体在自动化计算机任务方面的进展提供了平台,并推动未来构建连接大语言模型与计算机屏幕视觉基础的 multimodal 模型的研究。

主题分类

  • 主要分类:人工智能 (cs.AI)
  • 相关分类:计算与语言 (cs.CL),计算机视觉与模式识别 (cs.CV),人机交互 (cs.HC)

提交信息

  • 首次提交日期:2024年2月27日(v1)
  • 最新版本:2024年7月21日(v3)
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor