OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2308.03688v2

AgentBench:评测大语言模型作为智能体与环境交互的能力

 
  avalon ·  2026-08-24 11:01:15 · 3 次点击  · 0 条评论  

AgentBench: Evaluating LLMs as Agents

作者

Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, Shudan Zhang, Xiang Deng, Aohan Zeng, Zhengxiao Du, Chenhui Zhang, Sheng Shen, Tianjun Zhang, Yu Su, Huan Sun, Minlie Huang, Yuxiao Dong, Jie Tang

摘要

大型语言模型(LLMs)正变得越来越智能和自主,其目标已超越传统NLP任务,转向现实世界的实用任务。因此,迫切需要在交互式环境中评估LLMs作为智能体(Agent)在挑战性任务上的表现。本文提出了 AgentBench,一个多维度、不断演进的基准测试,目前包含 8 个不同的环境,用于在多轮开放生成的设定下评估 LLM-as-Agent 的推理和决策能力。

研究团队对 27 个基于 API 的商业模型和开源(OSS)模型 进行了广泛测试。结果表明,虽然顶尖商业 LLM 在复杂环境中展现出作为智能体的强大能力,但商业模型与开源模型之间存在显著的性能差距。研究还识别了环境和 LLM 中典型的失败原因,指出长期推理能力差、决策能力不足和指令跟随能力弱是开发实用 LLM 智能体的主要障碍。此外,研究发现代码训练数据高质量的多轮对齐数据能够有效提升智能体的性能。

AgentBench 的数据集、环境和集成评估包已发布于 GitHub

主题/分类

  • 主要分类:人工智能(cs.AI)
  • 其他分类:计算与语言(cs.CL)、机器学习(cs.LG)

其他信息

  • 论文编号:arXiv:2308.03688v2
  • 提交/修订日期:2023年8月7日提交(v1),2023年10月25日修订(此版本 v2),最新版本 v3 于 2025年10月4日
  • 页数:55页
3 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 29 ms
Developed with Cursor