OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2405.15793v3

SWE-agent:利用语言模型自动修复真实软件工程任务

 
  captain ·  2026-07-29 11:01:17 · 12 次点击  · 0 条评论  

SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering

作者

John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, Ofir Press

摘要

语言模型(LM)代理越来越多地被用于自动化数字环境中的复杂任务。正如人类在软件工程等复杂任务中受益于强大的软件应用程序(如集成开发环境)一样,本文提出 LM 代理代表了一类新的最终用户,他们有自己的需求和能力,并且将受益于为其专门构建的软件接口。本文研究界面设计如何影响语言模型代理的性能。基于此探索,本文提出了 SWE-agent:一个促进 LM 代理自主使用计算机解决软件工程任务的系统。SWE-agent 的自定义代理-计算机接口(ACI)显著增强了代理创建和编辑代码文件、导航整个代码仓库以及执行测试和其他程序的能力。我们在 SWE-bench 和 HumanEvalFix 上评估了 SWE-agent,分别达到了 12.5% 和 87.7% 的 pass@1 率,在两个基准上均实现了最先进的性能,远超以往使用非交互式 LM 取得的最佳结果。最后,本文提供了关于 ACI 设计如何影响代理行为和性能的见解。

主题/分类

  • 主要分类:软件工程(cs.SE)
  • 相关分类:人工智能(cs.AI)、计算与语言(cs.CL)、人机交互(cs.HC)、机器学习(cs.LG)

其他信息

  • 提交日期:2024年5月6日(v1),最后修订:2024年11月11日(v3)
  • 代码、数据及演示:https://swe-agent.com
12 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor