John Yang, Carlos E. Jimenez, Alexander Wettig, Kilian Lieret, Shunyu Yao, Karthik Narasimhan, Ofir Press
语言模型(LM)代理越来越多地被用于自动化数字环境中的复杂任务。正如人类在软件工程等复杂任务中受益于强大的软件应用程序(如集成开发环境)一样,本文提出 LM 代理代表了一类新的最终用户,他们有自己的需求和能力,并且将受益于为其专门构建的软件接口。本文研究界面设计如何影响语言模型代理的性能。基于此探索,本文提出了 SWE-agent:一个促进 LM 代理自主使用计算机解决软件工程任务的系统。SWE-agent 的自定义代理-计算机接口(ACI)显著增强了代理创建和编辑代码文件、导航整个代码仓库以及执行测试和其他程序的能力。我们在 SWE-bench 和 HumanEvalFix 上评估了 SWE-agent,分别达到了 12.5% 和 87.7% 的 pass@1 率,在两个基准上均实现了最先进的性能,远超以往使用非交互式 LM 取得的最佳结果。最后,本文提供了关于 ACI 设计如何影响代理行为和性能的见解。