作者: Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan
arXiv 编号: 2310.06770 (v2)
提交/修订日期: 2023年10月10日提交 (v1);2024年4月5日修订 (v2);2024年11月11日最新版本 (v3)
主题分类: 计算与语言 (cs.CL);人工智能 (cs.AI);软件工程 (cs.SE)
页面对应介绍: 该论文发表于 ICLR 2024,提供了基准测试的数据、代码和排行榜(访问网站:https://www.swebench.com)。
语言模型的发展速度已经超过了我们有效评估它们的能力,但研究其能力边界对于未来的发展至关重要。作者发现真实世界的软件工程是一个丰富、可持续且具有挑战性的测试平台,适合评估下一代语言模型。为此,他们引入了 SWE-bench,一个包含 2,294 个软件工程问题的评估框架,这些问题来源于 12 个流行的 Python 仓库中的真实 GitHub issues 及对应的 pull requests。
给定一个代码库和待解决问题的描述,语言模型需要编辑代码库以解决该问题。解决 SWE-bench 中的问题通常需要:
评估结果显示,无论是顶尖的专有模型还是作者微调的 SWE-Llama 模型,都只能解决最简单的问题。表现最好的模型 Claude 2 也仅能解决 1.96% 的问题。SWE-bench 上的进展代表着迈向更实用、更智能、更自主的语言模型的步骤。