OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2310.06770v2

SWE-bench:面向真实 GitHub 问题的软件工程能力评测基准

 
  chair ·  2026-08-24 11:01:15 · 2 次点击  · 0 条评论  

SWE-bench: 语言模型能否解决真实世界的 GitHub 问题?

作者: Carlos E. Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, Karthik Narasimhan

arXiv 编号: 2310.06770 (v2)

提交/修订日期: 2023年10月10日提交 (v1);2024年4月5日修订 (v2);2024年11月11日最新版本 (v3)

主题分类: 计算与语言 (cs.CL);人工智能 (cs.AI);软件工程 (cs.SE)

页面对应介绍: 该论文发表于 ICLR 2024,提供了基准测试的数据、代码和排行榜(访问网站:https://www.swebench.com)。

摘要

语言模型的发展速度已经超过了我们有效评估它们的能力,但研究其能力边界对于未来的发展至关重要。作者发现真实世界的软件工程是一个丰富、可持续且具有挑战性的测试平台,适合评估下一代语言模型。为此,他们引入了 SWE-bench,一个包含 2,294 个软件工程问题的评估框架,这些问题来源于 12 个流行的 Python 仓库中的真实 GitHub issues 及对应的 pull requests。

给定一个代码库和待解决问题的描述,语言模型需要编辑代码库以解决该问题。解决 SWE-bench 中的问题通常需要:

  • 理解并协调多个函数、类甚至文件之间的变更;
  • 与执行环境交互;
  • 处理极长的上下文;
  • 进行远超传统代码生成任务的复杂推理。

评估结果显示,无论是顶尖的专有模型还是作者微调的 SWE-Llama 模型,都只能解决最简单的问题。表现最好的模型 Claude 2 也仅能解决 1.96% 的问题。SWE-bench 上的进展代表着迈向更实用、更智能、更自主的语言模型的步骤。

2 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor