大型语言模型的引入显著推进了代码生成的发展。然而,开源模型通常缺乏像GPT-4 Code Interpreter这样的先进系统所具备的执行能力和迭代优化功能。为了解决这一问题,作者提出了OpenCodeInterpreter,一个专为生成、执行和迭代优化代码而设计的开源代码系统家族。
该系统由Code-Feedback数据集支持,该数据集包含68K个多轮交互样本。OpenCodeInterpreter将代码执行与人类反馈相结合,实现了动态的代码优化。作者在HumanEval、MBPP及EvalPlus增强版等关键基准上对OpenCodeInterpreter进行了全面评估。
结果显示,OpenCodeInterpreter-33B在HumanEval和MBPP的平均(及plus版本)上取得了83.2(76.4)的准确率,与GPT-4的84.2(76.2)表现相当;引入GPT-4合成的人类反馈后,准确率进一步提升至91.6(84.6)。OpenCodeInterpreter缩小了开源代码生成模型与GPT-4 Code Interpreter等专有系统之间的差距。