Ziyang Luo, Can Xu, Pu Zhao, Qingfeng Sun, Xiubo Geng, Wenxiang Hu, Chongyang Tao, Jing Ma, Qingwei Lin, Daxin Jiang
代码大型语言模型(Code LLMs),如 StarCoder,已在代码相关任务中展现出卓越的性能。然而,现有大多数模型仅在大量原始代码数据上进行预训练,而未经过指令微调。本文提出了 WizardCoder,通过将 Evol-Instruct 方法适配到代码领域,赋予代码大语言模型复杂指令微调的能力。
通过在四个主流代码生成基准(HumanEval、HumanEval+、MBPP 和 DS-1000)上的全面实验,该模型显著超越了所有其他开源代码大语言模型。此外,在 HumanEval 和 HumanEval+ 基准上,WizardCoder 甚至优于最大的闭源大语言模型,包括 Anthropic 的 Claude 和 Google 的 Bard。
代码、模型权重和数据已公开:https://github.com/nlpxucan/WizardLM