Qinkai Zheng, Xiao Xia, Xu Zou, Yuxiao Dong, Shan Wang, Yufei Xue, Zihan Wang, Lei Shen, Andi Wang, Yang Li, Teng Su, Zhilin Yang, Jie Tang
大型预训练代码生成模型(如 OpenAI Codex)能够生成语法和功能正确的代码,从而提高程序员的工作效率,并推动通用人工智能的发展。本文介绍了 CodeGeeX,一个拥有 130 亿参数的多语言代码生成模型。CodeGeeX 在截至 2022 年 6 月的 23 种编程语言的 8500 亿个 token 上进行了预训练。大量实验表明,在 HumanEval-X 基准上,CodeGeeX 在代码生成和代码翻译两项任务中均优于同规模的多语言代码模型。在 HumanEval(仅 Python)的基础上,我们通过手动编写 C++、Java、JavaScript 和 Go 语言的解决方案,开发了 HumanEval-X 基准,用于评估多语言模型。此外,我们还在 Visual Studio Code、JetBrains 和 Cloud Studio 上构建了基于 CodeGeeX 的扩展,每周为数万名活跃用户生成 47 亿个 token。用户研究显示,CodeGeeX 能够帮助 83.4% 的用户提高编码效率。最后,CodeGeeX 可公开访问,我们于 2022 年 9 月开源了其代码、模型权重(8500 亿 token 版本)、API、扩展和 HumanEval-X 基准。