OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2303.17568v1

CodeGeeX:大规模多语言代码生成模型与基准

 
  xylophone ·  2026-07-29 11:01:20 · 10 次点击  · 0 条评论  

CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Evaluations on HumanEval-X

作者

Qinkai Zheng, Xiao Xia, Xu Zou, Yuxiao Dong, Shan Wang, Yufei Xue, Zihan Wang, Lei Shen, Andi Wang, Yang Li, Teng Su, Zhilin Yang, Jie Tang

摘要

大型预训练代码生成模型(如 OpenAI Codex)能够生成语法和功能正确的代码,从而提高程序员的工作效率,并推动通用人工智能的发展。本文介绍了 CodeGeeX,一个拥有 130 亿参数的多语言代码生成模型。CodeGeeX 在截至 2022 年 6 月的 23 种编程语言的 8500 亿个 token 上进行了预训练。大量实验表明,在 HumanEval-X 基准上,CodeGeeX 在代码生成和代码翻译两项任务中均优于同规模的多语言代码模型。在 HumanEval(仅 Python)的基础上,我们通过手动编写 C++、Java、JavaScript 和 Go 语言的解决方案,开发了 HumanEval-X 基准,用于评估多语言模型。此外,我们还在 Visual Studio Code、JetBrains 和 Cloud Studio 上构建了基于 CodeGeeX 的扩展,每周为数万名活跃用户生成 47 亿个 token。用户研究显示,CodeGeeX 能够帮助 83.4% 的用户提高编码效率。最后,CodeGeeX 可公开访问,我们于 2022 年 9 月开源了其代码、模型权重(8500 亿 token 版本)、API、扩展和 HumanEval-X 基准。

主题/分类

  • 主要分类:Machine Learning (cs.LG)
  • 相关分类:Artificial Intelligence (cs.AI); Software Engineering (cs.SE)

提交信息

  • 版本:v1(初版)
  • 提交日期:2023 年 3 月 30 日
  • 最新版本:2024 年 7 月 10 日(v2)
10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 13 ms
Developed with Cursor