Qwen2.5-Coder 技术报告
基本信息
- 标题:Qwen2.5-Coder Technical Report
- 作者:Binyuan Hui, Jian Yang, Zeyu Cui, Jiaxi Yang, Dayiheng Liu, Lei Zhang, Tianyu Liu, Jiajun Zhang, Bowen Yu, Keming Lu, Kai Dang, Yang Fan, Yichang Zhang, An Yang, Rui Men, Fei Huang, Bo Zheng, Yibo Miao, Shanghaoran Quan, Yunlong Feng, Xingzhang Ren, Xuancheng Ren, Jingren Zhou, Junyang Lin
- 提交时间:2024年9月18日(v1);最后修订于2024年11月12日(v3)
- arXiv 编号:arXiv:2409.12186 [cs.CL]
- DOI:https://doi.org/10.48550/arXiv.2409.12186
摘要
本报告介绍了 Qwen2.5-Coder 系列模型,这是其前代 CodeQwen1.5 的重要升级。该系列包含六款模型:Qwen2.5-Coder-(0.5B/1.5B/3B/7B/14B/32B)。作为一个代码专用模型,Qwen2.5-Coder 基于 Qwen2.5 架构构建,并在超过 5.5 万亿 token 的庞大语料库上继续预训练。通过精细的数据清洗、可扩展的合成数据生成以及平衡的数据混合策略,Qwen2.5-Coder 在展现出强大的代码生成能力的同时,保留了通用和数学技能。这些模型在广泛的代码相关任务上进行了评估,在超过 10 个基准测试(包括代码生成、补全、推理和修复)上取得了最先进(SOTA)的性能,并且一致地超越了同等模型规模下更大的模型。作者相信 Qwen2.5-Coder 系列的发布将推动代码智能领域的研究,并且凭借其宽松的许可证,支持开发者在实际应用中更广泛地采用。
主题分类
- 主分类:Computation and Language (cs.CL)
版本历史
- v1:2024年9月18日
- v2:2024年11月11日
- v3:2024年11月12日