本文提出了 DeepSeek-V2,一个以经济训练和高效推理为特点的强大混合专家(Mixture-of-Experts,MoE)语言模型。该模型包含 236B 总参数,每个 token 激活 21B 参数,并支持 128K tokens 的上下文长度。
DeepSeek-V2 采用了创新的架构,包括多头潜在注意力(Multi-head Latent Attention,MLA)和 DeepSeekMoE。其中,MLA 通过将键值(Key-Value,KV)缓存显著压缩为潜在向量来保证高效推理;DeepSeekMoE 则通过稀疏计算,以经济成本训练强大的模型。
与 DeepSeek 67B 相比,DeepSeek-V2 在性能显著增强的同时,节省了 42.5% 的训练成本,将 KV 缓存减少了 93.3%,并将最大生成吞吐量提升至 5.76 倍。
研究团队在由 8.1T tokens 构成的高质量多源语料库上对 DeepSeek-V2 进行了预训练,并进一步通过监督微调(Supervised Fine-Tuning,SFT)和强化学习(Reinforcement Learning,RL)充分释放其潜力。评估结果表明,即使仅激活 21B 参数,DeepSeek-V2 及其对话版本仍在开源模型中达到了顶尖性能。