OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2405.04434

DeepSeek-V2:兼顾高性能与低成本训练推理的 MoE 语言模型

 
  iron ·  2026-09-13 11:01:14 · 12 次点击  · 0 条评论  

DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

基本信息

  • 论文标题:DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model
  • 作者:DeepSeek-AI(论文署名包含 DeepSeek-AI 及 Aixin Liu、Bei Feng、Bin Wang 等共 157 位作者)
  • 提交时间:2024 年 5 月 7 日(v1),最后修订于 2024 年 6 月 19 日(v5)
  • arXiv 编号:arXiv:2405.04434 [cs.CL]
  • DOI:https://doi.org/10.48550/arXiv.2405.04434

主题分类

  • 主分类:Computation and Language (cs.CL)
  • 次分类:Artificial Intelligence (cs.AI)

摘要

本文提出了 DeepSeek-V2,一个以经济训练和高效推理为特点的强大混合专家(Mixture-of-Experts,MoE)语言模型。该模型包含 236B 总参数,每个 token 激活 21B 参数,并支持 128K tokens 的上下文长度。

DeepSeek-V2 采用了创新的架构,包括多头潜在注意力(Multi-head Latent Attention,MLA)和 DeepSeekMoE。其中,MLA 通过将键值(Key-Value,KV)缓存显著压缩为潜在向量来保证高效推理;DeepSeekMoE 则通过稀疏计算,以经济成本训练强大的模型。

与 DeepSeek 67B 相比,DeepSeek-V2 在性能显著增强的同时,节省了 42.5% 的训练成本,将 KV 缓存减少了 93.3%,并将最大生成吞吐量提升至 5.76 倍。

研究团队在由 8.1T tokens 构成的高质量多源语料库上对 DeepSeek-V2 进行了预训练,并进一步通过监督微调(Supervised Fine-Tuning,SFT)和强化学习(Reinforcement Learning,RL)充分释放其潜力。评估结果表明,即使仅激活 21B 参数,DeepSeek-V2 及其对话版本仍在开源模型中达到了顶尖性能。

12 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 12 ms
Developed with Cursor