OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2110.01786

MoEfication:利用混合专家思想提升语言模型效率与扩展性

 
  software ·  2026-07-27 11:01:16 · 10 次点击  · 0 条评论  

MoEfication: Transformer Feed-forward Layers are Mixtures of Experts

基本信息

  • 论文标题: MoEfication: Transformer Feed-forward Layers are Mixtures of Experts
  • 作者: Zhengyan Zhang, Yankai Lin, Zhiyuan Liu, Peng Li, Maosong Sun, Jie Zhou
  • 提交日期: 2021年10月5日(v1);最终修订2022年4月5日(v3)
  • 分类: Computer Science > Computation and Language (cs.CL)
  • 论文状态: 已被 ACL Findings 2022 接收
  • 代码链接: https://github.com/thunlp/MoEfication

摘要

近期研究表明,预训练 Transformer 中的前馈网络(FFN)是存储各种语言和事实知识的关键组件。然而,FFN 的计算模式仍不清楚。本文研究了 FFN 的计算模式,观察到大多数输入仅激活 FFN 中极小比例的神经元。这一现象类似于人脑的稀疏性,而该特性推动了对人脑功能分区的研究。为了验证 FFN 中是否也存在功能分区,作者提出将模型转换为具有相同参数的 MoE(Mixture of Experts)版本,称为 MoEfication

具体来说,MoEfication 包含两个阶段:
1. 将 FFN 的参数拆分为多个功能分区作为"专家";
2. 构建专家路由器,为每个输入决定使用哪些专家。

实验结果表明,MoEfication 可以有条件地使用 10% 到 30% 的 FFN 参数,同时在不同模型和多种下游任务上保持超过 95% 的原始性能。此外,MoEfication 带来两个优势:
1. 显著降低推理的浮点运算量(FLOPS),例如仅使用 25% 的 FFN 参数即可实现 2 倍加速;
2. 为研究 FFN 的内部机制提供了细粒度的视角。

10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor