近期研究表明,预训练 Transformer 中的前馈网络(FFN)是存储各种语言和事实知识的关键组件。然而,FFN 的计算模式仍不清楚。本文研究了 FFN 的计算模式,观察到大多数输入仅激活 FFN 中极小比例的神经元。这一现象类似于人脑的稀疏性,而该特性推动了对人脑功能分区的研究。为了验证 FFN 中是否也存在功能分区,作者提出将模型转换为具有相同参数的 MoE(Mixture of Experts)版本,称为 MoEfication。
具体来说,MoEfication 包含两个阶段:
1. 将 FFN 的参数拆分为多个功能分区作为"专家";
2. 构建专家路由器,为每个输入决定使用哪些专家。
实验结果表明,MoEfication 可以有条件地使用 10% 到 30% 的 FFN 参数,同时在不同模型和多种下游任务上保持超过 95% 的原始性能。此外,MoEfication 带来两个优势:
1. 显著降低推理的浮点运算量(FLOPS),例如仅使用 25% 的 FFN 参数即可实现 2 倍加速;
2. 为研究 FFN 的内部机制提供了细粒度的视角。