# MoE-LLaVA: Mixture of Experts for Large Vision-Language Models
**作者:** Bin Lin, Zhenyu Tang, Yang Ye, Jiaxi Cui, Bin Zhu, Peng Jin, Jinfa Huang, Junwu Zhang, Munan Ning, Li Yuan
## 摘要
近期研究表明,扩展大型视觉语言模型(LVLMs)能有效提升下游任务性能。然而,现有的扩展方法使得计算过程中每个token的所有模型参数都被激活,这带来了巨大的训练和推理成本。本文提出了一种简单而有效的LVLM训练策略——MoE-Tuning。该策略创新性地解决了多模态稀疏学习中常见的性能下降问题,从而构建了一个拥有海量参数但计算成本恒定的稀疏模型。此外,我们提出了基于MoE的稀疏LVLM架构——MoE-LLaVA,该架构在部署时通过路由器仅激活top-k个专家,其余专家保持非活跃状态。大量实验表明,MoE-LLaVA在各种视觉理解和物体幻觉基准测试中均取得了显著性能。值得注意的是,仅使用约30亿稀疏激活参数,MoE-LLaVA在多种视觉理解数据集上展现出与LLaVA-1.5-7B相当的性能,甚至在物体幻觉基准测试中超越了LLaVA-1.5-13B。通过MoE-LLaVA,我们旨在为稀疏LVLMs建立一个基线,并为未来开发更高效、更有效的多模态学习系统提供宝贵的见解。
## 主题/分类
- **计算机视觉与模式识别 (cs.CV)**
## 其他信息
- **提交日期:** 2024年1月29日(v1),最新版本更新于2024年12月23日(v5)
- **注释:** 此版本(v2)更新了最新结果并修复了笔误
- **代码:** https://github.com/PKU-YuanGroup/MoE-LLaVA