Zechun Liu, Changsheng Zhao, Forrest Iandola, Chen Lai, Yuandong Tian, Igor Fedorov, Yunyang Xiong, Ernie Chang, Yangyang Shi, Raghuraman Krishnamoorthi, Liangzhen Lai, Vikas Chandra
随着云服务成本上升和延迟问题的日益凸显,移动设备上高效大语言模型的需求不断增长。本文聚焦于设计参数少于十亿的高质量语言模型,这是移动端部署的实用选择。与普遍强调数据和参数量决定模型质量的观点不同,本文研究强调了模型架构对于十亿参数以下规模语言模型的关键作用。
通过采用深而窄的架构,结合嵌入共享和分组查询注意力机制,作者建立了一个名为 MobileLLM 的强基线网络,相较于此前 125M/350M 参数规模的最优模型,分别取得了 2.7%/4.3% 的准确率提升。此外,作者提出了一种即时块级权重共享方法,在不增加模型大小且仅产生轻微延迟开销的情况下,进一步将准确率提升 0.7%/0.8%。在聊天基准测试中,MobileLLM 模型系列相较于之前的十亿以下参数模型有显著改进,并且在 API 调用任务中展现出接近 LLaMA-v2 7B 的正确性,凸显了小模型在常见端侧应用场景中的能力。