OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2402.14905

MobileLLM:为端侧设备优化的高效语言模型

 
  gossamer ·  2026-08-09 11:01:13 · 10 次点击  · 0 条评论  

MobileLLM:面向端侧应用场景的十亿以下参数语言模型优化

作者

Zechun Liu, Changsheng Zhao, Forrest Iandola, Chen Lai, Yuandong Tian, Igor Fedorov, Yunyang Xiong, Ernie Chang, Yangyang Shi, Raghuraman Krishnamoorthi, Liangzhen Lai, Vikas Chandra

摘要

随着云服务成本上升和延迟问题的日益凸显,移动设备上高效大语言模型的需求不断增长。本文聚焦于设计参数少于十亿的高质量语言模型,这是移动端部署的实用选择。与普遍强调数据和参数量决定模型质量的观点不同,本文研究强调了模型架构对于十亿参数以下规模语言模型的关键作用。

通过采用深而窄的架构,结合嵌入共享分组查询注意力机制,作者建立了一个名为 MobileLLM 的强基线网络,相较于此前 125M/350M 参数规模的最优模型,分别取得了 2.7%/4.3% 的准确率提升。此外,作者提出了一种即时块级权重共享方法,在不增加模型大小且仅产生轻微延迟开销的情况下,进一步将准确率提升 0.7%/0.8%。在聊天基准测试中,MobileLLM 模型系列相较于之前的十亿以下参数模型有显著改进,并且在 API 调用任务中展现出接近 LLaMA-v2 7B 的正确性,凸显了小模型在常见端侧应用场景中的能力。

主题/分类

  • 主要分类:机器学习(cs.LG)
  • 相关分类:人工智能(cs.AI)、计算与语言(cs.CL)
  • 会议:ICML 2024

其他信息

10 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 41 ms
Developed with Cursor