OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2404.14619

OpenELM:面向端侧部署的高效开源语言模型

 
  carbon ·  2026-08-20 11:01:14 · 6 次点击  · 0 条评论  

OpenELM:一个具有开放训练与推理框架的高效语言模型家族

作者

Sachin Mehta, Mohammad Hossein Sekhavat, Qingqing Cao, Maxwell Horton, Yanzi Jin, Chenfan Sun, Iman Mirzadeh, Mahyar Najibi, Dmitry Belenko, Peter Zatloukal, Mohammad Rastegari

摘要

大型语言模型的可复现性和透明度对于推动开放研究、确保结果可信度以及开展数据与模型偏差及潜在风险评估至关重要。为此,我们发布了 OpenELM,一个业界领先的开放语言模型。OpenELM 采用逐层缩放策略,在 Transformer 模型的每一层内高效分配参数,从而提升了模型精度。例如,在约十亿参数的预算下,OpenELM 相比 OLMo 在准确率上提升了 2.36%,同时所需的预训练 token 数量减少至其 1/2

与以往仅提供模型权重和推理代码、并在私有数据集上进行预训练的做法不同,我们的发布包含了在公开数据集上训练和评估该语言模型的完整框架,包括训练日志、多个检查点以及预训练配置。我们还发布了将模型转换为 MLX 库格式的代码,以便在 Apple 设备上进行推理和微调。这一全面的发布旨在赋能并壮大开放研究社区,为未来的开放研究工作铺平道路。

主题/分类

  • 计算机科学 > 计算与语言(cs.CL)
  • 人工智能(cs.AI)
  • 机器学习(cs.LG)

关键资源

  • 源代码、预训练模型权重与训练配置:https://github.com/apple/corenet
  • 模型权重(HuggingFace):https://huggingface.co/apple/OpenELM

投稿历史

  • v1 提交日期:2024年4月22日
  • v2 最后修订:2024年5月2日(本版本,含轻微修正)
6 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 23 ms
Developed with Cursor