Sachin Mehta, Mohammad Hossein Sekhavat, Qingqing Cao, Maxwell Horton, Yanzi Jin, Chenfan Sun, Iman Mirzadeh, Mahyar Najibi, Dmitry Belenko, Peter Zatloukal, Mohammad Rastegari
大型语言模型的可复现性和透明度对于推动开放研究、确保结果可信度以及开展数据与模型偏差及潜在风险评估至关重要。为此,我们发布了 OpenELM,一个业界领先的开放语言模型。OpenELM 采用逐层缩放策略,在 Transformer 模型的每一层内高效分配参数,从而提升了模型精度。例如,在约十亿参数的预算下,OpenELM 相比 OLMo 在准确率上提升了 2.36%,同时所需的预训练 token 数量减少至其 1/2。
与以往仅提供模型权重和推理代码、并在私有数据集上进行预训练的做法不同,我们的发布包含了在公开数据集上训练和评估该语言模型的完整框架,包括训练日志、多个检查点以及预训练配置。我们还发布了将模型转换为 MLX 库格式的代码,以便在 Apple 设备上进行推理和微调。这一全面的发布旨在赋能并壮大开放研究社区,为未来的开放研究工作铺平道路。