TinyLlama:一个开源的小型语言模型
基本信息
- 论文标题:TinyLlama: An Open-Source Small Language Model(TinyLlama:一个开源的小型语言模型)
- 作者:Peiyuan Zhang, Guangtao Zeng, Tianduo Wang, Wei Lu
- 提交日期:2024年1月4日(v1)
- 分类:计算与语言(cs.CL);人工智能(cs.AI)
- 类型:技术报告(Technical Report)
- arXiv ID:2401.02385
摘要
本文提出了 TinyLlama,一个紧凑的 1.1B 参数 语言模型,在约 1 万亿个 token 上预训练了大约 3 个 epoch。TinyLlama 基于 Llama 2 的架构和分词器构建,并利用了开源社区贡献的多种技术进展(如 FlashAttention),从而实现了更高的计算效率。尽管模型规模相对较小,TinyLlama 在一系列下游任务中展现了卓越的性能,显著优于现有同规模的开源语言模型。模型检查点和代码已在 GitHub 上公开发布(https://github.com/jzhang38/TinyLlama)。
主题与特点
- 模型规模:1.1B 参数的小型语言模型
- 技术基础:基于 Llama 2 架构与分词器
- 优化技术:采用 FlashAttention 等开源社区贡献的先进方法
- 性能表现:在多项下游任务中显著优于同规模开源模型
- 可用性:模型检查点和代码完全公开,开源可复现