OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2401.02385v1

TinyLlama:以紧凑参数规模复现 Llama 风格训练范式

 
  sixty ·  2026-08-22 11:01:21 · 9 次点击  · 0 条评论  

TinyLlama:一个开源的小型语言模型

基本信息

  • 论文标题:TinyLlama: An Open-Source Small Language Model(TinyLlama:一个开源的小型语言模型)
  • 作者:Peiyuan Zhang, Guangtao Zeng, Tianduo Wang, Wei Lu
  • 提交日期:2024年1月4日(v1)
  • 分类:计算与语言(cs.CL);人工智能(cs.AI)
  • 类型:技术报告(Technical Report)
  • arXiv ID2401.02385

摘要

本文提出了 TinyLlama,一个紧凑的 1.1B 参数 语言模型,在约 1 万亿个 token 上预训练了大约 3 个 epoch。TinyLlama 基于 Llama 2 的架构和分词器构建,并利用了开源社区贡献的多种技术进展(如 FlashAttention),从而实现了更高的计算效率。尽管模型规模相对较小,TinyLlama 在一系列下游任务中展现了卓越的性能,显著优于现有同规模的开源语言模型。模型检查点和代码已在 GitHub 上公开发布(https://github.com/jzhang38/TinyLlama)。

主题与特点

  • 模型规模:1.1B 参数的小型语言模型
  • 技术基础:基于 Llama 2 架构与分词器
  • 优化技术:采用 FlashAttention 等开源社区贡献的先进方法
  • 性能表现:在多项下游任务中显著优于同规模开源模型
  • 可用性:模型检查点和代码完全公开,开源可复现
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 31 ms
Developed with Cursor