OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2309.12307v1

LongLoRA:通过高效微调扩展大语言模型的长上下文能力

 
  android ·  2026-08-22 11:01:19 · 5 次点击  · 0 条评论  

LongLoRA: 高效微调长上下文大语言模型

基本信息

  • 作者:Yukang Chen, Shengju Qian, Haotian Tang, Xin Lai, Zhijian Liu, Song Han, Jiaya Jia
  • 提交日期:2023年9月21日(v1)
  • 分类:计算与语言(cs.CL);人工智能(cs.AI);机器学习(cs.LG)
  • arXiv 编号:2309.12307

摘要

本文提出 LongLoRA,一种高效的微调方法,用于在有限计算成本下扩展预训练大语言模型(LLMs)的上下文长度。由于长上下文的训练通常需要大量 GPU 资源和训练时间,例如,在 8192 上下文长度上的训练,自注意力层的计算成本是 2048 长度时的 16 倍,本文从两个方面加速 LLM 的上下文扩展:

  1. 稀疏局部注意力:尽管推理时需要密集的全局注意力,但微调可以通过稀疏局部注意力高效完成。提出的 shift short attention 机制有效支持上下文扩展,在计算上显著节省开销,同时保持与使用原始注意力微调相当的性能。该机制在训练时仅需两行代码实现,推理时可选择是否使用。

  2. 参数高效微调:文章重新审视了参数高效微调(PEFT)在上下文扩展中的应用,发现 LoRA 在可训练的嵌入层和归一化层设置下能有效支持长上下文扩展。

LongLoRA 在 LLaMA2 系列模型(7B/13B 至 70B)上展示了强大的实证结果,例如:
- 在单台 8×A100 机器上将 LLaMA2 7B 的上下文从 4k 扩展至 100k;
- 将 LLaMA2 70B 扩展至 32k 上下文。

LongLoRA 扩展模型上下文时保留原始架构不变,且与大多数现有技术(如 FlashAttention-2)兼容。

此外,为促进 LongLoRA 的实际应用,作者收集了 LongQA 数据集用于监督微调,包含超过 3,000 个长上下文问答对。

资源

  • 代码、模型、数据集和演示:https://github.com/dvlab-research/LongLoRA
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 25 ms
Developed with Cursor