OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2303.16199

LLaMA-Adapter:以参数高效方式快速适配大语言模型

 
  classic ·  2026-08-27 11:01:23 · 1 次点击  · 0 条评论  

LLaMA-Adapter: 基于零初始化注意力机制的高效语言模型微调方法

作者

Renrui Zhang, Jiaming Han, Chris Liu, Peng Gao, Aojun Zhou, Xiangfei Hu, Shilin Yan, Pan Lu, Hongsheng Li, Yu Qiao

摘要

本文提出 LLaMA-Adapter,一种轻量级适配方法,旨在将 LLaMA 高效微调为指令遵循(instruction-following)模型。该方法利用 52K 条 self-instruct 演示数据,在冻结的 LLaMA 7B 模型之上仅引入 120 万(1.2M)个可学习参数,并在 8 张 A100 GPU 上实现 不到一小时的微调成本

具体而言,该方法采用一组可学习的适配提示(adaption prompts),将其前置到较高 Transformer 层的词元(token)之前。同时提出一种带有零门控(zero gating)的零初始化注意力机制,能够自适应地将新的指令线索注入 LLaMA,同时有效保留其预训练知识。

凭借高效训练策略,LLaMA-Adapter 能够生成高质量响应,在性能上与使用全量微调 7B 参数的 Alpaca 模型相当。除语言指令外,该方法还可简单扩展至多模态指令学习,用于训练图像条件 LLaMA 模型,在 ScienceQA 和 COCO Caption 基准上取得了优异的推理性能。此外,研究还在传统视觉与语言任务中评估了零初始化注意力机制对 ViT、RoBERTa 等其他预训练模型的微调效果,验证了该方法优越的泛化能力。

代码已开源:https://github.com/OpenGVLab/LLaMA-Adapter

分类

  • 主要领域:计算机视觉与模式识别(cs.CV)
  • 相关领域:人工智能(cs.AI)、计算与语言(cs.CL)、机器学习(cs.LG)、多媒体(cs.MM)

其他信息

  • 论文编号:arXiv:2303.16199
  • 接收情况:ICLR 2024
  • 提交/修订时间:2023年3月28日提交,2024年9月18日最后修订(v3)
1 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 16 ms
Developed with Cursor