Renrui Zhang, Jiaming Han, Chris Liu, Peng Gao, Aojun Zhou, Xiangfei Hu, Shilin Yan, Pan Lu, Hongsheng Li, Yu Qiao
本文提出 LLaMA-Adapter,一种轻量级适配方法,旨在将 LLaMA 高效微调为指令遵循(instruction-following)模型。该方法利用 52K 条 self-instruct 演示数据,在冻结的 LLaMA 7B 模型之上仅引入 120 万(1.2M)个可学习参数,并在 8 张 A100 GPU 上实现 不到一小时的微调成本。
具体而言,该方法采用一组可学习的适配提示(adaption prompts),将其前置到较高 Transformer 层的词元(token)之前。同时提出一种带有零门控(zero gating)的零初始化注意力机制,能够自适应地将新的指令线索注入 LLaMA,同时有效保留其预训练知识。
凭借高效训练策略,LLaMA-Adapter 能够生成高质量响应,在性能上与使用全量微调 7B 参数的 Alpaca 模型相当。除语言指令外,该方法还可简单扩展至多模态指令学习,用于训练图像条件 LLaMA 模型,在 ScienceQA 和 COCO Caption 基准上取得了优异的推理性能。此外,研究还在传统视觉与语言任务中评估了零初始化注意力机制对 ViT、RoBERTa 等其他预训练模型的微调效果,验证了该方法优越的泛化能力。
代码已开源:https://github.com/OpenGVLab/LLaMA-Adapter