AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
基本信息
- 作者: Seungwhan Moon, Andrea Madotto, Zhaojiang Lin, Tushar Nagarajan, Matt Smith, Shashank Jain, Chun-Fu Yeh, Prakash Murugesan, Peyman Heidari, Yue Liu, Kavya Srinet, Babak Damavandi, Anuj Kumar
- 提交时间: 2023年9月27日 (v1)
- 分类: 机器学习 (cs.LG),同时涉及计算与语言 (cs.CL) 和计算机视觉与模式识别 (cs.CV)
- arXiv ID: 2309.16058
摘要
本论文提出了 Any-Modality Augmented Language Model (AnyMAL),一个统一的多模态模型,能够对多种输入模态信号(即文本、图像、视频、音频和 IMU 运动传感器数据)进行推理,并生成文本响应。
AnyMAL 继承了最先进 LLM(包括 LLaMA-2 (70B))强大的基于文本的推理能力,并通过预训练的 aligner 模块将各模态特定的信号转换到联合文本空间。为了进一步增强多模态 LLM 的能力,研究者使用人工收集的多模态指令集对模型进行了微调,该指令集涵盖多样化的主题和任务,超越了简单问答的范畴。
研究团队进行了包括人工评估和自动评估在内的全面实证分析,在多种多模态任务上展示了最先进的性能。