OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2309.16058v1

AnyMAL:统一多模态输入与多任务学习的大模型方法

 
  juice ·  2026-09-04 11:01:16 · 12 次点击  · 0 条评论  

AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model

基本信息

  • 作者: Seungwhan Moon, Andrea Madotto, Zhaojiang Lin, Tushar Nagarajan, Matt Smith, Shashank Jain, Chun-Fu Yeh, Prakash Murugesan, Peyman Heidari, Yue Liu, Kavya Srinet, Babak Damavandi, Anuj Kumar
  • 提交时间: 2023年9月27日 (v1)
  • 分类: 机器学习 (cs.LG),同时涉及计算与语言 (cs.CL) 和计算机视觉与模式识别 (cs.CV)
  • arXiv ID: 2309.16058

摘要

本论文提出了 Any-Modality Augmented Language Model (AnyMAL),一个统一的多模态模型,能够对多种输入模态信号(即文本、图像、视频、音频和 IMU 运动传感器数据)进行推理,并生成文本响应。

AnyMAL 继承了最先进 LLM(包括 LLaMA-2 (70B))强大的基于文本的推理能力,并通过预训练的 aligner 模块将各模态特定的信号转换到联合文本空间。为了进一步增强多模态 LLM 的能力,研究者使用人工收集的多模态指令集对模型进行了微调,该指令集涵盖多样化的主题和任务,超越了简单问答的范畴。

研究团队进行了包括人工评估和自动评估在内的全面实证分析,在多种多模态任务上展示了最先进的性能

12 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 12 ms
Developed with Cursor