Language Is Not All You Need: Aligning Perception with Language Models
基本信息
- 作者:Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao, Saksham Singhal, Shuming Ma, Tengchao Lv, Lei Cui, Owais Khan Mohammed, Barun Patra, Qiang Liu, Kriti Aggarwal, Zewen Chi, Johan Bjorck, Vishrav Chaudhary, Subhojit Som, Xia Song, Furu Wei
- 提交时间:2023年2月27日(v1),2023年3月1日(v2)
- 分类:计算与语言(cs.CL);计算机视觉与模式识别(cs.CV)
摘要
语言、多模态感知、行动和世界建模的大规模融合是迈向通用人工智能的关键一步。本文提出了 Kosmos-1,一个多模态大语言模型(Multimodal Large Language Model, MLLM),能够感知通用模态、进行上下文学习(即少样本学习),并遵循指令(即零样本学习)。
具体而言,研究团队从零开始在大规模多模态语料库上训练 Kosmos-1,语料包括任意交错的文本与图像、图像-标题对以及纯文本数据。研究在多种设置下(包括零样本、少样本和多模态思维链提示)评估了模型,且在整个评估过程中无需任何梯度更新或微调。
实验结果表明,Kosmos-1 在以下任务上取得了令人印象深刻的表现:
- 语言理解、生成,甚至是免 OCR 的 NLP 任务(直接输入文档图像);
- 感知-语言任务,包括多模态对话、图像描述和视觉问答;
- 视觉任务,例如通过文本指令指定分类标签的图像识别。
此外,研究还表明多模态大语言模型可以受益于跨模态迁移,即知识可以从语言迁移到多模态,也可以从多模态迁移到语言。研究团队还引入了一个 Raven IQ 测试数据集,用于诊断多模态大语言模型的非语言推理能力。