Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Furu Wei
本文提出了 Kosmos-2,一种多模态大语言模型(Multimodal Large Language Model, MLLM),使其具备了感知物体描述(如边界框)并将文本锚定到视觉世界的新能力。具体而言,该模型将引用表达式表示为 Markdown 格式的链接,即 [文本片段](边界框),其中物体描述由一系列位置标记(location tokens)组成。研究团队结合多模态语料库,构建了大规模的有锚定图文对数据(称为 GrIT)来训练该模型。
除了 MLLM 已有的能力(如感知通用模态、遵循指令、进行上下文学习)之外,Kosmos-2 将锚定能力集成到下游应用中。研究团队在广泛的任务上对 Kosmos-2 进行了评估,包括:
该工作为具身人工智能(Embodiment AI)的发展奠定了基础,并揭示了语言、多模态感知、行动与世界建模大融合的方向,这被认为是迈向通用人工智能(AGI)的关键一步。