OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2306.14824

KOSMOS-2:支持 grounding 的多模态大模型,可连接文本与视觉实体

 
  testing ·  2026-08-17 11:01:18 · 9 次点击  · 0 条评论  

Kosmos-2:将多模态大语言模型与真实世界进行锚定

作者

Zhiliang Peng, Wenhui Wang, Li Dong, Yaru Hao, Shaohan Huang, Shuming Ma, Furu Wei

摘要

本文提出了 Kosmos-2,一种多模态大语言模型(Multimodal Large Language Model, MLLM),使其具备了感知物体描述(如边界框)并将文本锚定到视觉世界的新能力。具体而言,该模型将引用表达式表示为 Markdown 格式的链接,即 [文本片段](边界框),其中物体描述由一系列位置标记(location tokens)组成。研究团队结合多模态语料库,构建了大规模的有锚定图文对数据(称为 GrIT)来训练该模型。

除了 MLLM 已有的能力(如感知通用模态、遵循指令、进行上下文学习)之外,Kosmos-2 将锚定能力集成到下游应用中。研究团队在广泛的任务上对 Kosmos-2 进行了评估,包括:

  1. 多模态锚定:如指代表达理解、短语锚定;
  2. 多模态引用:如指代表达生成;
  3. 感知-语言任务
  4. 语言理解与生成

该工作为具身人工智能(Embodiment AI)的发展奠定了基础,并揭示了语言、多模态感知、行动与世界建模大融合的方向,这被认为是迈向通用人工智能(AGI)的关键一步。

主题分类

  • 计算与语言(cs.CL,主分类)
  • 计算机视觉与模式识别(cs.CV)

补充信息

  • 论文页数:20 页
  • 代码与预训练模型:https://aka.ms/kosmos-2
  • 提交历史:2023 年 6 月 26 日(v1),2023 年 7 月 13 日(v3,当前版本)
9 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 15 ms
Developed with Cursor