OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2305.05665

ImageBind:统一六种模态到共享嵌入空间的多模态表示学习

 
  arctic ·  2026-09-05 11:01:19 · 12 次点击  · 0 条评论  

ImageBind: One Embedding Space To Bind Them All

作者

Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra

摘要

本文提出了 ImageBind,一种学习跨六种不同模态(图像、文本、音频、深度、热成像和 IMU 数据)联合嵌入的方法。研究表明,训练这种联合嵌入并不需要所有模态组合的配对数据,仅需与图像配对的数据就足以将各模态绑定在一起。ImageBind 能够利用近期大规模视觉-语言模型,仅通过模态与图像的自然配对即可将其零样本能力扩展到新模态。该方法开箱即用地实现了多种新颖的涌现应用,包括跨模态检索、模态算术组合、跨模态检测与生成。这些涌现能力随图像编码器强度的提升而增强,并在跨模态涌现零样本识别任务上刷新了最先进水平,超越了专门训练的监督模型。最后,本文展示了优于先前工作的强少样本识别结果,并表明 ImageBind 可作为评估视觉模型在视觉和非视觉任务上表现的新途径。

主题分类

  • 计算机视觉与模式识别(cs.CV)
  • 人工智能(cs.AI)
  • 机器学习(cs.LG)
  • 多媒体(cs.MM)

其他信息

  • 论文编号: arXiv:2305.05665
  • 提交时间: 2023年5月9日(v1),2023年5月31日(v2)
  • 发表信息: CVPR 2023(Highlighted Paper)
  • 资源链接: 项目网站与代码/模型已公开(见评论区链接)
12 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 13 ms
Developed with Cursor