Rohit Girdhar, Alaaeldin El-Nouby, Zhuang Liu, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra
本文提出了 ImageBind,一种学习跨六种不同模态(图像、文本、音频、深度、热成像和 IMU 数据)联合嵌入的方法。研究表明,训练这种联合嵌入并不需要所有模态组合的配对数据,仅需与图像配对的数据就足以将各模态绑定在一起。ImageBind 能够利用近期大规模视觉-语言模型,仅通过模态与图像的自然配对即可将其零样本能力扩展到新模态。该方法开箱即用地实现了多种新颖的涌现应用,包括跨模态检索、模态算术组合、跨模态检测与生成。这些涌现能力随图像编码器强度的提升而增强,并在跨模态涌现零样本识别任务上刷新了最先进水平,超越了专门训练的监督模型。最后,本文展示了优于先前工作的强少样本识别结果,并表明 ImageBind 可作为评估视觉模型在视觉和非视觉任务上表现的新途径。