Bin Lin, Bin Zhu, Yang Ye, Munan Ning, Peng Jin, Li Yuan
大型视觉语言模型(LVLM)已提升了视觉语言理解中多种下游任务的性能。现有大多数方法将图像和视频编码为独立的特征空间,然后作为输入馈送给大型语言模型。然而,由于图像和视频缺乏统一的 tokenization(即在投影之前未对齐),大型语言模型难以从几个较弱的投影层中学习多模态交互。
在本工作中,作者将视觉表示统一到语言特征空间中,以推动基础 LLM 向统一 LVLM 发展。由此建立了一个简单而稳健的 LVLM 基线——Video-LLaVA,它从图像和视频的混合数据集中学习,使两者相互增强。
Video-LLaVA 在广泛的图像基准测试中取得了优越性能,涵盖 5 个图像问答数据集和 4 个图像基准工具包(共 9 个图像基准)。此外,与 Video-ChatGPT 相比,Video-LLaVA 在 MSRVTT、MSVD、TGIF 和 ActivityNet 上分别提升了 5.8%、9.9%、18.6% 和 10.1%。大量实验表明,Video-LLaVA 在统一的视觉表示下使图像和视频相互受益,超越了专门为图像或视频设计的模型。
计算机视觉与模式识别(cs.CV)