OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2311.10122v1

Video-LLaVA:统一图像与视频理解的视觉指令微调模型

 
  ancient ·  2026-08-22 11:01:19 · 5 次点击  · 0 条评论  

Video-LLaVA:通过投影前对齐学习统一视觉表示

作者

Bin Lin, Bin Zhu, Yang Ye, Munan Ning, Peng Jin, Li Yuan

摘要

大型视觉语言模型(LVLM)已提升了视觉语言理解中多种下游任务的性能。现有大多数方法将图像和视频编码为独立的特征空间,然后作为输入馈送给大型语言模型。然而,由于图像和视频缺乏统一的 tokenization(即在投影之前未对齐),大型语言模型难以从几个较弱的投影层中学习多模态交互。

在本工作中,作者将视觉表示统一到语言特征空间中,以推动基础 LLM 向统一 LVLM 发展。由此建立了一个简单而稳健的 LVLM 基线——Video-LLaVA,它从图像和视频的混合数据集中学习,使两者相互增强。

Video-LLaVA 在广泛的图像基准测试中取得了优越性能,涵盖 5 个图像问答数据集和 4 个图像基准工具包(共 9 个图像基准)。此外,与 Video-ChatGPT 相比,Video-LLaVA 在 MSRVTT、MSVD、TGIF 和 ActivityNet 上分别提升了 5.8%、9.9%、18.6% 和 10.1%。大量实验表明,Video-LLaVA 在统一的视觉表示下使图像和视频相互受益,超越了专门为图像或视频设计的模型。

主题/分类

计算机视觉与模式识别(cs.CV)

论文信息

  • arXiv ID: 2311.10122v1
  • 提交日期: 2023年11月16日
  • 最新版本: v3(2024年10月1日)
  • DOI: https://doi.org/10.48550/arXiv.2311.10122
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 19 ms
Developed with Cursor