OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2403.00504

V-JEPA:通过世界模型式表征学习推进视频理解

 
  day ·  2026-08-10 11:01:21 · 14 次点击  · 0 条评论  

学习并利用视觉表示学习中的世界模型

作者

Quentin Garrido, Mahmoud Assran, Nicolas Ballas, Adrien Bardes, Laurent Najman, Yann LeCun

摘要

联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA)已成为一种有前景的自监督学习方法,它通过利用世界模型进行学习。虽然先前的方法仅限于预测输入的缺失部分,本文探索了如何将JEPA的预测任务推广到更广泛的损坏类型上。我们提出了图像世界模型(Image World Models, IWM),这是一种超越掩码图像建模的方法,学习在潜空间中预测全局光度变换的效果。我们研究了学习高性能IWM的配方,并表明其依赖于三个关键方面:条件设定(conditioning)、预测难度(prediction difficulty)和容量(capacity)。此外,我们展示了通过IWM学习到的预测性世界模型可以通过微调来适应并解决多样化任务;微调后的IWM世界模型在性能上可与之前自监督方法相当或超越它们。最后,我们表明使用IWM学习可以控制所学表示的抽象级别,既能学习如对比方法那样的不变表示,也能学习如掩码图像建模那样的等变表示。

主题分类

  • 计算机视觉与模式识别(cs.CV)
  • 人工智能(cs.AI)
  • 机器学习(cs.LG)

其他信息

  • 提交日期:2024年3月1日
  • 页面:23页,16幅图
  • arXiv编号:2403.00504
14 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 18 ms
Developed with Cursor