Quentin Garrido, Mahmoud Assran, Nicolas Ballas, Adrien Bardes, Laurent Najman, Yann LeCun
联合嵌入预测架构(Joint-Embedding Predictive Architecture, JEPA)已成为一种有前景的自监督学习方法,它通过利用世界模型进行学习。虽然先前的方法仅限于预测输入的缺失部分,本文探索了如何将JEPA的预测任务推广到更广泛的损坏类型上。我们提出了图像世界模型(Image World Models, IWM),这是一种超越掩码图像建模的方法,学习在潜空间中预测全局光度变换的效果。我们研究了学习高性能IWM的配方,并表明其依赖于三个关键方面:条件设定(conditioning)、预测难度(prediction difficulty)和容量(capacity)。此外,我们展示了通过IWM学习到的预测性世界模型可以通过微调来适应并解决多样化任务;微调后的IWM世界模型在性能上可与之前自监督方法相当或超越它们。最后,我们表明使用IWM学习可以控制所学表示的抽象级别,既能学习如对比方法那样的不变表示,也能学习如掩码图像建模那样的等变表示。