Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, Kfir Aberman
大型文本到图像模型在AI发展中实现了显著飞跃,能够从给定的文本提示中生成高质量且多样化的图像。然而,这些模型缺乏模仿给定参考集中主体外观并在不同上下文中合成其新颖再现的能力。
本文提出了一种新的文本到图像扩散模型“个性化”方法。只需输入一个主体的少量图像,即可微调预训练的文本到图像模型,使其学会将唯一标识符与该特定主体绑定。一旦主体嵌入模型的输出域,该唯一标识符便可用于合成主体在不同场景中的新颖逼真图像。
通过利用模型中嵌入的语义先验,并引入一种新的自生类特定先验保持损失(autogenous class-specific prior preservation loss),该技术能够在参考图像中未出现的多样化场景、姿态、视角和光照条件下合成主体。
作者将该技术应用于多个此前难以攻克的任务,包括:主体重情境化(subject recontextualization)、文本引导的视角合成(text-guided view synthesis)以及艺术化渲染(artistic rendering),同时保持主体的关键特征。此外,论文还提供了针对这一主体驱动生成新任务的新数据集和评估协议。