随着文本到图像(T2I)扩散模型(如 Stable Diffusion)以及 DreamBooth、LoRA 等个性化技术的发展,人们已经能够以较低成本将想象转化为高质量图像。然而,为现有的高质量个性化 T2I 模型添加运动动态并使其生成动画,仍然是一个开放挑战。
本文提出了 AnimateDiff,一个实用框架,无需模型特定微调即可为个性化 T2I 模型添加动画能力。该框架的核心是一个即插即用的运动模块,经过一次训练后,可以无缝集成到任何源自相同基础 T2I 模型的个性化 T2I 模型中。通过所提出的训练策略,该运动模块能够从真实世界视频中有效学习可迁移的运动先验。训练完成后,运动模块可插入个性化 T2I 模型,形成个性化动画生成器。
此外,本文还提出了 MotionLoRA,一种针对 AnimateDiff 的轻量级微调技术,使预训练的运动模块能够以较低的训练和数据收集成本适应新的运动模式(如不同的镜头类型)。
研究团队在社区收集的多个公开代表性个性化 T2I 模型上评估了 AnimateDiff 和 MotionLoRA。结果表明,所提出的方法能够帮助这些模型生成时间上平滑的动画片段,同时保持视觉质量和运动多样性。