OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2307.04725v2

AnimateDiff:给文本到图像模型注入时序模块实现动画生成

 
  flamex ·  2026-08-17 11:01:19 · 7 次点击  · 0 条评论  

AnimateDiff:无需特定微调即可为个性化文本到图像扩散模型添加动画

基本信息

  • 论文标题:AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning
  • 作者:Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, Bo Dai
  • 提交日期:2023年7月10日(v1);最后修订:2024年2月8日(v2)
  • 所属领域:计算机视觉与模式识别(cs.CV);交叉领域:图形学(cs.GR)、机器学习(cs.LG)
  • arXiv ID:2307.04725v2

摘要

随着文本到图像(T2I)扩散模型(如 Stable Diffusion)以及 DreamBooth、LoRA 等个性化技术的发展,人们已经能够以较低成本将想象转化为高质量图像。然而,为现有的高质量个性化 T2I 模型添加运动动态并使其生成动画,仍然是一个开放挑战。

本文提出了 AnimateDiff,一个实用框架,无需模型特定微调即可为个性化 T2I 模型添加动画能力。该框架的核心是一个即插即用的运动模块,经过一次训练后,可以无缝集成到任何源自相同基础 T2I 模型的个性化 T2I 模型中。通过所提出的训练策略,该运动模块能够从真实世界视频中有效学习可迁移的运动先验。训练完成后,运动模块可插入个性化 T2I 模型,形成个性化动画生成器。

此外,本文还提出了 MotionLoRA,一种针对 AnimateDiff 的轻量级微调技术,使预训练的运动模块能够以较低的训练和数据收集成本适应新的运动模式(如不同的镜头类型)。

研究团队在社区收集的多个公开代表性个性化 T2I 模型上评估了 AnimateDiff 和 MotionLoRA。结果表明,所提出的方法能够帮助这些模型生成时间上平滑的动画片段,同时保持视觉质量和运动多样性

开源资源

  • 代码和预训练权重:https://github.com/guoyww/AnimateDiff
7 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 19 ms
Developed with Cursor