OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  论文  ›  abs/2310.19512

VideoCrafter:高质量开放域文本到视频生成模型

 
  approach ·  2026-09-19 11:01:15 · 5 次点击  · 0 条评论  

VideoCrafter1: Open Diffusion Models for High-Quality Video Generation

基本信息

  • 标题:VideoCrafter1: Open Diffusion Models for High-Quality Video Generation
  • 作者:Haoxin Chen, Menghan Xia, Yingqing He, Yong Zhang, Xiaodong Cun, Shaoshu Yang, Jinbo Xing, Yaofang Liu, Qifeng Chen, Xintao Wang, Chao Weng, Ying Shan
  • 提交日期:2023 年 10 月 30 日(v1)
  • 学科分类:Computer Vision and Pattern Recognition (cs.CV)
  • 备注:Tech Report;GitHub:https://github.com/AILab-CVC/VideoCrafter;主页:https://ailab-cvc.github.io/videocrafter/
  • arXiv ID:arXiv:2310.19512

摘要

视频生成在学术界和工业界都日益受到关注。尽管商业工具能够生成看起来合理的视频,但可供研究人员和工程师使用的开源模型数量有限。在本工作中,作者提出了两个用于高质量视频生成的扩散模型,即文本到视频(T2V)模型和图像到视频(I2V)模型。T2V 模型根据给定的文本输入合成视频,而 I2V 模型则额外引入图像输入。所提出的 T2V 模型能够生成分辨率为 $1024 \times 576$ 的逼真且具有电影级质量的视频,在质量上优于其他开源 T2V 模型。I2V 模型旨在生成严格遵循所提供参考图像内容的视频,保持其内容、结构和风格。该模型是首个开源 I2V 基础模型,能够在保持内容一致性约束的前提下,将给定图像转换为视频片段。作者认为,这些开源视频生成模型将为社区的技术进步做出重要贡献。

主题/分类

  • 主分类:Computer Vision and Pattern Recognition (cs.CV)
5 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 11 ms
Developed with Cursor