OA0
OA0 是一个探索 AI 的社区
现在注册
已注册用户请  登录
OA0  ›  代码  ›  Open-Sora-Plan — 开源视频生成路线的社区实现

Open-Sora-Plan — 开源视频生成路线的社区实现

 
  boost ·  2026-08-20 11:00:18 · 7 次点击  · 0 条评论  

Open-Sora Plan

Open-Sora Plan

本项目旨在创建一个简单且可扩展的代码仓库,用于复现 Sora(OpenAI,但我们更愿意称之为“ClosedAI”)。

本项目希望通过开源社区的力量复现Sora,由北大-兔展AIGC联合实验室共同发起,来自兔展、华为、鹏城实验室和开源社区伙伴均有深度贡献力量。

当前V1.5版本完全基于华为昇腾训练(昇腾纯血版),欢迎Pull Request和使用!

我们正在快速迭代新版本,欢迎更多合作者或算法工程师加入,算法工程师招聘-兔展智能.pdf

[![arXiv](https://img.shields.io/badge/Arxiv-Open--Sora%20Plan-b31b1b.svg?logo=arXiv)](https://arxiv.org/abs/2412.00131) [![arXiv](https://img.shields.io/badge/Arxiv-Helios-b31b1b.svg?logo=arXiv)](https://arxiv.org/abs/2603.04379) [![arXiv](https://img.shields.io/badge/Arxiv-WF--VAE-b31b1b.svg?logo=arXiv)](https://arxiv.org/abs/2411.17459) [![License](https://img.shields.io/badge/License-Apache-yellow)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/LICENSE)
[![slack badge](https://img.shields.io/badge/Discord-join-blueviolet?logo=discord&)](https://discord.gg/DFZg5678) [![WeChat badge](https://img.shields.io/badge/微信-加入-green?logo=wechat&)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/issues/53#issuecomment-1987226516) [![Twitter](https://img.shields.io/badge/-Twitter@LinBin46984-black?logo=twitter&logoColor=1D9BF0)](https://x.com/LinBin46984/status/1795018003345510687) [![Modelers](https://img.shields.io/badge/%E9%AD%94%E4%B9%90-%E6%A8%A1%E5%9E%8B%E4%BD%93%E9%AA%8C-blue)](https://modelers.cn/spaces/MindSpore-Lab/Open_Sora_Plan)
[![GitHub repo stars](https://img.shields.io/github/stars/PKU-YuanGroup/Open-Sora-Plan?style=flat&logo=github&logoColor=whitesmoke&label=Stars)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/stargazers)  [![GitHub repo forks](https://img.shields.io/github/forks/PKU-YuanGroup/Open-Sora-Plan?style=flat&logo=github&logoColor=whitesmoke&label=Forks)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/network)  [![GitHub repo watchers](https://img.shields.io/github/watchers/PKU-YuanGroup/Open-Sora-Plan?style=flat&logo=github&logoColor=whitesmoke&label=Watchers)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/watchers)  [![GitHub repo size](https://img.shields.io/github/repo-size/PKU-YuanGroup/Open-Sora-Plan?style=flat&logo=github&logoColor=whitesmoke&label=Repo%20Size)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/archive/refs/heads/main.zip)
[![GitHub repo contributors](https://img.shields.io/github/contributors-anon/PKU-YuanGroup/Open-Sora-Plan?style=flat&label=Contributors)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/graphs/contributors) [![GitHub Commit](https://img.shields.io/github/commit-activity/m/PKU-YuanGroup/Open-Sora-Plan?label=Commit)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/commits/main/) [![Pr](https://img.shields.io/github/issues-pr-closed-raw/PKU-YuanGroup/Open-Sora-Plan.svg?label=Merged+PRs&color=green)](https://github.com/PKU-YuanGroup/Open-Sora-Plan/pulls) [![GitHub issues](https://img.shields.io/github/issues/PKU-YuanGroup/Open-Sora-Plan?color=critical&label=Issues)](https://github.com/PKU-YuanGroup/Video-LLaVA/issues?q=is%3Aopen+is%3Aissue) [![GitHub closed issues](https://img.shields.io/github/issues-closed/PKU-YuanGroup/Open-Sora-Plan?color=success&label=Issues)](https://github.com/PKU-YuanGroup/Video-LLaVA/issues?q=is%3Aissue+is%3Aclosed)

PKU-YuanGroup%2FOpen-Sora-Plan | Trendshift

如果您喜欢我们的项目,请在 GitHub 上给我们一个 ⭐ 以获取最新更新。
# 📣 新闻 * **[2026.03.08]** 👋👋👋 我们推出了 [Helios](https://github.com/PKU-YuanGroup/Helios),这是一款突破性的视频生成模型,可在单块 H100 GPU 上以 **19.5 FPS** 的速度实现分钟级、高质量视频合成——无需依赖传统的长视频防漂移策略或标准视频加速技术。欢迎查阅[技术报告](https://huggingface.co/papers/2603.04379)! * **[2025.06.05]** 🔥🔥🔥 我们发布了 1.5.0 版本,这是我们最强大的模型!通过引入**更高压缩率的 WFVAE** 和改进的稀疏 DiT 架构 **SUV**,我们仅用 8B 规模的模型和 4000 万视频样本就实现了**与 HunyuanVideo(开源版)相当的性能**。1.5.0 版本**完全在昇腾 910 系列加速器上完成训练和推理**;请查看 [mindspeed_mmdit](https://github.com/PKU-YuanGroup/Open-Sora-Plan/tree/mindspeed_mmdit) 分支获取我们的新代码,以及 [Report-v1.5.0.md](docs/Report-v1.5.0.md) 获取详细报告。GPU 版本即将推出。 * **[2024.12.03]** ⚡️ 我们发布了 v1.3 的 [arXiv 论文](https://arxiv.org/abs/2412.00131)和 WF-VAE [论文](https://arxiv.org/abs/2411.17459)。下一个更强大的版本即将到来。 * **[2024.10.16]** 🎉 我们发布了 1.3.0 版本,主要特性包括:**WFVAE**、**提示词优化器**、**数据过滤策略**、**稀疏注意力**和 **bucket 训练策略**。我们还支持在 **24G 显存**内生成 93x480p 的视频。更多细节请参见最新的[报告](docs/Report-v1.3.0.md)。 * **[2024.08.13]** 🎉 我们推出了基于 Open-Sora Plan v1.2.0 的 **I2V(图生视频)** 模型。当前版本支持图像到视频的生成以及过渡视频生成(以首帧和尾帧为条件的视频生成)。详情请参阅此[报告](https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/Report-v1.2.0.md#training-image-to-video-diffusion-model)中的 Image-to-Video 部分。 * **[2024.07.24]** 🔥🔥🔥 v1.2.0 版本来了!采用 3D 全注意力架构(而非 2+1D),我们发布了在 4 秒 720p 视频上训练的真正 3D 视频扩散模型。查看我们最新的[报告](docs/Report-v1.2.0.md)。 * **[2024.05.27]** 🎉 我们推出了 Open-Sora Plan v1.1.0,该版本显著提升了视频质量和时长,并且完全开源!请查看我们最新的[报告](docs/Report-v1.1.0.md)。感谢 [ShareGPT4Video](https://sharegpt4video.github.io/) 提供的长视频标注能力。 * **[2024.04.09]** 🤝 很高兴分享我们在变质延时视频生成方面的最新探索:[MagicTime](https://github.com/PKU-YuanGroup/MagicTime),它从延时视频中学习真实世界的物理知识。 * **[2024.04.07]** 🎉🎉🎉 今天我们隆重推出 Open-Sora-Plan v1.0.0,该版本大幅提升了视频生成质量和文本控制能力。详见我们的[报告](docs/Report-v1.0.0.md)。感谢华为 NPU 的支持。 * **[2024.03.27]** 🚀🚀🚀 我们发布了 [VideoCausalVAE](docs/CausalVideoVAE.md) 的报告,该模型同时支持图像和视频。我们在演示中展示了重建视频的效果。文本生成视频的模型正在开发中。 * **[2024.03.01]** 🤗 我们启动了名为 Open-Sora Plan 的 Sora 复现计划!欢迎**关注** 👀 此仓库以获取最新更新。 # 😍 作品展示 Open-Sora Plan v1.5.0 的文本生成视频效果。 ### Youtube: [![Demo Video of Open-Sora Plan V1.5.0](https://github.com/user-attachments/assets/130bbba2-3ded-4092-92ef-b65b673cb1a6)](https://youtu.be/IiWTdx2EHCY) ### Bilibili: [![Demo Video of Open-Sora Plan V1.5.0](https://github.com/user-attachments/assets/130bbba2-3ded-4092-92ef-b65b673cb1a6)](https://www.bilibili.com/video/BV1X77tzxE3b/) # 😮 项目亮点 Open-Sora Plan 在视频生成方面表现出色。 ### 🔥 更高性能和压缩率的 WFVAE - 采用 8×8×8 下采样率,但 PSNR 高于 Wan2.1 使用的 VAE。降低了其之上构建的 DiT 的训练成本。 ### 🚀 更强大的稀疏 DiT - 更强大的稀疏注意力架构 SUV,在提供超过 35% 加速的同时,性能接近密集 DiT。

# 🐳 资源 | 版本 | 架构 | 扩散模型 | CausalVideoVAE | 数据 | 提示词优化器 | |:---|:---|:---|:---|:---|:---| | v1.5.0 | SUV (Skiparse 3D) | [121x576x1024](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.5.0/blob/main/MindSpeed/model_ema.pt)[5] | [Anysize_8x8x8_32dim](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.5.0/blob/main/MindSpeed/wfvae_888_dim32.ckpt) | - | - | | v1.3.0 [4] | Skiparse 3D | [Anysize in 93x640x640](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.3.0/tree/main/any93x640x640)[3], [Anysize in 93x640x640_i2v](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.3.0/tree/main/any93x640x640_i2v)[3] | [Anysize](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.3.0/tree/main/vae)| [prompt_refiner](https://huggingface.co/datasets/LanguageBind/Open-Sora-Plan-v1.3.0/tree/main/prompt_refiner) | [checkpoint](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.3.0/tree/main/prompt_refiner)| | | v1.2.0 | Dense 3D | [93x720p](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/93x720p), [29x720p](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/29x720p)[1], [93x480p](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/93x480p)[1,2], [29x480p](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/29x480p), [1x480p](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/1x480p), [93x480p_i2v](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/93x480p_i2v) | [Anysize](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.2.0/tree/main/vae)| [Annotations](https://huggingface.co/datasets/LanguageBind/Open-Sora-Plan-v1.2.0) | - | | v1.1.0 | 2+1D | [221x512x512](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.1.0/tree/main/221x512x512), [65x512x512](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.1.0/tree/main/65x512x512) |[Anysize](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.1.0/tree/main/vae) |[Data and Annotations](https://huggingface.co/datasets/LanguageBind/Open-Sora-Plan-v1.1.0)| - | | v1.0.0 | 2+1D | [65x512x512](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.0.0/tree/main/65x512x512), [65x256x256](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.0.0/tree/main/65x256x256), [17x256x256](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.0.0/tree/main/17x256x256) | [Anysize](https://huggingface.co/LanguageBind/Open-Sora-Plan-v1.0.0/tree/main/vae) | [Data and Annotations](https://huggingface.co/datasets/LanguageBind/Open-Sora-Plan-v1.0.0)| - | > [1] 请注意,v1.2.0 的 29×720p 和 93×480p 权重在 Panda70M 上训练,未经过最终的高质量数据微调,因此可能产生水印。 > [2] 我们从 93×720p 微调了 3.5k 步得到 93×480p,供社区研究使用。 > [3] 该模型在 stride=32 上任意训练。因此,请保持推理分辨率是 32 的倍数。帧数需为 4n+1,例如 93、77、61、45、29、1(图像)。 > [4] 模型权重也可在 [OpenMind](https://modelers.cn/models/linbin/Open-Sora-Plan-v1.3.0) 和 [WiseModel](https://wisemodel.cn/models/PKU-YUAN/Open-Sora-Plan-v1.3.0) 获取。 > [5] 当前模型权重仅与 NPU + MindSpeed-MM 框架兼容。模型权重也可在 [modelers](https://modelers.cn/models/PKU-YUAN-Group/Open-Sora-Plan-v1.5.0/tree/main/MindSpeed) 获取。 > [!Warning] > >

> > 🚨 对于 1.2.0 版本,我们不再支持 2+1D 模型。 > >
# ⚙️ 快速开始 ### GPU 即将推出... ### NPU 请查看 **[mindspeed_mmdit](https://github.com/PKU-YuanGroup/Open-Sora-Plan/tree/mindspeed_mmdit)** 分支,并按照其中的 README.md 进行配置。 # 📖 技术报告 请查看 [Report-v1.5.0.md](docs/Report-v1.5.0.md)。 # 💡 如何贡献 我们非常感谢您对 Open-Sora Plan 开源社区的贡献,并帮助我们将其变得比现在更好! 更多详情请参阅[贡献指南](docs/Contribution_Guidelines.md)。 # 👍 致谢与相关工作 * [Allegro](https://github.com/rhymes-ai/Allegro):Allegro 是一个强大的文本到视频模型,基于我们的 Open-Sora Plan,仅通过简单文本输入即可生成高达 6 秒、15 FPS、720p 分辨率的高质量视频。开源的意义正变得越来越切实可见。 * [Latte](https://github.com/Vchitect/Latte):一个出色的 2+1D 视频生成模型。 * [PixArt-alpha](https://github.com/PixArt-alpha/PixArt-alpha):用于逼真文生图合成的扩散 Transformer 快速训练。 * [ShareGPT4Video](https://github.com/InternLM/InternLM-XComposer/tree/main/projects/ShareGPT4Video):通过更好的标题提升视频理解与生成能力。 * [VideoGPT](https://github.com/wilson1yan/VideoGPT):使用 VQ-VAE 和 Transformers 进行视频生成。 * [DiT](https://github.com/facebookresearch/DiT):基于 Transformer 的可扩展扩散模型。 * [FiT](https://github.com/whlzy/FiT):灵活的扩散模型视觉 Transformer。 * [Positional Interpolation](https://arxiv.org/abs/2306.15595):通过位置插值扩展大语言模型的上下文窗口。 # 🔒 许可证 * 详情请参见[许可证](LICENSE)。 ## ✨ Star 历史 [![Star History](https://api.star-history.com/svg?repos=PKU-YuanGroup/Open-Sora-Plan)](https://star-history.com/#PKU-YuanGroup/Open-Sora-Plan&Date) # ✏️ 引用
@article{lin2024open,
  title={Open-Sora Plan: Open-Source Large Video Generation Model},
  author={Lin, Bin and Ge, Yunyang and Cheng, Xinhua and Li, Zongjian and Zhu, Bin and Wang, Shaodong and He, Xianyi and Ye, Yang and Yuan, Shenghai and Chen, Liuhan and others},
  journal={arXiv preprint arXiv:2412.00131},
  year={2024}
}
@article{helios,
  title={Helios: Real Real-Time Long Video Generation Model},
  author={Yuan, Shenghai and Yin, Yuanyang and Li, Zongjian and Huang, Xinwei and Yang, Xiao and Yuan, Li},
  journal={arXiv preprint arXiv:2603.04379},
  year={2026}
}
@article{li2024wf,
  title={WF-VAE: Enhancing Video VAE by Wavelet-Driven Energy Flow for Latent Video Diffusion Model},
  author={Li, Zongjian and Lin, Bin and Ye, Yang and Chen, Liuhan and Cheng, Xinhua and Yuan, Shenghai and Yuan, Li},
  journal={arXiv preprint arXiv:2411.17459},
  year={2024}
}
# 🤝 社区贡献者
7 次点击  ∙  0 人收藏  
登录后收藏  
0 条回复
关于 ·  帮助 ·  PING ·  隐私 ·  条款   
OA0 - Omni AI 0 一个探索 AI 的社区
沪ICP备2024103595号-2
耗时 17 ms
Developed with Cursor