Open-Sora-Plan 入门实战:文生视频,3 步跑出你的第一条 AI 视频

Open-Sora-Plan 入门实战:文生视频,3 步跑出你的第一条 AI 视频 Open-Sora-Plan 入门实战文生视频3 步跑出你的第一条 AI 视频【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-PlanOpen-Sora-Plan 是一个复现 Sora 的开源文生视频项目。你输入一句英文描述它输出一段对应的视频。这篇文章写给想试水视频生成、但不知道从哪下手的你。 Open-Sora-Plan 能做什么3 个文生视频场景它用文字当输入生成完整的视频片段覆盖文生视频和图片生视频两条路线。一句话提示词生成视频你写一段场景描述它生成几秒的视频。你会看到镜头有运动、角色有动作接近一段真实拍摄的画面。静态图变成动态视频给它一张图片当首帧它能让画面动起来。你会看到静止的图变成一个会动的场景适合给封面图加动态效果。提示词文件批量生成你把一堆提示词放进一个文本文件它逐条各生成一条视频。你会看到一个文件夹里塞满成片每条对应一行文字。 动手之前最简配置清单先确认硬件和软件具体依赖版本以 pyproject.toml 为准硬件GPU 版本推荐多卡 H100v1.5.0 完全基于昇腾 910NPU训练和推理软件Python 3.8PyTorch 2.1.0其余依赖随包一起装权重各版本的模型文件单独下载地址见仓库 README然后拉代码并安装git clone https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan cd Open-Sora-Plan pip install -e .环境上遇到报错先翻仓库 README 和 docs/ 下的版本报告比看零散帖子更靠谱。 跑起来生成你的第一条视频下面走 v1.3.0 的 GPU 推理主线v1.5.0 是 NPU 版需切到对应分支。第一步准备一个提示词文件内容可以照抄 examples/sora.txtecho a cat playing with a ball in a park, sunny day my_prompt.txt第二步跑推理脚本。它参照 scripts/text_condition/gpu/sample_t2v_v1_3.sh把 model_path 和 ae_path 换成你下载的位置即可torchrun --nproc_per_node 8 -m opensora.sample.sample \ --model_path model_path --version v1_3 \ --text_prompt my_prompt.txt \ --ae WFVAEModel_D8_4x8x8 --ae_path ae_path跑完后--save_img_path 目录里会存下一个 mp4 文件。这是约 5 秒、93 帧、352×640 分辨率的视频。打开看你提示词里的场景已经变成会动的画面了。 它凭什么快和好两个核心技术点第一个是 WFVAE一个视频压缩模型。VAE 先把视频压成小数字潜空间后面的主模型只处理这些数字。WFVAE 用 8×8×8 的压缩率把潜空间形状缩到一半。DiT 的训练成本随之下降重建质量反而更高。它的 PSNR分数越高重建越清晰还超过了社区常用的 4×8×8 VAE模型下采样率PSNRLPIPSCogVideoX4×8×836.380.0243Wan2.14×8×835.770.0197WF-VAE-M本项目8×8×836.910.0205第二个是 SUV一个稀疏 U 型 DiT。DiT 是用 Transformer 做视频生成的主网络。SUV 不改变特征的形状只减少 token视频里的一小块画面之间的交互次数。在昇腾 910B 上它比密集 DiT 推理快超过 35%生成质量几乎不掉。以上数据以项目最新文档为准。 能拿它来干嘛3 个可直接复制的场景下面的提示词都可以直接粘贴使用。给初二生物课做光合作用动态图解A 3D animated diagram of photosynthesis in a leaf, sunlight and water entering, oxygen releasing, clear labels, educational style给历史课重现古罗马市集An ancient Roman marketplace, busy traders, stone buildings, historical atmosphere, cinematic lighting给物理课做火山喷发模拟A volcano eruption simulation, lava flowing down the mountain, educational, detailed, realistic生成后直接投屏讲或者录进课件里都比静态 PPT 有代入感。⚖️ 横向对比v1.5.0 和开源同行差多少在 Vbench 基准上8B 的 v1.5.0 追平了 13B 的 HunyuanVideo开源版语义和美学两项还更高模型参数规模总分质量分语义分美学分CogVideoX-5B5B81.61%82.75%77.04%61.98%HunyuanVideo开源版13B83.24%85.09%75.82%60.36%Open-Sora-Plan v1.5.08B83.02%84.24%78.18%66.89%8B 的参数量效果贴着 13B 走语义分和美学分还是最高的。数据以项目最新文档为准。 接下来去哪docs/Report-v1.5.0.mdv1.5.0 完整技术报告docs/Contribution_Guidelines.md贡献流程说明scripts/训练和推理脚本合集建议你先跑通 v1.3.0 的 GPU 版有昇腾环境再上 v1.5.0。下一步动作改一下 examples/sora.txt 里的一行字重新跑看看视频怎么变。【免费下载链接】Open-Sora-PlanThis project aim to reproduce Sora (Open AI T2V model), we wish the open source community contribute to this project.项目地址: https://gitcode.com/GitHub_Trending/op/Open-Sora-Plan创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考