Stable Video Infinity 完全指南:从零到第一个 14 分钟长视频

Stable Video Infinity 完全指南:从零到第一个 14 分钟长视频 Stable Video Infinity 完全指南从零到第一个 14 分钟长视频【免费下载链接】Stable-Video-Infinity[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling项目地址: https://gitcode.com/GitHub_Trending/st/Stable-Video-InfinityStable Video InfinitySVI是 EPFL 团队开源的无限长视频生成框架也是 ICLR 26 Oral 论文的实现。普通视频模型一次最多出 5 秒而 SVI 依靠误差回收微调Error-Recycling Fine-Tuning让模型学会自我修正把单图延展成十几分钟、画面不漂移的长视频。它适合手里有一张图或一段音频、想要分钟级成片的个人创作者也适合想微调专属 LoRA 的开发者。 三个真实使用场景SVI 家族不是单一模型而是一组基于 Wan 2.1 I2V 14B 底模微调的 LoRA。Wan 2.1 原生一次只出几秒直接滚动续接时误差会逐段累积、画面逐渐崩坏——SVI 在训练时就把自生成误差注入模型让它学会识别并修正这类退化这是无限长的核心。单场景图片延展出分钟级长视频手里有一张满意的静图想要它持续动起来且镜头、色调不跑偏。SVI-2.0 或 SVI-Shot 输入一张参考图加一条文字提示流即可官方在 20 分钟级别的测试中未观察到漂移与遗忘适合产品展示、风景延时、氛围空镜。SVI-Shot 单场景长视频的参考图仓库内置测试数据多场景叙事短片想拍一支有镜头切换、情节推进的短片。把故事拆成提示词流5 秒对应一条提示SVI-Film 就能生成电影感的长片。仓库内置的海边测试片段跑完约 50 秒场景切换自然。SVI-Film 电影感长片的参考图仓库内置测试数据说话人长视频有一个人像和一段音频想要口型同步的长对话。SVI-Talk 用人像加音频驱动说话画面官方在 10 分钟测试中无漂移且文字与细节的一致性优于同类的短时长方案。SVI-Talk 长时长下细节保持更好对比 Multitalk 与 InfiniteTalk️ 最短上手路径跑通一次需要三步装环境、下两层模型、执行一条脚本。下面就是全部必须执行的命令。环境配置与显存要求官方在 A100 80GB、CUDA 12.0、torch 2.8.0 上验证过安装脚本实际会装 torch 2.5.0。14B 底模建议准备 48GB 以上显存24GB 消费卡大概率 OOM。conda create -n svi python3.10 -y conda activate svi pip install -e . pip install flash_attn2.8.0.post2装完终端无报错即可。若 flash-attn 编译失败见文末高频问题排查。模型下载模型分两层底模 Wan 2.1 I2V 14B 提供生成能力SVI LoRA 提供误差回收能力两者缺一不可。huggingface-cli download Wan-AI/Wan2.1-I2V-14B-480P \ --local-dir ./weights/Wan2.1-I2V-14B-480P huggingface-cli download vita-video-gen/svi-model \ version-2.0/SVI_Wan2.1-I2V-14B_lora_v2.0.safetensors \ --local-dir ./weights/Stable-Video-Infinity预期weights/下出现两个目录。SVI-1.0 的其余变体在同一个模型仓库的 version-1.0 子目录里按需补下。第一次生成仓库data/toy_test/svi_2.0/内置参考图与提示词测试脚本见 scripts/test/ 目录。直接跑 SVI-2.0 脚本bash scripts/test/svi_2.0.sh预期视频写入videos/svi_2.0/。官方参考数据是 1 分钟视频约 10 分钟单卡 H100480p 下 14 分钟长片在 A100 上数小时跑完属正常区间。 模型选型对比拿不准用哪个变体先看这张表。名称适用场景特点建议SVI-2.0单场景为主兼容部分转场一条提示词流出片稳定性为家族最佳新手默认选择SVI-Shot单场景延展20 分钟测试零漂移零遗忘产品展示、氛围空镜SVI-Film含 Opt 版多场景叙事每条提示词对应 5 秒画面Opt 版长时间画质更好短片创作首选SVI-Talk说话人人像加音频驱动10 分钟测试无漂移数字人、访谈SVI-Dance舞蹈骨架骨骼序列条件生成舞蹈短视频SVI-Tom卡通动画一条提示流生成长卡通片动画风格内容另外SVI-2.0 Pro 与 Wan 2.2 底模的组合位于仓库的 svi_wan22 分支支持更高分辨率本文路径基于 main 分支Wan 2.1 系。SVI 的误差回收训练同时拿到生成与鲁棒性原论文示意⚙️ 核心参数推荐值调参只动下面 5 个都在 scripts/test/ 的脚本里可见。参数作用推荐值调大/调小的影响--num_motion_frames跨片段参考帧数单场景 1多场景 5与训练值对齐最稳调大增强连贯性过度会锁死画面--num_clips生成片段数每片段 81 帧按需如 50越大视频越长显存与耗时线性增长--max_width输入图宽度上限保持宽高比贴近 480×832 训练规格过大偏离训练分布运动变少过小损失细节--cfg_scale_text文字提示跟随强度5.0 起步调大文字更准过大出现重影调小画面自由但提示被忽略--ref_pad_num参考帧填充方式单场景 -1Film 用 0-1 用随机帧填充把任务变成参考图修复基本消灭漂移0 放宽单场景约束主体出画后可能遗忘三条经验参考帧数与分辨率都以训练分布为准先看终端日志里的实际生成分辨率再动手每个片段务必换不同 seed相同噪声会让伪影逐段累积提示词交给 LLM 扩写成叙事风格长句比手写短句效果好。 高频问题排查flash-attn 编译失败多为 torch 与 CUDA 版本不匹配。用独立 conda 环境、锁定 torch2.5.0flash_attn2.8.0.post2仍失败时换预编译 wheel 或查官方 issue 讨论。长视频后半段画质明显下降先查各片段 seed 是否相同再查是否用了量化/蒸馏 LoRA。每段换 seed、采样步数别省量化底模画质打折步数取多些。运动幅度不足、画面像定住输入分辨率偏离 480×832 训练分布是主因把--max_width压回训练附近用终端日志里的实际分辨率核对次要原因是--cfg_scale_text偏低可提到 7 试试。文字提示不跟随把--cfg_scale_text从 5.0 提到 7 左右同时把提示词用 LLM 扩写测试数据与训练数据风格差异越大越需要拉高 CFG。画面逐渐色偏VAE 对静态背景反复编解码的误差会累积加上 LoRA 训练风格受限。最直接的解法是用目标风格的少量视频微调 LoRA详见 docs/FAQ.md Q3。 进阶与资源训练自己的 SVI LoRA 只需几十条视频级别的数据。把数据整理成 data/toy_train/ 的格式Talk 与 Dance 变体先跑 scripts/data_preprocess/ 里的预处理脚本再用scripts/train/中对应的训练脚本启动8 到 64 卡都验证过。训完把权重转成 safetensors再改推理脚本的--extra_module_root指过去。ComfyUI 用户注意SVI LoRA 不能直接用原版 Wan 2.1 工作流参考帧 padding 设置必须改。仓库comfyui_workflow_svi_1.0/内提供 SVI-1.0 官方工作流可直接导入SVI-Film 用 5 个 motion framesSVI-Tom 用 1 个SVI-Shot 另有 VACE 参考图填充装错工作流是社区报障最多的原因。路线图方面Wan 2.2 Animate SVI 正在推进720p 支持在 TODO 清单上Wan 2.2 底模对应 SVI-2.0 Pro 见 svi_wan22 分支。开跑前的验证清单weights/下底模与 SVI LoRA 文件齐全目录结构与 README 一致终端日志打印的生成分辨率贴近 480×832而非原始图片分辨率各片段 seed 互不相同ComfyUI 参考帧填充与 motion frames 数已按变体设置风格偏差靠微调解决不靠堆参数【免费下载链接】Stable-Video-Infinity[ICLR 26 Oral] Stable Video Infinity: Infinite-Length Video Generation with Error Recycling项目地址: https://gitcode.com/GitHub_Trending/st/Stable-Video-Infinity创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考