ComfyUI实战:搭建本地生图+视频一体化AI工作流

ComfyUI实战:搭建本地生图+视频一体化AI工作流 本地AI 部署现在并不是新鲜话题但“生图 视频一体化”这个组合仍然让很多人既感兴趣又怕踩坑。所谓一体化方案并不是某个大模型同时干两件事而是把开源生图模型、开源视频生成模型、节点式工作流引擎和模型管理组件拼成一条完整链路输入一句话先出图再让图动起来或者直接把一句话变成短视频。下面的内容以 ComfyUI 作为统一调度层从环境准备、模型下载、工作流搭建到结果验证把这条链路完整走一遍。先说明一个态度网上常见的“跑不出效果你找我”这类承诺并不严谨。本地 AI 效果受显卡型号、显存、驱动、Python 版本、模型文件、节点版本等多个变量影响任何一环不一致结果都可能完全不同。与其相信一句口号不如把每一步的原理和检查点搞清楚。读完这篇文章你可以获得一套能够自己排查问题的部署方法而不是一个碰运气的安装包。整条链路会拆成五件事理解一体化结构、准备环境、跑通生图、接入视频、验证与排错。1. 先拆解“生图视频一体化”到底由哪些部分组成1.1 一体化是流程一体化不是一个模型干所有事很多第一次接触这类方案的人会误以为存在一个“生图大模型”加一个“视频大模型”打成一个包。实际上开源社区的一体化方案是分层组合生图模型负责静态画面的构图、光影、风格常见的有 SD 1.5、SDXL、Flux 系列。视频模型负责在时间维度上生成连续帧常见的有 Wan 2.1/2.2、LTX-Video、AnimateDiff、Stable Video Diffusion 等。工作流引擎负责把“文字描述、模型加载、采样、解码、输出合成”串起来ComfyUI 是这一层最常用的开源选择。附件组件负责视频合成、帧序列处理、模型管理例如 VideoHelperSuite、ComfyUI Manager。所以一体化方案的本质是“流水线一体化”不是模型一体化。生图模型和视频模型各管一段工作流引擎把两段结果按顺序接起来。理解这一点后续遇到报错时才能判断问题出在哪个环节。1.2 为什么推荐 ComfyUI 作为统一调度层ComfyUI 是一个基于节点的开源工作流工具用户通过连接节点来定义生成任务。和 WebUI 这类偏“填表式”的工具相比它在生图 视频一体化场景上有几个实打实的优势第一节点可以复用。生图链路已经生成好的图片或 latent可以直接作为图生视频视频链路的输入不需要单独写胶水代码。第二自定义节点生态完整。视频生成模型基本都有对应的 wrapper 节点安装后就能在画布里拖拽使用典型的有 WanVideoWrapper、AnimateDiff Evolved、VideoHelperSuite 等。第三工作流可以导出为 JSON 文件。一个团队里A 调好的参数和节点连接关系发给 B 后导入即可复现非常适合排查“为什么我跑出来不一样”这类问题。第四自带 API 模式。ComfyUI 启动后本身监听本地 HTTP 端口可以把工作流封装成请求提交方便接入自己的脚本和业务系统。1.3 本地开源方案与在线工具的真实差异在一些推广文案里会看到“效果硬刚即梦 2.5”之类的说法。这里需要提醒一句即梦这类产品是云端大规模集群推理本地单卡方案在模型规模上天然不占优。所谓“硬刚”必须落到具体模型、具体提示词、具体硬件上才有意义任何脱离环境的对比都容易变成口号。从选型角度本地方案和在线工具的取舍关系可以用一张表说明对比维度在线 AI 创作工具如即梦本地开源方案算力来源云端大规模集群本地单卡受显存和内存限制单次成本订阅或按生成次数计费主要是电费和硬件折旧数据隐私素材和生成结果会经过云端数据不离开本机可控性官方限定的参数和风格模型、采样器、CFG、LoRA、工作流全部可控使用门槛打开网页即可用需要安装环境、下载模型、处理依赖模型协议由平台规则决定取决于具体开源模型的许可证这张表说明的核心判断是本地方案适合对隐私、成本、可控性有要求的场景但要求使用者具备基本的命令行和排错能力。如果只是偶尔生成一张图在线工具体验更好如果要把生图和视频链路做成可复用的生产流程本地方案更值得投入。2. 环境准备显存、驱动、Python 与 ComfyUI 安装2.1 先确认显卡和显存底线在下载任何模型之前先确认硬件能不能跑否则后面所有安装都是在浪费时间。本地生图和视频生成对显卡的依赖程度很高尤其是显存。显存能稳定运行的典型范围建议6GBSD 1.5 生图视频生成非常吃力只做生图学习8GBSDXL 生图低显存模式部分小视频模型可以开始尝试完整链路12GBSDXL 生图流畅中小视频模型推荐入门配置16GB多数中小视频模型可跑一体化方案的舒适区24GB 及以上更大参数的模型追求更高效果时再考虑除了显存还有几个容易被忽略的硬件项内存建议 32GB 起因为视频帧序列在解码阶段会占用大量内存系统盘和工作目录建议放在固态硬盘模型加载和帧写入的速度差距非常明显电源和散热也要跟上长视频生成会让显卡持续高负载运行。2.2 检查 NVIDIA 驱动和 CUDAComfyUI 本身不直接依赖 CUDA Toolkit而是依赖 PyTorch 的 CUDA 支持。真正决定能否用 GPU 的是 NVIDIA 驱动版本和 PyTorch 编译时对应的 CUDA 版本。打开命令行执行nvidia-smi正常输出会包含三块关键信息显卡型号、Driver 版本、CUDA 版本。例如 Driver 版本 560.x、CUDA 版本 12.6说明当前驱动支持 CUDA 12.6 及以下版本。这里有一个常见的坑有人以为安装了 CUDA Toolkit 就等于驱动可用。实际上 PyTorch 是通过驱动和显卡交互的驱动版本太老即使装了新版 ToolkitPyTorch 也可能无法调用 GPU。建议把 NVIDIA 驱动更新到较新的稳定版再去安装 PyTorch。2.3 安装 ComfyUI源码安装与便携整合包社区里常见的一键安装包、整合包本质上是把 Python、PyTorch、ComfyUI 主程序和常用自定义节点预先打包压缩。优点是省去环境配置缺点是版本被固定一旦某个节点更新或模型不兼容定位问题会更困难。如果打算长期使用并维护自己的工作流推荐走源码安装流程可控性更高git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI python -m venv venv # Windows venv\Scripts\activate # Linux / macOS source venv/bin/activate pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu124 pip install -r requirements.txt关键点有三个。第一一定要用虚拟环境不要直接装到系统 Python。ComfyUI 的自定义节点会安装大量第三方依赖直接装到系统环境很容易造成依赖冲突。第二PyTorch 的安装命令里的cu124表示对应 CUDA 12.4。这个版本号要以 PyTorch 官方页面当前支持的版本为准避免安装了不匹配的版本导致 CUDA 不可用。如果机器没有 NVIDIA 显卡也可以装 CPU 版但生图和视频基本没法实际使用。第三requirements.txt只能保证 ComfyUI 主程序依赖完整视频相关自定义节点的依赖需要单独安装后面会专门讲。2.4 启动成功需要看到哪些标志在虚拟环境激活状态下启动python main.py正常启动时控制台最后会出现类似输出Starting server To see the GUI go to: http://127.0.0.1:8188此时用浏览器访问http://127.0.0.1:8188能看到一个中间是画布、左侧有节点列表的页面。到这里只说明主程序起来了GPU 是否真正参与计算还要在第一次生图时验证。3. 跑通第一条本地生图工作流3.1 下载生图模型并放到正确目录ComfyUI 默认不会自带任何生图模型。需要从模型平台下载.safetensors格式的模型文件放到models/checkpoints目录。常见的下载平台是 Hugging Face 和阿里魔搭 ModelScope国内网络环境下优先使用 ModelScope速度通常更稳定。以 SDXL 和 Flux 两类模型为例SDXL base 模型文件约 6 到 7GB8GB 显存可以配合低显存模式运行。Flux.1-dev 模型体积明显更大加上文本编码器和 VAE整体占用超过 20GB推荐 16GB 以上显存如果显存不够可以找社区发布的 fp8 或 GGUF 量化版本。模型放好之后回到 ComfyUI 页面刷新节点列表。如果模型文件没有出现最常见的原因是目录放错或者文件名包含特殊字符。ComfyUI 目录结构里还有几个需要注意的位置ComfyUI/ ├── main.py ├── requirements.txt ├── models/ │ ├── checkpoints/ # 完整模型文件如 SDXL、Flux checkpoint │ ├── diffusion_models/ # 只包含扩散模型本体的文件 │ ├── vae/ # VAE 解码模型 │ ├── text_encoders/ # 文本编码器 │ ├── loras/ # LoRA 微调文件 │ ├── clip/ # CLIP 模型 │ └── vae_approx/ ├── custom_nodes/ # 自定义节点目录 ├── input/ # 图生视频时放置输入图片 └── output/ # 生成结果输出目录3.2 用默认模板搭建最小文生图链路ComfyUI 页面顶部菜单的 Load 里有默认模板选择 Default 之后画布上会出现一套完整的文生图链路。最小链路包含下面这些节点Load Checkpoint加载 checkpoint 模型同时负责 CLIP 文本编码和 VAE。CLIP Text Encode把提示词编码成模型能理解的向量正面提示词和负面提示词各一个。