16GB 显卡跑 2K 带声音视频:MiniMax H3 量化模型本地部署完整指南

16GB 显卡跑 2K 带声音视频:MiniMax H3 量化模型本地部署完整指南 16GB 显卡跑 2K 带声音视频MiniMax H3 量化模型本地部署完整指南【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-ConvrotMinimax-H3-nvfp4-INT4-INT8-Convrot 把 MiniMax H3海螺 3.0视频生成模型的 INT4 / INT8 / NVFP4 量化权重整理进了同一个仓库目标只有一个让你用 16GB–24GB 显存的消费级显卡在 ComfyUI 里本地生成 2K 分辨率、自带立体声音频、最长 15 秒的视频而不用租大显存云卡。下面按能输出什么 → 该下载什么 → 怎么跑起来的顺序讲清楚。 先看懂它能输出什么这条管线和你常见的文生视频工具最大的区别是音画同出视频和立体声音频由同一个 Transformer 联合预测对白还能跨 11 种语言中、英、日、韩、法、德、西、俄、葡、意、阿拉伯语你可以直接用母语写提示词。输出项规格时长4–15 秒分辨率短边默认 768px2K 生成需配合 H3-Regenerate-2K帧率24 FPS画幅21:9、16:9、4:3、1:1、3:4、9:16 等多种比例音频32 kHz 立体声输入侧分两个系列文件名前缀不同按需选择即可系列输入方式参考上限FL2VA0/1/2 张图纯文本生视频、首帧或尾帧图生视频、首尾帧控制—Ref2VA多模态参考输入图像 视频片段 音频图 ≤9 张视频 ≤3 段每段 2–15 秒总长 ≤15 秒音频 ≤3 段必须搭配图/视频不能单独作为输入文件总数 ≤12只想要文字变视频就选 FL2VA手里有多张参考图、片段或想混入音频才需要 Ref2VA。 显存对号入座五种量化文件怎么选量化就是用少量画质换取数倍显存。这个仓库的好处是同一模型的各档量化都齐了你只需要看自己的显卡是哪一档扩散模型文件名中段区分系列文件后缀显存需求适合的显卡_pruned_int4_convrot约 11.3 GB16GB如 4070 Ti Super、4080入门首选_pruned_mixed_int4_int8_convrot约 15.5 GB16GB 且想留一点余量、画质比纯 INT4 好_pruned_int8_convrot约 21 GB24GB3090、4090剪枝版里质量最高_pruned_nvfp412.5 GB/_nvfp4_mixed24.4 GB12.5–24.4 GB仅限 Blackwell 架构RTX 5090、PRO 6000 等30/40 系显卡不要下载文本编码器Qwen3-VL-32B必须和显卡档位配套文件大小配套显卡qwen3vl_32b_minimax_h3_int4_convrot.safetensors15.0 GB16GBqwen3vl_32b_minimax_h3_int8_convrot.safetensors27.1 GB24GBqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.7 GBBlackwellVAE 解码器谁都必须下共两个文件vae/minimax_h3_audio_vae_fp32.safetensors605 MBvae/minimax_h3_video_vae_fp16.safetensors5.21 GB漏掉音频 VAE 的常见后果就是视频正常出来但声音是空的。️ 三步把模型跑进 ComfyUI第 1 步克隆仓库。大权重文件走 git-lfs 拉取机器上需要先装好 git-lfs否则拿到的只是几百字节的指针文件git clone https://gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot第 2 步按上面的表挑 4 个文件1 个扩散模型 1 个配套的文本编码器 2 个 VAE分别放进 ComfyUI 的models下对应位置扩散模型、文本编码器、vae 三个目录。第 3 步导入工作流。仓库根目录的ref2.json是一份现成的 Ref2VA ComfyUI 工作流含视频解码、音频解码和超分节点导入后把图像/音频输入换成你的素材即可如果你用 FL2VA思路类似——只保留提示词和最多两张首尾帧图的输入。✅ 生成前自查清单报显存不足先换 INT4 扩散模型同时缩短时长、降低分辨率这是最快的止血方式。有画面没声音检查两个 VAE 是否都下载并加载——工作流里音频 VAE 是独立的加载节点。算子报错、模型无法加载确认显卡架构。NVFP4 只在 Blackwell 上可用其他架构请回到 INT4/INT8/MIXED。文本编码器加载爆显存多半是档位配错了16GB 的卡不要挂 27GB 的 INT8 编码器。音频当唯一输入失败这是模型规格限制音频必须搭配图像或视频一起输入。 许可说明MiniMax H3 及其量化衍生权重采用 MiniMax H3 社区许可协议。使用时请遵守合法使用条款不生成违法、色情或侵犯第三方权利的内容商业用途前确认符合协议约定。建议路径先按INT4 扩散模型 INT4 编码器 两个 VAE的组合跑通一次完整流程确认工作流没问题后再按你的显存档位升级量化版本。本地部署视频生成模型跑通比跑快更重要。【免费下载链接】Minimax-H3-nvfp4-INT4-INT8-Convrot项目地址: https://ai.gitcode.com/hf_mirrors/Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考