Duix.Avatar 数字人本地部署教程:三步生成口播视频 📅 发布时间:2026/9/11 16:50:05 👁 浏览次数: Duix.Avatar 数字人本地部署教程三步生成口播视频【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一个开源数字人工具包你只需要一段 10 秒左右的说话视频它就能在本地完成形象和声音克隆之后输入文字或上传音频即可驱动这个数字人产出口播视频。本文按环境自查 → 部署 → 出片的顺序走通它的本地部署全流程。它能做什么全离线训练、合成全部跑在你自己的显卡上素材不出本机外貌 声音一次克隆约 10 秒视频同时产出人物模型和声音模型文字/音频双驱动文字会先转成语音再驱动口型也可以直接用现成音频脚本支持 8 种语言中、英、日、韩、法、德、阿、西前置条件自查动手前 6 项项目要求说明系统Windows 10 19042.1526需 WSL或 Ubuntu 22.04 DesktopWSL 是 Windows 自带的 Linux 子系统Windows 版 Docker 依赖它显卡NVIDIA 显卡 驱动已装好跑nvidia-smi能列出显卡没有它三个服务起不来内存32GB 及以上16GB 偏紧ASR 服务可能启动失败CPU13 代 i5-13400F 或同级官方推荐配置磁盘WindowsC 盘 100GB镜像且 D 盘 30GB数据Ubuntu空闲 100GB镜像和数据默认分开存放网络稳定连接首次拉取镜像约 70GB建议 Wi-Fi部署从零到服务跑通的 4 步第 1 步安装 WSL 与 DockerWindows 上wsl --list --verbose查看 WSL 是否已装没有就执行wsl --install再执行wsl --update更新安装 Docker Desktop按 CPU 架构选安装包首次运行接受协议、跳过登录Ubuntu 上已装 Docker 的跳过sudo apt update sudo apt install docker.io docker-compose另外 Ubuntu 还需要装好 NVIDIA 驱动nvidia-smi验证并安装 NVIDIA Container Toolkit、用sudo nvidia-ctk runtime configure --runtimedocker配置运行时后重启 Docker这一步照着 NVIDIA 官方文档走即可。⚠️ 注意wsl --update更新后可能需要重启电脑先保存手头工作。判断成功docker --version能输出版本号。第 2 步获取项目代码git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar服务端配置在 deploy/ 目录下Windows、Ubuntu、lite 精简版、5090 版各有一份 compose 文件。如果你打算自己从源码构建客户端才需要 Node.js 18直接装官方构建的安装包可以不管它。第 3 步用 docker-compose 启动三个服务cd deploy docker-compose up -d这条命令会拉取并启动三个容器docker-compose 是一条命令编排多个容器的工具duix-avatar-asr语音识别服务端口 10095duix-avatar-tts语音合成服务端口 18180duix-avatar-gen-video视频合成服务端口 8383首次拉镜像约 70GB预计 Wi-Fi 下半小时左右。按情况换文件即可显存/内存紧张用docker-compose -f docker-compose-lite.yml up -d只起视频合成一个服务Ubuntu 用docker-compose -f docker-compose-linux.yml up -d50 系显卡或 CUDA 12.8 的 30/40 系显卡用docker-compose -f docker-compose-5090.yml up -d。判断成功docker ps显示三个服务都是 Running。下载期间别关终端也没必要守着该干嘛干嘛去。第 4 步安装客户端到项目 Releases 页面下载官方构建的安装包Windows双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu双击Duix.Avatar-x.x.x.AppImage直接启动免安装若以 root 用户登录桌面双击打不开在终端加--no-sandbox参数启动判断成功客户端能打开首页出现 Create Video / Create Avatar 两个入口。验证首个结果先看服务再出第一条视频docker ps应看到三个服务全部 Runninglite 版只有 gen-video 一个docker ps # NAME STATUS PORTS # duix-avatar-asr Running 10095:10095/tcp # duix-avatar-tts Running 18180:8080/tcp # duix-avatar-gen-video Running 8383:8383/tcp然后打开客户端走一遍最小流程点 Create Avatar上传一段 10 秒左右、人在说话的正面视频等模型训练完成点 Create Video输入一段文字数字人就会用克隆的声音说出这段话补充一句创建模型用的视频必须带人声——程序要用这段声音做声音克隆只传无声画面会直接报错。调优最值得动的 3 个配置点移动数据存储位置Windows 的 compose 默认把模型和视频数据挂在d:/duix_avatar_dataUbuntu 是~/duix_avatar_data默认值对大多数人不用动。如果 C 盘空闲不足 100GB把 Docker 的磁盘镜像位置换到空间更大的盘Docker Desktop 右上角齿轮 → Settings → Resources → Advanced → Disk image location选一个剩余 100GB 的目录Apply restart。资源紧张就退到 lite 版默认三服务ASR TTS 视频合成内存开销大。如果你的目标是拿现成的音频 视频合成口播视频或机器内存只有 16GB 左右直接用 lite 版 compose只保留视频合成服务资源占用小很多。50 系显卡用专用 compose50 系显卡5090 实测以及 CUDA 12.8 的 30/40 系显卡要用docker-compose-5090.yml这份基于 torch 预览版的配置。 这两类卡遇到 GPU 相关报错时先换这份文件重启再排查其他问题。两个能直接上手的场景场景一企业代言人口播视频素材代言人正面讲话视频 10–15 秒收音干净、背景无噪音设置先克隆模型再用文字模式贴入宣传文案产出形象与声音都属本人的口播视频换文案可反复生成场景二一门课多语言版本素材讲师正面视频一次声音模型一份设置脚本支持 8 种语言按目标语言分别生成产出同一节课的中、英、日等多语言口播视频快速排错4 个高频问题1.docker-compose up -d报 request canceled / Client.Timeout→ 最可能原因Docker Hub 官方源连接不稳定。 → 一步修复在 Docker Engine 的 daemon.json 里加registry-mirrors国内镜像源Apply restart 后重跑。2. 三个容器始终不是 Running→ 最可能原因没有 NVIDIA 显卡或驱动没装好——本项目全部算力在本地 GPU。 → 一步修复跑nvidia-smi确认能列出显卡装好驱动后再重启容器。3. 新增模特报错 / 日志里刷 file not exists→ 最可能原因上传的视频没有声音或声音不是人说话。 → 一步修复重新上传一段人在清晰讲话的视频。4. 定制模特报 Connection refused→ 最可能原因ASR 服务启动较慢服务端刚起就来克隆内存过小16GB也可能起不来。 → 一步修复服务端启动后等几分钟再操作内存不够就先升级。 排查时先取日志客户端右上角设置里点 Open Log 找到main.log服务端点开对应 Docker 服务的 Logs 标签页复制报错段落再对照 常见问题 搜。写在最后到这里数字人本地部署已经闭环三个服务跑起来客户端上传 10 秒视频训出模型文字进、口播视频出全程离线。更多端口与接口细节可看 README_zh.md 和 常见问题。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考