Duix.Avatar 数字人本地部署完整指南:10秒视频克隆你的专属数字分身 📅 发布时间:2026/9/11 12:56:26 👁 浏览次数: Duix.Avatar 数字人本地部署完整指南10秒视频克隆你的专属数字分身【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款完全开源、支持本地部署的 AI 数字人工具包。把一段约 10 秒的视频丢给它就能克隆出你的形象和声音之后输入文案或上传音频即可自动生成口播视频。整套流程不依赖云端画面与声音数据都留在自己的电脑上适合对个人隐私敏感、又想让内容生产提效的创作者和小团队。为什么值得折腾一个本地数字人先说清楚它解决的痛点数据不出门。形象视频、声音样本、生成结果全部在本地完成不用把肖像和声音上传到第三方服务器。做企业宣传、内部培训视频时这条基本是硬需求。不卡在会员次数上。开源本地部署模式可以反复克隆、反复生成没有按次计费。门槛比想象中低。没有英伟达 GPU 确实跑不了但推荐配置就是一台 i5-13400F 32G 内存 RTX 4070 级别的常见主机不是工作站起步。全离线可用。服务端和客户端都装好后断网也能继续生成视频。如果你只是想要能出片它开箱即用如果你是想接 API 到自己业务里它同样把训练和合成的接口暴露在了本机端口上后面会讲。硬件门槛你的电脑跑得动吗部署前先把机器过一遍不达标的话后面所有步骤都会卡住。硬性要求缺一不可一块英伟达显卡且驱动装好。执行nvidia-smi能正常显示显卡信息才算通过因为三个服务端容器全部走 GPU 计算。内存建议 32G 及以上。16G 内存机器连 ASR 服务都可能拉不起来。推荐配置官方给出的参考档位CPU13 代 i5-13400F 或同级内存32G 起显卡RTX 4070 或同级50 系列显卡另有专用部署方案见下文硬盘Windows 用户要求 C 盘空闲大于 100G存 Docker 镜像另需一个盘官方默认 D 盘空闲大于 30G 存放数字人和作品数据Ubuntu 用户需要一块大于 100G 的空闲空间系统支持Windows 10 19042.1526 或更高版本通过 WSL2 运行 DockerUbuntu 22.04 Desktop官方已验证其他 Linux 发行版未做兼容测试 如果 C 盘放不下 100G 镜像装完 Docker 后可以在它的 Settings → Resources 里把 WSL 磁盘镜像目录挪到别的盘如下图红框处。三步跑起来从装环境到出片第一步装 WSL2 和 DockerWindows先执行wsl --install安装 WSL网络不稳就多试几次装完用wsl --list --verbose确认再执行wsl --update更新一下。然后从 Docker 官网下载安装包装 Docker Desktop首次启动接受协议、跳过登录即可。第二步拉镜像并启动服务端进入项目的deploy目录配置文件都在 deploy/ 下执行docker-compose up -d这一条命令会拉起三个容器语音识别ASR、语音合成TTS和视频生成。⚠️ 首次拉取约 70G 镜像官方提示大概要半小时左右建议连 WiFi 慢慢等。看到三个服务都变成 Running 状态就成功了。根据硬件选不同配置文件显存紧张、只需要出视频docker-compose -f docker-compose-lite.yml up -d只启动视频生成这一个服务。50 系列新显卡docker-compose -f docker-compose-5090.yml up -d基于 5090 实测通过30/40 系列用 CUDA 12.8 的用户也可参考。Ubuntudocker-compose -f docker-compose-linux.yml up -d。Linux 下需先装显卡驱动和 NVIDIA Container Toolkit否则 Docker 调不到 GPU。第三步装客户端从项目 releases 下载对应系统的安装包Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 下载 AppImage 双击即可运行无需安装。 一个容易忽略的细节Ubuntu 下如果以 root 用户登录桌面直接双击 AppImage 可能起不来要在终端里加参数运行./Duix.Avatar-x.x.x.AppImage --no-sandbox。客户端首次打开后在右上角 Setting 里选择语言、确认用户协议即可开始使用。核心能力拆解一条口播视频是怎么生成的克隆和生成是两条独立的流水线理解它们之后出问题时你知道该查哪一环。形象与声音克隆点击客户端里的Create Avatar选一段视频提交。注意视频里必须有人在说话因为程序要从中提取声音做声音克隆纯画面视频会直接报错。克隆完成后数字人会出现在My Avatars列表里声音模型会记录在本地后续生成时复用。口播视频生成在Create Video入口选择已克隆的数字人然后二选一输入文案系统用克隆声音合成配音或直接上传一段现成音频。提交后服务端把音频和形象视频对齐口型输出成片成品归到My Works。文案支持八种语言中、英、日、韩、法、德、阿拉伯语、西班牙语。三条服务线的分工客户端只是壳真正干活的是三个 Docker 服务源码里对应的调用逻辑可以这样看声音克隆与配音客户端通过 src/main/service/voice.js 调 TTS 服务端口 18180先做声音预处理再按参考音频合成新文本的语音。视频合成通过 src/main/service/video.js 调视频生成服务端口 8383提交任务后用任务 code 轮询进度。形象训练逻辑在 src/main/service/model.js负责把视频拆成画面与音频分别入库。对想集成到自己业务里的开发者这三个服务启动后就在http://127.0.0.1上暴露了接口声音预处理18180/v1/preprocess_and_tran、音频合成18180/v1/invoke、视频合成8383/easy/submit配8383/easy/query查进度。具体字段可以直接对照上面三个 service 文件里的请求参数不用猜。常见卡点与排错手册按踩坑概率从高到低排每个都有明确的处置动作。拉镜像失败连接 registry-1.docker.io 超时最典型的新手卡点基本是 Docker Hub 官方源不稳定。在 Docker Desktop 的 Settings → Docker Engine 里加上registry-mirrors国内镜像源然后 Apply restart 即可配置位置如下图。定制模特报 Connection refusedASR 服务启动慢服务端刚拉起来就急着克隆会连不上。对策等服务都 Running 后等几分钟再操作。另外如果机器只有 16G 内存ASR 服务本身可能就起不来这属于硬件不达标不是配置问题。克隆时提示文件不存在或报错打开对应容器的日志页右侧按钮可以直接复制日志内容客户端日志则在设置菜单里打开日志位置见上文客户端截图。日志里的file does not exists一类报错优先检查视频里是否真的有人声。提问前的官方自查清单三个服务是否都是 Runningnvidia-smi是否能正常输出显卡信息服务端重跑docker-compose up -d和客户端是否都升到最新版——项目更新很频繁很多问题新版已修。更多问题可查阅官方文档doc/常见问题.md。从出片到接入业务下一步怎么走跑通第一条口播视频只是起点这套工具的延展空间主要在两头往内容端走批量换文案、换语言重新生成把一套数字人形象复用到多语言视频上是本地部署模式最划算的用法——不产生额外调用成本。往集成端走三个服务端口都在本机写个脚本定时提交easy/submit再轮询easy/query就能搭一条文案进、视频出的自动化流水线接口字段照抄 src/main/api/ 下的请求封装即可。 提醒一点开源本地部署适合技术型用户做深度定制如果不想维护 GPU 服务器官方也提供云端 API 方案两条路线可以在项目 README 里对照选择。部署过程中卡在哪一步先翻一遍 doc/常见问题.md 再提问题附上客户端和服务端日志解决会快很多。现在就按装 Docker → 拉镜像 → 装客户端三步走你的第一个数字分身离你只有一个docker-compose up -d的距离。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考