10秒视频克隆数字人:Duix-Avatar 本地部署,半小时跑通离线口播视频生成 📅 发布时间:2026/9/20 16:55:08 👁 浏览次数: 10秒视频克隆数字人Duix-Avatar 本地部署半小时跑通离线口播视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar核心词Duix-Avatar、数字人本地部署、离线数字人、数字人克隆 长尾词开源AI克隆技术、Docker部署数字人、本地口播视频生成、数字人视频合成APIDuix-Avatar 是一个真正开源的 AI 数字人工具包给它一段 10 秒左右的说话视频就能克隆你的形象和声音之后输入一段文字就能生成口播视频。整个过程在你的电脑上离线跑完画面、声音、脚本都不出本地。下面按装好 → 跑通 → 看懂原理的顺序走一遍全程只需要 Docker不碰命令行以外的复杂配置。配好硬件把 Duix-Avatar 数字人服务拉起来先对一下配置。它必须用 NVIDIA 显卡因为所有算力都在本机Mac 或非 N 卡机器直接跳过这个项目。项目最低要求推荐配置系统Windows 10 19042 / Ubuntu 22.04同左显卡带驱动的 NVIDIA 显卡RTX 4070内存32GB32GB 及以上磁盘C 盘 100GB存镜像、D 盘 30GB存数据100GB 空闲第一步装 NVIDIA 驱动装完用nvidia-smi能看到显卡信息就对了和 DockerWindows 先执行wsl --install装好 WSL再装 Docker Desktop 并启动Ubuntu 上两条命令装 Docker 和 compose。⚠️ 注意镜像总大小约 70GB如果 C 盘放不下装完 Docker 后在 Docker Desktop 的设置里把镜像存储位置改到别的盘。然后克隆仓库并启动服务国内网络建议在 Docker 里先配一个镜像加速源不然拉镜像会卡# 克隆项目并进入部署目录 git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d # 首次拉取约 70GB 镜像建议连 WiFi 耐心等待Ubuntu 22.04 换用这条命令即可cd /your/path/Duix-Avatar/deploy docker-compose -f docker-compose-linux.yml up -d看到三个服务tts、asr、gen-video都变成 Running 就成功了只想跑视频合成、自己已有音频的可以用docker-compose-lite.yml只起一个服务。最后到项目的 Release 页面下载安装包Windows 双击setup.exe安装Linux 下载 AppImage 直接双击运行。客户端启动后会自动连上本地服务主界面长这样——上面两个入口是短视频制作和快速定制模特下面就是你的作品和数字模特列表看懂它怎么把你变成数字人把整个流程想象成先存档、再对口型。你上传的 10 秒说话视频会被拆成画面和声音两路系统先记住你的长相、轮廓和说话时的口型变化相当于给脸拍几百张照片存档同时从声音里提取你的声纹特征。之后你写一段文字系统先用克隆的声纹把文字念成语音这就是 TTS文本转语音再把这段语音和存档画面做对齐每一帧的口型都跟着语音的节奏和语调动起来最后合成一条口播视频。所以克隆效果和你的素材强相关——素材里人说话越清晰克隆声音越像。和云端 SaaS 数字人的区别也很直接数据不出本机断网照常出片按一次硬件投入算账而不是按次付费。代价是吃 GPU 显存和磁盘生成速度也比不上云端集群。实际用起来是什么样场景一给自己做口播短视频。你想做一条自我介绍或产品讲解视频但不想出镜。点快速定制模特上传一段 8 秒以上的视频720P 以上、MP4/MOV、单人出镜、脸部无遮挡、全程在说话——声音也要一起克隆提交后等几分钟我的数字模特里就多了一个你的数字分身。之后点创建视频选这个模特粘贴文案等它合成完一条口播视频就躺在我的作品里了支持预览和下载。文案支持 8 种语言音频模式下单个录音最长 30 分钟。场景二批量出片直接调本地 API。如果你要一次性生成几十条视频点界面太慢。Docker 起来后服务直接暴露在本机端口上最核心的就是视频合成接口——提交任务时把音频和静音视频的路径传给8383端口再用返回的 code 轮询进度即可// 提交合成任务音频 静音视频 唯一任务码 fetch(http://127.0.0.1:8383/easy/submit, { method: POST, body: JSON.stringify({ audio_url: /your/path/a.wav, video_url: /your/path/v.mp4, code: task-001 }) }); // 查进度GET http://127.0.0.1:8383/easy/query?codetask-001训练和合成的完整调用逻辑客户端源码里就有现成参考src/main/service/。卡住了看这里现象docker-compose up -d报registry-1.docker.io ... request canceled。大概率原因Docker Hub 官方源连接不稳定。解决在 Docker 的 daemon.json 里加一个国内registry-mirrors镜像源保存后重新执行docker-compose up -d。现象服务起不来或反复重启容器状态不是 Running。大概率原因没有 NVIDIA 显卡/驱动没装好或内存不足。解决先nvidia-smi确认驱动正常再确认内存 32GB 起16G 内存可能连 ASR 服务都拉不起来。现象新增模特时报错。大概率原因克隆视频里没有人声。解决重拍一段有真人清晰说话的视频8 秒以上、720P、MP4/MOV系统要用这段声音做声音克隆。更多报错和日志查看方法见 doc/常见问题.md。收尾Duix-Avatar 把数字人克隆和口播视频生成整套搬到了你自己的电脑上免费开源、数据不出本地。现在就去做两件事到 Release 页面下载对应系统的客户端装好然后上传一段 10 秒的视频生成你的第一个数字人。部署脚本都在 deploy/ 目录卡住的地方欢迎直接去项目仓库提 issue。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考