一条10秒视频克隆出会口播的你自己:免费开源数字人项目 Duix.Avatar 本地部署完整实践

一条10秒视频克隆出会口播的你自己:免费开源数字人项目 Duix.Avatar 本地部署完整实践 一条10秒视频克隆出会口播的你自己免费开源数字人项目 Duix.Avatar 本地部署完整实践【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款完全开源、可本地运行的开源数字人工具上传一段约 10 秒的真人视频即可完成数字人克隆形象 声音再输入文案或音频就能完成数字人视频生成。所有计算发生在自己的电脑里全程离线支持 Windows 与 Ubuntu 22.04脚本覆盖中、英、日、韩等 8 种语言。核心卖点免费开源全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签商业许可协议全离线运行视频与声音数据不出本机隐私可控10 秒视频即可克隆形象和声音无需专业设备开放 API开发者可自行调用模型训练与视频合成接口️ 动手之前硬件要求与适用场景Windows 环境系统Windows 10 19042.1526 或更高版本D 盘存放数字人模型和作品数据空闲大于 30GBC 盘存放 Docker 镜像文件空闲大于 100GB空间不足时装完 Docker 后可在 Settings → Resources → Advanced 的 Disk image location 处把镜像目录改到空间更大的磁盘推荐配置Intel i5-13400F、内存 32GB 及以上、RTX 4070 级别显卡必须有 NVIDIA 显卡并正确安装官方驱动硬性要求没有 GPU 三个服务起不来Ubuntu 22.04 Desktop官方已验证内核 6.8.0-52-generic其他 Linux 发行版未做兼容测试内存 32GB 及以上、NVIDIA 显卡加官方驱动、磁盘空闲 100GB 以上另需安装 NVIDIA Container Toolkit 并执行nvidia-ctk runtime configure --runtimedocker让 Docker 能调用 GPU如果你只想做现成形象 音频 → 口播视频的合成不想跑完整的语音合成和识别链路后面可以选 lite 轻量版服务更少、资源占用更低。 Docker 一键部署步骤让三个服务跑起来第一步准备环境Windows用wsl --list --verbose检查是否装过 WSL没装就执行wsl --install网络原因可能失败多试几次安装中设置的用户名和密码要记住再用wsl --update更新下载安装 Docker Desktop首次启动接受协议、跳过登录即可若访问 Docker 官方镜像源不畅先给/etc/docker/daemon.json添加国内镜像源registry-mirrors否则拉镜像会直接超时第二步启动服务克隆代码https://gitcode.com/GitHub_Trending/he/Duix-Avatar进入deploy目录执行docker-compose up -d这一步会拉取三个镜像guiji2025/fun-asr语音识别、guiji2025/fish-speech-ziming语音合成、guiji2025/duix.avatar视频合成。总流量约 70GB网速正常的话大概半小时。其他场景的变体命令同在 deploy 目录执行轻量版只启动视频合成服务docker-compose -f docker-compose-lite.yml up -dUbuntu 部署docker-compose -f docker-compose-linux.yml up -dRTX 50 系显卡docker-compose -f docker-compose-5090.yml up -d基于 torch 官方预览版5090 测试通过30/40 系使用 cuda12.8 的用户也可采用第三步验证部署完整版应有 Duix.Avatar-asr、Duix.Avatar-tts、Duix.Avatar-gen-video 三个容器lite 版只有 Duix.Avatar-gen-video全部显示 Running 即部署成功服务起不来时优先自查显卡驱动是否装好——本项目算力全部在本地没有 NVIDIA 显卡和驱动容器无法启动 做出第一个数字人形象训练与视频生成1. 安装客户端Windows获取官方构建的Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu双击Duix.Avatar-x.x.x.AppImage直接启动无需安装root 用户登录桌面时 AppImage 可能双击无反应改用终端执行./Duix.Avatar-x.x.x.AppImage --no-sandbox即可2. 创建数字人形象模型训练准备约 10 秒视频人物必须在画面中说话程序要用这段声音做声音克隆无声视频会直接报错在 Create Avatar 区域上传视频后系统自动把视频分离为静音视频 音频再做面部特征提取和声音克隆音频默认落在D:\duix_avatar_data\voice\datadocker-compose 里的挂载路径可改训练完成后My Avatars列表里会出现新数字人3. 生成口播视频数字人视频生成文本驱动选择数字人输入文案系统自动合成语音并驱动口型音频驱动直接上传音频文件数字人跟着音频说话可配置语音参数、水印开关watermark_switch、超分chaofen等界面支持中文、英文、日文、韩文等 8 种语言️ 踩坑速查现象 → 原因 → 处理docker-compose up -d报 request canceled / context canceled官方镜像源连接不稳定 → 在 daemon.json 的 registry-mirrors 配置国内镜像源或开全局代理后重试新增模特报错视频没有声音或无人说话 → 换一段人在讲话的视频定制模特报 Connection refusedASR 服务启动慢 → 服务端启动后等几分钟再操作内存只有 16GB 时服务本身可能起不来heygen-tts 容器反复重启社区已知问题以官方 issue 列表的最新结论为准视频生成卡在 20%显存或内存不足 → 显存建议 8GB 以上加大系统虚拟内存降低输出分辨率或改用 lite 部署客户端连不上服务端三个服务未全部 Running → 检查容器状态与防火墙端口服务端和客户端都更新到最新版服务端重新执行docker-compose up -d查日志的两处入口客户端日志右上角设置菜单选 Open Log或直接打开C:\Users\你的用户名\AppData\Roaming\heygem.ai\logs\main.log服务端日志Docker 中打开对应容器的 Logs 页签复制报错行 跑通之后开放 API 与二次开发Docker 启动后服务会在本机暴露端口用 127.0.0.1 直接调用模型训练音频预处理127.0.0.1:18180/v1/preprocess_and_tran完成视频分离后返回参考音频与参考文本返回的 asr_format_audio_url、reference_audio_text 要记下来后续合成要用音频合成127.0.0.1:18180/v1/invoke传入文本和上一步返回值输出 wav 音频视频合成127.0.0.1:8383/easy/submit提交音频与视频路径可配置水印、超分等参数进度查询走8383/easy/query?code任务编号请求字段的具体定义看源码src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。想改客户端行为的话开发环境需要 Node.js 18数据存储路径在 deploy 目录的 yml 文件里调整。更多故障排查见官方文档doc/常见问题.md。整条链路跑通后你的数字人资产全部保存在本地准备好一段说话的视频剩下的就是输入文案、导出视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考