免费开源:Duix.Avatar 数字人克隆本地部署完整指南,半天跑通

免费开源:Duix.Avatar 数字人克隆本地部署完整指南,半天跑通 免费开源Duix.Avatar 数字人克隆本地部署完整指南半天跑通【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款免费开源的 AI 数字人工具包上传一段 10 秒左右的视频就能在本地完成形象和声音的克隆全程离线运行输入文案或上传音频即可产出口播视频。本文按查配置 → 起服务 → 出第一条视频 → 排查卡点的顺序带你从零跑通最后讲清楚日志位置和开放 API。用过商业数字人平台的人最在意的通常是两点素材不离开自己的机器以及不用按量付费。这两点恰好是这个开源项目的立足点。它还有第三点优势——代码完全开放可以阅读、可以修改也能通过接口接进自己的业务系统。主界面分两大入口左侧Create Video做口播视频右侧Create Avatar做数字人克隆下方标签页管理作品和形象 先说清它能干什么一条视频 形象 声音 成片这一节解决值不值得折腾部署的问题。能力清单如下素材成本极低一条 10 秒视频同时完成数字人克隆里的形象和声音两项不用单独拍照片、录人声双模式驱动输入文案或直接上传音频数字人都能配对口型说话8 种界面语言中文、英语、日语、韩语、法语、德语、阿拉伯语、西班牙语在设置里切换免费商用全球范围内免费商用仅用户量超 10 万或年营收超 1000 万美元的企业需另签商业许可协议。底层由三个服务协作ASRfun-asr负责语音转文字TTSfish-speech-ziming负责声音克隆视频合成引擎负责口型驱动。三者都以 Docker 容器跑在你自己的 GPU 上使用阶段完全不需要外网。️ 部署前先核对三件硬件条件这一步解决我的机器会不会卡住的问题。官方推荐配置是 13 代 i5-13400F、32G 内存、RTX 4070最低门槛见下表项目最低要求备注系统Windows 1019042.1526或 Ubuntu 22.04其他 Linux 版本官方未测试显卡NVIDIA 显卡且驱动装好算力全在本地没有英伟达显卡三个服务起不来内存32G 及以上16G 机器可能起不全服务磁盘C 盘 100G、D 盘 30GWindowsC 盘存镜像D 盘存数字人数据驱动装没装好一条命令就能验证终端执行nvidia-smi能看到显卡信息就说明没问题。C 盘空间不够也别慌。装好 Docker 后在 Docker Desktop 的 Settings → Resources 里点 Browse可以把磁盘镜像位置挪到别的空闲分区。Disk image location 就是镜像存储位置改到空间充足的分区即可 一条命令拉起三个本地服务这一步的作用是借助 Docker 把 TTS、ASR、视频合成三个容器跑起来。Windows 用户执行wsl --list --verbose查看是否装过 WSL没有就执行wsl --install网络不好时多试几次执行wsl --update把 WSL 更新到最新版安装 Docker Desktop首次启动接受协议、跳过登录即可。Ubuntu 用户sudo apt update sudo apt install docker.io docker-compose另外装好 NVIDIA 显卡驱动并安装 NVIDIA Container Toolkit 让 Docker 能调用 GPU。环境就绪后克隆代码、进入 deploy/ 目录启动服务git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d几个关键提醒首次启动要下载约 70G 镜像一般等半小时建议连 WiFi 慢慢拉Ubuntu 改用docker-compose -f docker-compose-linux.yml up -d英伟达 50 系列显卡30/40 系列 cuda 12.8 也可以试用-f docker-compose-5090.yml想只部署视频合成的精简版用docker-compose-lite.yml此时只有一个容器。成功的标志Docker 里出现三个 Running 状态的容器。服务端跑通后安装客户端——Windows 双击Duix.Avatar-x.x.x-setup.exe安装Ubuntu 双击Duix.Avatar-x.x.x.AppImage直接启动若用 root 用户进桌面需在终端加--no-sandbox参数运行。 产出第一条口播视频的三步走这一节解决部署好了到底怎么做出视频的问题操作都在客户端里创建数字人点 Create Avatar 上传 10 秒视频。两条硬性要求——人物清晰可见、必须带说话的声音程序要靠这段声音做声音克隆无声或非人声必报错等待训练系统自动提取面部与声音特征按显卡性能通常需要几分钟生成视频切到 Create Video选中刚建好的数字人输入文案或上传音频点生成几分钟后即可拿到成片。想让克隆效果更稳拍摄时把握四点正面角度不遮挡、面部光线均匀、发音清晰、背景简洁。不必追求 4K分辨率适中反而生成更快。 卡住了先看这三处这一节把部署和生成中最常见的三个卡点合并在一起讲另附两边日志的获取方式。顺带提一句8383 和 18180 是本项目占用的端口若被其他程序占用服务也会起不正常。镜像下载失败docker-compose up 超时国内连 Docker Hub 官方源不稳定。进 Docker Desktop 的 Settings → Docker Engine在registry-mirrors里填入镜像源地址列表点 Apply restart 后重新执行启动命令即可。添加镜像源后不用改任何代码重跑启动命令创建形象报 Connection refusedASR 服务冷启动比其他两个慢服务端刚拉起就立刻克隆连接会被拒绝。等几分钟再试即可。注意内存16G 的机器可能起不全全部服务。视频生成卡在 20%问题多半出在 TTS 处理环节。打开 TTS 容器旧版名为 heygen-tts的日志若反复出现file not exists说明音频文件路径对不上重启该服务后重试并检查音频目录权限。红框是返回的报错信息可直接对照音频路径排查两边日志怎么拿客户端右上角设置菜单选打开日志日志文件是AppData\Roaming\heygem.ai\logs下的main.log服务端在 Docker 中打开对应容器的 Log 页点右侧的复制按钮即可取走完整日志。客户端日志就一个 main.log提问时直接附上服务端日志同样支持一键复制若仍未解决先做四项自查三个服务是否都 Running、显卡驱动是否装好、两端是否更新到最新版服务端在 deploy 目录重跑docker-compose up -d客户端拉代码后重新 build再去翻 常见问题文档。 开放 API把数字人接进自己的程序这一节面向开发者。Docker 启动后本地暴露了三个端口全部通过http://127.0.0.1调用完整流水线分三步模特训练把克隆音频放入 TTS 服务约定目录默认D:\duix_avatar_data\voice\data调用127.0.0.1:18180/v1/preprocess_and_tran返回参考音频路径和参考文本——这两个值要记下来下一步要用音频合成调用127.0.0.1:18180/v1/invoke传入要说的文案和上一步的返回值得到克隆声音的音频文件视频合成调用127.0.0.1:8383/easy/submit传入音频与视频路径拿到任务编号后轮询127.0.0.1:8383/easy/query?code任务编号查进度。具体参数可对照仓库 src/main/service/ 下的源码model.js对应模型训练、voice.js对应声音、video.js对应视频合成。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考