三步跑通 HeyGem.ai(Duix.Avatar)离线 AI 数字人视频生成

三步跑通 HeyGem.ai(Duix.Avatar)离线 AI 数字人视频生成 三步跑通 HeyGem.aiDuix.Avatar离线 AI 数字人视频生成【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarHeyGem.ai项目本名 Duix.Avatar是一款免费开源的 AI 数字人AI 虚拟形象工具用一段真人视频克隆对方的形象和声音之后输入文字或语音就能生成口型对齐的讲话视频。它最大的卖点是全离线本地运行——部署完成后生成视频全程不联网素材和数据不出本机。项目速览它能做什么、要什么配置先记住三件事形象 声音克隆上传一段人在说话的视频系统完成面部建模和语音克隆ASR 与语音合成各跑在一个本地容器里文本/语音驱动输入是文本或音频文件输出是口型与语音对齐的数字人视频多语言脚本支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言环境要求一览推荐配置 i5-13400F / 32GB 内存 / RTX 4070项要求客户端JavaScriptElectron Vue 3Node.js 18服务端Docker3 个容器服务ASR / 语音合成 / 视频合成GPUNVIDIA 显卡并装好驱动全部算力在本地内存 / 磁盘内存建议 32GB磁盘留 100GB镜像下载约 70GB系统Windows 1019042.1526 及以上或 Ubuntu 22.04网络仅首次拉镜像需要启动后完全离线三步跑起来服务端 客户端全启动结论先行拉代码、起容器、开客户端三组命令的事。第 1 步拉取源码并装依赖git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai npm install安装客户端依赖要求 Node.js 18。第 2 步Docker 启动后端服务三个镜像为guiji2025/fun-asr、guiji2025/fish-speech-ziming、guiji2025/duix.avatar在 deploy 目录执行cd deploy docker-compose up -d⚠️ 首次运行会下载约 70GB 镜像耗时几十分钟Docker 里看到 3 个服务都是 Running 即部署成功。两个变体不需要语音克隆时用精简版docker-compose -f docker-compose-lite.yml up -d只起 1 个视频合成服务Ubuntu 用docker-compose -f docker-compose-linux.yml up -d。第 3 步启动客户端npm run dev开发模式启动 Electron 客户端能跑起来说明环境没问题。生产使用可直接下载官方安装包省掉这一步。功能走查一段视频克隆形象再产出一条视频跟着一个小案例走完各功能怎么衔接创建数字人首页点 Create Avatar上传一段人在说话的视频。程序先拆分音画ASR 服务做语音识别语音合成服务完成声音克隆产出一个带脸 声的形象卡片存入 My Avatars 列表。生成视频点 Create Video选形象、输入文本或上传语音文件。TTS 服务把文本转成声音视频合成服务驱动数字人动嘴产出对齐口型的成片自动归档到 My Works。接入自己的系统容器对外暴露本地接口——语音合成http://127.0.0.1:18180/v1/invoke视频合成http://127.0.0.1:8383/easy/submit配合easy/query查进度。参数说明见 README 的 Open APIs 一节客户端的调用代码都在核心服务目录里照着改即可。调优与定制配置改哪里、起什么作用配置项生效位置实际效果完整版 / 精简版deploy/docker-compose.yml或docker-compose-lite.yml精简版只跑视频合成更省资源但没有克隆声音能力50 系显卡5090 等deploy/docker-compose-5090.yml换用 PyTorch 官方预览版CUDA 12.8镜像存放位置Docker Desktop → Settings → Resources → Disk image location把 100GB 镜像从 C 盘挪走Windows界面语言src/renderer/src/i18n/客户端中英文切换素材数据目录Windows 默认D:\duix_avatar_data\数字人、音频、视频的落盘位置磁盘空间紧张时先挪镜像位置再考虑清理缓存目录这两处是占用大头。避坑手册典型问题与解法现象原因解法docker-compose up -d拉镜像报request canceledDocker Hub 官方源连接不稳在 daemon.json 配置registry-mirrors镜像源后重试新增数字人报错上传的视频里没有人在说话视频必须包含真人讲话声音是语音克隆的依据创建数字人报Connection refusedASR 服务启动慢或内存太小服务端起来后等几分钟再操作16GB 内存已实测不够3 个服务都起不来没有 NVIDIA 显卡或驱动没装先跑nvidia-smi确认本项目无 GPU 无法启动以上都排查过还卡住需要日志定位客户端右上角菜单 Open Log服务端逐个点开 Docker 服务看 Logs提问或自查前先过一遍 常见问题文档 里的自查清单三个服务是否 Running、驱动是否装好、服务端和客户端是否都是最新版。一句话总结HeyGem.ai 是全离线的 AI 数字人视频生成工具三组命令加一次 70GB 镜像下载就能在自己电脑上跑出自己的脸 自己的声音的视频。卡住就看 doc/常见问题.md 怎么自查想改功能就从 src/main/service/ 的调用代码入手。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考