Duix.Avatar本地部署教程:10秒视频克隆形象,本地离线出片 Duix.Avatar本地部署教程10秒视频克隆形象本地离线出片【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar想让AI替你在视频里出镜吗Duix.Avatar 是一款开源数字人工具上传一段10秒左右的说话视频就能克隆你的形象和声音之后输入文案或上传音频全部在本地离线生成口播视频数据不出内网。它适合想在 Windows 或 Ubuntu 上私有部署、不想把素材传到第三方平台的个人和小团队。整套流程分四步确认配置、Docker 起服务端、克隆数字人、出第一支片。一、先确认这台电脑跑得动这个项目所有算力都在本地 GPU 上硬件不够后面所有命令都会卡住所以动手前先对一遍清单。硬件对照表项目要求系统Windows 10 19042 及以上或 Ubuntu 22.04内存32G 及以上必需16G 可能起不来显卡NVIDIA 显卡并装好驱动必需无 N 卡服务起不了磁盘Windows 需有 D 盘且空闲 30G 以上C 盘空闲 100G 以上存 Docker 镜像推荐参考配置i5-13400F 32G 内存 RTX 4070。C 盘不够 100G 也不用慌装完 Docker 后可以在 Settings → Resources → Advanced 里把 Disk image location 指到空闲空间更大的磁盘装好 Docker 和显卡驱动服务端跑在 Docker 里这是绕不开的前置件。Windows先执行wsl --install和wsl --update装好 WSL网络不稳就多试几次再安装 Docker Desktop。看到 Docker 主界面能打开说明装好了。Ubuntu用 apt 安装 docker.io 和 docker-composeNVIDIA 驱动去官网装装完执行nvidia-smi能打印出显卡信息才算成功最后还要装 nvidia-container-toolkit否则容器用不了 GPU。二、用 Docker 把服务端跑起来服务端是三个 Docker 服务fish-speech语音合成、fun-asr语音识别、duix.avatar视频合成。你不需要理解它们内部只需要把它们拉起来。克隆代码三条命令启动先拿代码git clone https://gitcode.com/GitHub_Trending/he/HeyGem.ai cd HeyGem.ai然后装客户端依赖并启动桌面客户端让 Electron 窗口先跑起来npm install npm run dev看到客户端桌面窗口弹出说明 Node.js 环境没问题客户端要求 Node.js 18。最后在仓库的 deploy 目录里启动服务端cd deploy docker-compose up -d首次拉镜像约 70G 流量官方建议留半小时左右连 WiFi 别用流量。看到什么才算成功打开 Docker Desktop或执行docker ps三个容器全部是 Running 状态就成功了。三个服务分别占用 18180语音合成、10095语音识别、8383视频合成端口记住 8383后面用 API 会提到。三、克隆你的第一个数字人客户端打开后是三个入口Create Video、Create Avatar下方是 My Works 和 My Avatars 两个列表。点 Create Avatar上传一段 10 秒左右的视频。这里有两个硬性要求视频里必须有人且人在说话视频必须带声音。为什么卡这么死因为程序会直接从视频里提取你的声音做克隆再拿画面建模。用静音视频或纯风景素材克隆必失败。提交后等训练完成My Avatars 里出现一张新模型卡片就是你的第一个数字分身了。四、第一次出片从文案到口播视频回到 Create Video选中刚克隆好的模型然后二选一输入一段文案系统会用你的克隆音色朗读再驱动口型上传一段音频直接用现成音频驱动适合你不想用 TTS 的场景。点生成稍等片刻My Works 里会多出一支口型对得上的视频点开即播。文案支持 8 种语言中、英、日、韩、法、德、阿拉伯、西班牙语。到这里从克隆到出片的主流程就走完了。五、进阶玩法选读主线跑通后按需深入。显存不大用 lite 版deploy 目录里除了默认的 docker-compose.yml还有 docker-compose-lite.yml。lite 版只启动视频合成这一个服务适合显存紧张、只做视频合成的机器。用-f docker-compose-lite.yml指定它启动即可。注意它没有语音合成和识别服务形象、声音克隆走不了只能拿现成音频驱动。50 系显卡专用方案RTX 50 系官方用 5090 测试通过30/40 系 cuda 12.8 用户也可用要用 deploy 目录下的 docker-compose-5090.yml它基于 torch 官方预览版构建别混用默认文件。用 API 接进自己的系统Docker 启动后所有能力都在本地端口开放语音合成 18180、视频合成 8383接口是http://127.0.0.1:8383/easy/submit提交、/easy/query查进度。想写脚本批量出片可以直接参考 src/main/service/ 里现成的调用代码。六、踩坑速查docker-compose up -d 拉镜像超时、报 request canceled原因Docker Hub 官方源不稳定。 解决Docker 设置 → Docker Engine 里加国内 registry-mirrors 镜像源Apply restart 后重试。新增模特报错训练失败原因素材视频没声音或者画面里不是人在说话。 解决重录一段 10 秒内、口齿清晰、单人出镜的说话视频再传。定制模特报 Connection refused原因ASR 服务启动慢或者内存只有 16G 压根没起来。 解决服务端刚起来等几分钟再克隆内存不足就按 32G 升配。更多问题见官方文档 doc/常见问题.md。一句话回顾Docker 起三个服务、10 秒视频克隆形象、文案一键出片整条链路全在本地完成。你的下一步很具体找个窗边好光线的位置录一段 10 秒说话视频按第二、三节的顺序跑一遍今晚就能拿到自己的第一支数字人口播视频。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考