Duix-Avatar 本地部署教程:一条命令离线生成数字人,10秒视频克隆自己的数字分身 Duix-Avatar 本地部署教程一条命令离线生成数字人10秒视频克隆自己的数字分身【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar做云端数字人平台素材要先上传到别人服务器生成一条视频收一次费还离不开网。Duix-Avatar 是一个完全跑在你自己电脑上的开源本地数字人工具上传一段 10 秒左右的视频就能克隆你的形象和声音之后输入文字即可离线生成口播视频不用联网、不按次计费。这篇文章带你从零把环境搭起来、跑通第一个产出再讲清原理和最容易踩的坑。关键词核心关键词本地数字人、Duix-Avatar 离线部署长尾关键词10 秒视频克隆数字人、Docker 一条命令部署数字人、离线生成口播视频、RTX 4070 数字人性能、数字人服务日志排查从零跑通三步拿到你的第一个本地数字人先花 2 分钟检查硬件和磁盘服务端的全部算力都跑在本地 NVIDIA 显卡上所以这台机器的硬性条件是必须有一块英伟达显卡且装好了驱动。没有这张卡后面三个容器一个都起不来。官方推荐的配置和磁盘要求内存 32G 及以上16G 大概率起不来后面坑位里会讲参考机型i5-13400F 32G 内存 RTX 4070Windows 需要 10 系统 19042.1526 或更高版本C 盘留 100G 以上存镜像D 盘留 30G 以上存数字人素材和作品Ubuntu 版本官方适配了 22.04 Desktop内核 6.8.0-52-generic空闲空间 100G 以上用nvidia-smi看一眼能显示出显卡信息就说明驱动没问题。Docker 一条命令部署服务端把仓库克隆下来部署脚本在 deploy/ 目录git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d然后就是等首次拉镜像大约 70G 流量官方说半小时左右看网速建议连 WiFi 跑。完整版起来后 Docker 里会看到三个服务Duix.Avatar-asr语音识别、Duix.Avatar-tts声音合成、Duix.Avatar-gen-video视频合成。几个按场景选的执行变体只需要视频合成、不想拉全套docker-compose -f docker-compose-lite.yml up -d只有一个服务50 系列显卡如 5090官方已测试通过30/40 系列用 CUDA 12.8 的也可以docker-compose -f docker-compose-5090.yml up -dUbuntu 上装完 Docker 和 nvidia-container-toolkit 后sudo apt update sudo apt install docker.io docker-compose nvidia-container-toolkit sudo nvidia-ctk runtime configure --runtimedocker sudo systemctl restart docker再执行docker-compose -f docker-compose-linux.yml up -d即可。Windows 上如果 C 盘不足 100G装完 Docker 后可以在 Docker 设置的 Resources → Disk image location 里把镜像存储位置挪到别的盘见下图下载客户端验证第一个产出服务端三个服务都是 Running 之后从官方 Release 页面下载安装包Windows 是Duix.Avatar-x.x.x-setup.exe双击安装Ubuntu 是Duix.Avatar-x.x.x.AppImage免安装直接运行root 用户进桌面时需要加--no-sandbox参数。客户端启动后会自动检测本地服务状态。上传一段 10 秒左右的、人在说话的视频创建数字人再输一段文字生成口播视频——✅ 看到第一条作品出现在我的作品里恭喜你本地数字人已经跑通了。界面 5 分钟速览按动线走一遍主界面很克制左侧一个 Home右侧就两大块 作品列表见下图按你的操作动线走Create Avatar快速定制上传 10 秒视频克隆形象和声音产出出现在 My Avatars我的数字模特 列表里可以起名字、按名字搜索。Create Video短视频制作选一个已创建的数字人输入文案系统自动合成语音并驱动口型产出在 My Works我的作品 列表里支持分页浏览。右上角 Settings只有三项——查看用户协议、打开客户端日志排查问题用、中/英文语言切换。原理速览10 秒视频是怎么变成数字人的整个过程没有玄学就三步而且全部发生在你本机你上传的 10 秒视频先被拆成画面和声音两条轨道。画面交给视频合成服务gen-video学习你的长相和口型声音则走另外两个服务——ASR 服务基于 FunASR先把视频里说的话转成文字TTS 服务基于 fish-speech学习你的音色。克隆完成时系统手里已经有了你的脸 你的声音两份本地模型。之后你每输入一次文案系统就用 TTS 把你的文案读成你的声音再把这段音频和模特视频喂给视频合成服务做唇形对齐输出最终口播视频。所谓全链路本地处理说的就是上面这条链路上的每个服务都跑在你自己电脑的 Docker 容器里数据不出机器客户端本身只是一个壳它调用的就是本机127.0.0.1上的那几个端口脚本层面支持中、英、日、韩、法、德、阿拉伯、西语共 8 种语言。避坑手册五个高频问题按现象 → 原因 → 解决排查⚠️ 遇到卡住或报错先按下面四条自查项目官方也建议先看 doc/常见问题.md三个服务是否都是 Running、nvidia-smi是否识别显卡、服务端客户端是否都是最新版、项目 Issue 列表里是否已有现成答案。docker-compose up -d 报错 request canceled / context canceled现象三个服务全部失败日志里出现request canceled while ... 15.1s这类超时错误。原因拉镜像走 Docker Hub 官方源国内网络不稳定。解决在 Docker 设置的 Docker Engine 里配置国内镜像加速registry-mirrors列表保存后 Apply restart或者开全局代理再拉一次。新增模特报错克隆形象失败现象上传 10 秒视频创建数字人时报错。原因视频里没有声音或画面里没有人说话——系统要靠这段声音做声音克隆静音视频必然失败。解决换一段本人正对镜头、口齿清晰说话的视频重新上传。克隆形象提示 Connection refused现象服务端刚启动就操作克隆日志里出现Connection refused。原因ASR 服务启动较慢需要几分钟才能就绪另外内存只有 16G 的机器可能直接起不来。解决等服务跑满几分钟再操作如果是新机器按官方要求把内存加到 32G。TTS 日志反复刷 file not exists现象heygen-tts容器日志里反复出现File not exists错误任务卡住。原因音频文件路径包含中文或特殊字符或磁盘剩余空间不足官方要求 C 盘 100G 以上、D 盘 30G 以上。解决把素材路径改成纯英文无空格检查磁盘剩余空间是否达标。三个容器起不来或不停重启现象容器创建失败或反复重启状态一直不是 Running。原因本项目算力全在本地显卡缺 NVIDIA 显卡或没装驱动时容器无法启动。解决nvidia-smi验证驱动必要时从英伟达官网重装仍不行就到项目 Issue 列表里搜同类问题比如 tts 服务重启类问题在 Issue 中已有讨论。进阶玩法与二次开发API 能力边界Docker 起来后本地会暴露几个 HTTP 端口整套功能都能被你的代码调用也就是说不一定非要用客户端。三个关键接口模特训练127.0.0.1:18180/v1/preprocess_and_tran把视频里分离出来的音频做预处理返回一段参考音频和它的文字转写这两样东西是后续合成声音的凭据。音频合成127.0.0.1:18180/v1/invoke传入文本和一个保持唯一的 speaker UUID再加上上一步返回的参考音频就得到这个人的声音读出的音频。视频合成127.0.0.1:8383/easy/submit提交音频和模特视频的路径并拿到任务码再用/easy/query?code任务码轮询进度。客户端里这三步的完整调用逻辑可以直接参考 src/main/service/ 下的 model.js、voice.js、video.js端口约定在 src/main/config/config.js。能力边界很清楚适合做批量生产流水线、接进自己的后台或内容系统、按业务逻辑自动排产不适合的则是实时对话类场景——它的定位是离线视频合成不是实时驱动。硬件选型与成本不同档显卡怎么选本地部署是一次性硬件投入换掉持续订阅费而且项目支持全球免费商用唯一限制用户量超 10 万或年营收超 1000 万美元的企业需另签商业许可协议。社区实测 8G 显存的卡也能跑所以真正的分水岭是内存32G 起和显存大小。不同档位的参考数据来自官方和参考资料的公开口径硬件档位推荐输出分辨率单次克隆耗时生成速度RTX 4070 32G 内存720P约 15 分钟1.2 倍实时RTX 4080 64G 内存1080P约 10 分钟2.0 倍实时RTX 4090 128G 内存1080P约 8 分钟3.5 倍实时选型建议个人创作者用 4070 档起步足够产出 720P 口播视频没有压力批量做号或商用出 1080P 素材再上 4080/4090 档时间成本差距明显。磁盘别省C 盘 100G D 盘 30G 是底线50 系新卡5090用户记得用docker-compose-5090.yml这套配置。最后三句话收个尾Duix-Avatar 让你把数字人从云端按次付费变成本地一次买断形象和声音素材全程不出你的机器它用 Docker 三个容器 一个图形客户端的形态把门槛压到了会开终端的程度免费商用条款则让它能直接用于教育课程、电商口播和企业培训等真生意场景。现在就做一件事把仓库克隆下来在deploy/目录里敲下docker-compose up -d泡杯茶等半小时回来创建你的第一个数字人。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考