
Duix.Avatar10秒视频克隆数字人从部署到出片全记录【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar上次客户临时要一条产品介绍口播视频我下午翻遍了工具清单在线服务按分钟计费本地方案要么要传素材上云要么环境装到崩溃。后来接触到 Duix.Avatar它是本地部署的数字人克隆工具——提交一段 10 秒左右带人声的视频就能克隆你的形象和声音之后输入文案或上传音频自动生成口型同步的口播视频全程离线素材不出机器。 它到底是什么Duix.Avatar 是硅基智能开源的数字人工具箱开源协议支持全球免费商用用户量超 10 万或年营收超 1000 万美元的企业需签商业许可协议仓库根目录有协议 PDF。核心能力一句话一段 10 秒视频完成形象 声音克隆文案驱动生成口播视频。形态上客户端是 Electron 桌面应用服务端是 Docker 拉起的三个本地服务算力全部在自己机器上。10 秒视频克隆形象与声音文字、音频两种驱动方式全离线素材不上传8 种界面语言Docker 一键起服务端开放本地 API 可二次集成 跟我做一次先对一下硬件要求后面全用得上Windows 1019042.1526 及以上或 Ubuntu 22.04NVIDIA 显卡30/40/50 系列均可 已装好驱动内存 32G磁盘留 100G 以上首次拉镜像约 70G 流量。拿到代码只需一行git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatardeploy目录里放好了四份 docker-composeWindows 用默认的docker-compose.ymlUbuntu 用docker-compose-linux.ymlRTX 50 系显卡用docker-compose-5090.yml只想要视频合成那一个服务跳过声音克隆就用docker-compose-lite.yml。进目录执行cd deploy docker-compose up -d剩下就是等半小时上下Docker 会把三个服务TTS、ASR、视频合成的镜像拉下来跑起来。Windows 用户留意一点C 盘要装得下 100G 的镜像文件空间不够就去 Docker Desktop 的 Settings → Resources → Disk image location把镜像目录挪到别的盘再 Apply服务端就绪后从项目 Releases 下载对应系统的客户端安装包Windows 双击 exe 安装Ubuntu 直接运行 AppImageroot 用户需加--no-sandbox。打开客户端点 Create Avatar上传那段 10 秒视频克隆完成后你的第一个数字人就在 My Avatars 里了。接着点 Create Video输入文案或上传音频生成结束第一条口播视频出现在 My Works 列表中。 看看效果生成完成后My Works 里按时间排列着所有作品支持关键词搜索和分页浏览点开就能播放、下载或基于同一模特重做。右上角 Setting 菜单里可以切换界面语言共支持中文、英文、日、韩、法、德、阿拉伯、西语 8 种文案跟着界面语言走。两种驱动方式的差别很直接文字驱动时系统先用克隆的声音把文案读成音频再驱动口型适合批量出稿音频驱动则直接拿你上传的音频对口型适合已有配音、不想重新合成的情况。 拆开看看如果你打开源码目录客户端的后端逻辑集中在src/main/service/下三个文件各管一段model.js新增模特。用 ffmpeg 把上传视频转成 h264、分离音轨音频送去做声音克隆形象模型写入本地 SQLite。voice.js声音克隆与合成。先调 ASR 接口拿到参考音频的文本之后把文案发给 TTS 服务用克隆音色合成语音。video.js成片组装。把音频和模特视频提交给 8383 端口的合成接口轮询进度并更新作品列表。整条数据流四步走视频拆轨ffmpeg 提取音轨ASR 识别出参考文本声音克隆参考音频 文本入库建立音色语音合成文案 → 克隆音色的 wav视频合成wav 模特视频 → 口型同步成片不想走客户端Docker 起来后所有能力都以本地 API 暴露合成任务提交到http://127.0.0.1:8383/easy/submit用/easy/query?codexxx查进度声音侧是 18180 端口的/v1/preprocess_and_tran克隆和/v1/invoke合成。参数样例都写在上面三个源码文件和 README 的 API 一节里照着请求即可。⚠️ 你可能撞上的坑拉镜像超时报 request canceled。Docker Hub 官方源对国内网络不稳定。解法在 Docker 配置里加registry-mirrors配国内镜像源改完 Apply restart 再重新docker-compose up -d新增模特直接报错。最常见原因是上传的视频里没有声音或没有人说话——程序要用这段声音做声音克隆。重拍一段 10–20 秒、人脸清晰且在说话的视频再传。定制模特报 Connection refused。ASR 服务启动比较慢服务端刚拉起就点克隆会连不上。等几分钟再操作另外 16G 内存的机器可能根本拉不起这套服务32G 是实打实的要求。卡在某个进度不知道查哪。客户端日志在 Setting 菜单的 Open Log本地是 logs 目录下的 main.log服务端日志去 Docker 里点对应容器的 Logs 页签生成卡 20% 这类问题基本能在 TTS 容器的日志里看到音频路径报错⚖️ 适合谁 / 不太适合谁适合手上有 NVIDIA 独显机器想不出镜批量做口播、教学、宣传视频素材涉隐私或商业机密要求全离线处理开发者想通过本地 API 把数字人生成接进自己的产品需要多语言内容用 8 种界面语言分别产出不同语种版本不太适合没有 NVIDIA 显卡或内存不足 32G三个服务跑不起来希望五分钟跑起来接受不了半小时拉镜像和 70G 的磁盘占用追求广播级的口型精度本地版官方定位是效果可用用户规模很大的商业化落地商用前先核对 LICENSE 里的签署门槛把数字人视频从按分钟计费的云端服务变成一套能躺在自己机房里的工具代价就是一张 NVIDIA 显卡和 100G 磁盘。部署被卡住时先翻 doc/常见问题.md上面几个坑基本都有记录商用授权条款看 LICENSE 和仓库里的协议 PDF。机器够的话先拉镜像从 lite 版本试起。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考