Duix.Avatar 数字人克隆本地部署教程:一段约 10 秒的视频生成口播数字人 Duix.Avatar 数字人克隆本地部署教程一段约 10 秒的视频生成口播数字人【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-AvatarDuix.Avatar 是一款免费开源的数字人克隆工具你提交一段约 10 秒的视频它在本地离线完成形象与声音的克隆之后你只需提供文案或一段音频就能自动产出与该人物口型同步的口播视频。适合想做口播内容、但不想出镜或不愿把素材传上云的创作者、教师和企业用户。部署前自查硬件与系统要求清单先对照配置不满足的项目会在后面卡住。检查项要求操作系统Windows 10 19042.1526 及以上或 Ubuntu 22.04 Desktop内核 6.8.0-52-generic显卡NVIDIA 显卡并装好驱动必需RTX 30/40/50 系列均可内存32GB 及以上必需硬盘WindowsC 盘留 100GB 以上存服务镜像D 盘留 30GB 以上存模型与作品Ubuntu留 100GB 以上CPU推荐值第 13 代 i5-13400F 一档Windows 上必须有 D 盘数字人模型和生成的作品默认都存在那里。全部算力跑在本机显卡上没有 NVIDIA 显卡或没装驱动服务端的容器起不来。首次拉取镜像约消耗 70GB 流量建议连 WiFi 下载。️ 本地部署 Duix.AvatarDocker 服务端 客户端1. 准备 Docker 环境Windows 用户在 PowerShell 执行wsl --list --verbose没有 WSL 就先执行wsl --install再用wsl --update更新从 Docker 官网下载 Docker Desktop按 CPU 架构选安装包并安装首次启动接受协议、跳过登录即可Ubuntu 用户sudo apt update sudo apt install docker.io docker-compose此外还要安装 NVIDIA 显卡驱动和 NVIDIA Container Toolkit后者是 Docker 调用 GPU 的必备工具。装完执行nvidia-smi能看到显卡信息即成功。如果 C 盘剩余空间不足 100GB可在 Docker Desktop 的 Settings → Resources → Advanced 中把 Disk image location 改到空间更大的磁盘2. 启动服务端git clone https://gitcode.com/GitHub_Trending/he/Duix-Avatar cd Duix-Avatar/deploy docker-compose up -d按你的环境换 compose 文件即可轻量版只启动一个合成服务docker-compose -f docker-compose-lite.yml up -dUbuntudocker-compose -f docker-compose-linux.yml up -dRTX 50 系列显卡已用 5090 验证30/40 系列 CUDA 12.8 也可用docker-compose -f docker-compose-5090.yml up -d标准配置会拉起三个服务Duix.Avatar-asr语音识别、Duix.Avatar-tts语音合成、Duix.Avatar-gen-video视频合成。下载大约需要半小时看到三个容器都处于 Running 状态即部署完成。3. 安装客户端到项目 Releases 页下载对应系统的安装包Windows双击Duix.Avatar-x.x.x-setup.exe完成安装Ubuntu直接运行Duix.Avatar-x.x.x.AppImageroot 用户下需要在终端执行并追加--no-sandbox参数从克隆数字人到生成第一条口播视频客户端主界面只有两个核心入口Create Video生成视频和 Create Avatar创建数字人下方列表分别管理作品与模型创建数字人点击 Create Avatar上传一段约 10 秒的视频。两个硬性条件画面中人脸清晰、无遮挡视频里有人在说话且声音清楚——系统要用这段声音做克隆提交后系统自动提取面部与声音特征耗时取决于显卡一般几分钟。生成口播视频在 Create Video 卡片里选择刚建好的模型填入要说的文案或直接上传一段音频点击生成稍等几分钟成片会出现在 My Works 列表口播文案支持 8 种语言英语、日语、韩语、中文、法语、德语、阿拉伯语、西班牙语可在设置里切换界面语言。 服务起不来、生成卡住怎么排查排查前先过三件事三个服务是否都处于 Running 状态nvidia-smi能否看到显卡服务端与客户端是否都是最新版本服务端重新执行docker-compose up -d即可刷新镜像拉取失败connection 报错docker-compose up -d报request canceled/context canceled多是 Docker Hub 官方源连接不稳定。给 Docker 配一个镜像源Windows 在 Docker Desktop → Docker Engine 的 JSON 里加入registry-mirrorsUbuntu 改/etc/docker/daemon.json保存后重启 Docker再重新执行docker-compose up -d。克隆形象报 Connection refused日志里出现funasr Connection refused一般是 asr 服务还没启动完。服务端刚拉起时它启动较慢等几分钟再操作。另外注意内存太小如 16GB可能直接起不来。生成进度停在 20%进度条长时间不动多半是音频环节出错。打开 Duix.Avatar-tts 容器的 Logs 页看是否有File does not exist一类报错出现这类报错时检查D:\duix_avatar_data\voice\data与 fish-speech 服务约定的音频目录可在 docker-compose 中修改下的音频文件是否完整必要时重启该容器再重跑一次合成任务。进阶调用 API 批量合成数字人视频Docker 启动后服务端在本地开放了接口通过http://127.0.0.1即可调用环节接口模特训练ASR 预处理POST /v1/preprocess_and_tran端口 18180音频合成TTSPOST /v1/invoke端口 18180视频合成POST /easy/submit进度查询GET /easy/query?code...端口 8383流程是把素材视频分离为静音视频加音频音频放入D:\duix_avatar_data\voice\data调用训练接口拿到asr_format_audio_url和reference_audio_text两个返回值再作为参数传给音频合成接口最后把音频与视频路径提交给视频合成接口。每个接口的完整请求参数可以直接参照客户端里的调用代码src/main/service/model.js、src/main/service/video.js、src/main/service/voice.js。这条路线没有界面步骤限制适合用脚本批量生产视频。出问题时下一步查文档与提 Issue部署或生成出问题先按 doc/常见问题.md 的自查步骤走一遍确认服务状态、用nvidia-smi验证显卡、更新到最新版本。仍解决不了时把复现步骤、客户端日志主界面右上角菜单可打开和三个 Docker 服务的日志整理好再到项目的 Issues 区提问附上截图与日志会处理得更快。【免费下载链接】Duix-Avatar Truly open-source AI avatar(digital human) toolkit for offline video generation and digital human cloning.项目地址: https://gitcode.com/GitHub_Trending/he/Duix-Avatar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考