SadTalker上手指南:一张人像加一段音频生成会说话的人脸动画 SadTalker上手指南一张人像加一段音频生成会说话的人脸动画【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是 CVPR 2023 发表的人脸动画工具只需一张人像图片和一段音频就能生成口型、表情与头部动作同步的说话人脸视频。下面是从环境搭建到跑通第一条视频的完整本地路径。能力速览单张人像加音频生成说话人脸视频支持全身图输入保留原始姿态可从参考视频借用眨眼与头部动作GFPGAN 一键增强面部清晰度 最短路径装好依赖并跑出第一条视频克隆仓库并进入目录git clone https://gitcode.com/GitHub_Trending/sa/SadTalker cd SadTalker创建独立的 Python 3.8 环境并依次安装依赖。README 中钉死的是 torch 1.12.1 cu113如果你的显卡需要别的 CUDA 版本按 README 换对应版本即可conda create -n sadtalker python3.8 conda activate sadtalker pip install torch torchvision torchaudio conda install ffmpeg pip install -r requirements.txt接着下载全部预训练权重一条命令拿齐音频到表情、音频到姿态、256/512 两档渲染器以及 GFPGAN 权重并自动建好 checkpoints/ 与 gfpgan/ 目录bash scripts/download_models.sh下载脚本用了断点续传重复执行不会重复下载如果网络环境下源站较慢可以按脚本里的清单手动取文件放到相同目录。跑之前确认两件事python -c import torch; print(torch.__version__)能打印版本ffmpeg -version不报错——前者影响模型加载后者影响视频合成。仓库自带中文新闻音频和全身人像直接作为首次输入组合python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results流水线依次做三件事从图片提取 3DMM 系数、音频预测运动系数、渲染合成。成片在results/时间戳/时间戳.mp4。习惯点选界面的话Linux/Mac 跑webui.sh、Windows 双击webui.bat会启动一个功能相近的 Gradio 演示。 用法配方三组输入组合输入组合关键参数产出效果近景人像 音频默认自动裁脸表情与头部动作丰富全身图 音频--still --preprocess full贴回原图保留原始姿态头部几乎不动人像 音频 参考视频--ref_pose 视频头部动作借自参考视频更自然--ref_eyeblink 视频可单独使用只借眨眼节奏任意配方加--enhancer gfpgan生成后再做面部增强examples/ 目录里有多组人像与音频样本可自由组合完整参数说明见最佳实践文档。 高频故障速查ffmpeg 不被识别单独安装 ffmpeg 并加入 PATHconda install ffmpeg或brew install ffmpeg即可解决。CUDA out of memory运行前设置export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 用set。FileNotFoundError / ModuleNotFoundError: No module named ai都是模型文件缺失或下载不完整重跑bash scripts/download_models.sh补齐。音频解码报错只支持 wav 或 mp3 输入其他格式先转成 wav。更多疑难可以参考官方 FAQ。 延伸社区已将 SadTalker 做成 Stable Diffusion WebUI 扩展见 WebUI 文档配合 GFPGAN 与 Real-ESRGAN它能扩展进一条完整的数字人口播视频生产线。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考