SadTalker 说话视频生成指南:一张照片加一段音频,让肖像开口说话 SadTalker 说话视频生成指南一张照片加一段音频让肖像开口说话【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker配音录好了成片里却只有一张不会动的照片。SadTalker 是音频驱动的说话视频生成工具给它一张肖像照片和一段音频它会生成口型同步的说话头部视频渲染分辨率由--size控制默认 256也可指定 512 使用新版 512x512 面部模型。项目由西安交通大学与腾讯 AI Lab 联合开发方法发表于 CVPR 2023代码以 Apache 2.0 协议开源。 最短路径装环境、下模型整条链路只依赖三样东西Python 3.8、Git、FFmpeg。装好之后剩下的都能交给脚本git clone https://gitcode.com/GitHub_Trending/sa/SadTalker bash scripts/download_models.sh bash webui.shLinux/macOS 依次执行上面三行克隆仓库、把全部模型文件自动下载到checkpoints/和gfpgan/weights/再运行webui.sh自动创建 venv、安装依赖浏览器会直接打开 Gradio 界面。macOS 若报 dlib 相关错误补一句pip install dlib即可。Windows 装好三样前置后在仓库目录双击webui.bat脚本会自动装依赖并启动界面模型文件需要手动下载分别放入checkpoints/和gfpgan/weights/两个目录。WebUI 和命令行共用同一套模型哪边顺手动哪边。 三条命令出第一条说话视频不用自己准备素材仓库自带示例音频和肖像替换成自己的文件后一条命令就能跑python inference.py --driven_audio examples/driven_audio/bus_chinese.wav \ --source_image examples/source_image/art_0.png \ --enhancer gfpgan前两个参数分别是音频和图片--enhancer gfpgan打开面部增强。跑完后成片输出到results/时间戳/时间戳.mp4终端会打印最终文件名。不想敲命令的话在 Gradio 界面里上传照片和音频、点生成效果一致。 三个参数决定成片效果完整参数表在官方文档 docs/best_practice.md。对成片影响最大的三个按重要度排1.--preprocess先决定素材怎么裁默认crop自动检测面部关键点裁出面部特写再生成头部运动和表情都最稳定。素材是全身或半身照时改用full并加上--still固定头部姿态可以得到自然的全身说话视频。resize会把整图缩放到目标分辨率再渲染适合证件照这类头像素材官方文档明确提示全身照用它会效果不佳。2.--enhancer面部细节增强--enhancer gfpgan或RestoreFormer会在成片上跑人脸修复网络提升面部细节想连背景一起增强再加--background_enhancer realesrgan。成片脸部发糊时这是第一个该打开的开关。3.--expression_scale表情强度默认 1.0数值越大面部表情动作越强。成片表情过于夸张、和语气不搭时把这个值调低一档再重新生成。另有一个可选项--ref_eyeblink和--ref_pose可以从另一段参考视频里借用眨眼和头部姿态成片的眼睛活动会更自然。 输入素材这样选图片正面、面部清晰系统要先检出面部关键点才能裁剪人脸占比太小或角度太偏时无法定位。光线均匀避免强烈侧光和重阴影。只支持真人或接近真人的肖像官方文档明确说明动漫等风格化图像不适用。音频只支持 wav 和 mp3其他格式会报解码错误官方 FAQ 有说明。录音尽量干净少带环境噪音音频负责驱动口型和表情素材越噪结果越不稳。仓库examples/driven_audio/自带 14 段示例音频覆盖中文、英文、日文不用录音也能马上生成。 三类具体用法课程与培训视频讲师的正面肖像加上录好的课程音频得到的说话视频可以直接放在课程首页或作为试看片段。内容更新时只换音频不用重新拍摄。外语教学素材示例音频里有英文如RD_Radio31_000.wav和日文japanese.wav配上固定肖像就能做出真人语音加静态图的发音演示素材。语言课里更换语段、更新讲义的成本很低。纪念与个人创作老照片、个人照片用--preprocess full --still生成全身说话视频头像是默认crop模式即可。想让眼神更自然加--ref_eyeblink从一段实拍视频里借用眨眼。❓ 卡住了先看这三条更多问题见官方 docs/FAQ.md。最常遇到的是这三条提示ffmpeg is not recognized或找不到命令先装 ffmpeg。Linux 用conda install ffmpegmacOS 用brew install ffmpegWindows 需要把 ffmpeg 加入 PATH。报checkpoints\BFM_Fitting\...等文件不存在模型没下全或放错位置。重新执行scripts/download_models.sh确认checkpoints/与gfpgan/weights/两个目录完整。Mac M1 报 Illegal Hardware Errordlib 的编译版本不兼容单独执行pip install dlib重装。适合手里有现成照片和音频、又不想学剪辑和动画的人教学、课程、纪念类内容都能直接套用。下一步可以先用仓库里的示例素材跑通流程再换成自己的素材按--preprocess、--enhancer、--expression_scale的顺序逐项调整。【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考