SadTalker 教程:从零到跑通的环境配置与模型下载完整指南

📅 2026/8/23 16:44:19
SadTalker 教程:从零到跑通的环境配置与模型下载完整指南
SadTalker 教程从零到跑通的环境配置与模型下载完整指南【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalkerSadTalker 是一个语音驱动人脸动画项目给它一张静态照片和一段音频它就能让照片里的人物开口说话并带上自然的表情与头部动作。这篇教程只围绕一个目标——帮你跑通第一个动画示例装对运行环境、下全模型文件、执行第一条推理命令。文中每一步都标注了命令的作用中途卡住时直接翻到报错急救包按条目对号入座即可。最快跑通路线赶时间的话直接照抄下面这套命令Windows 请用 PowerShell其余平台用终端git clone https://gitcode.com/GitHub_Trending/sa/SadTalker # 克隆项目仓库到本地 cd SadTalker # 进入项目目录 conda create -n sadtalker python3.8 # 新建独立环境conda 是环境管理工具python3.8 指定解释器版本 conda activate sadtalker # 激活环境后续命令都在其中执行 pip install torch torchvision torchaudio # 安装 PyTorch 深度学习框架模型推理的底座 conda install ffmpeg # 安装音视频处理工具输出视频时必需 pip install -r requirements.txt # 按项目依赖清单批量安装其余 Python 包 bash scripts/download_models.sh # 一键下载全部模型文件 python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results # 用示例音频和图片生成第一个动画macOS 用户在此基础上补一条pip install dlibdlib 是人脸关键点检测库macOS 需要单独安装其余平台不用。跑完后去results目录找 mp4 视频那就是你的第一个成果。把环境装对上面那串命令涉及四个前置条件Python 3.8推荐版本兼容性最佳、Git、Conda、FFmpeg。国内用户建议用文首的镜像地址克隆速度更快也更稳。三平台的差异集中在两条其余命令完全相同步骤WindowsmacOS含 M1/M2Linux终端PowerShell 或 WSL终端终端ffmpeg 安装手动安装并加入 PATH或conda install ffmpegconda install ffmpeg或brew install ffmpegconda install ffmpeg或sudo apt-get install ffmpeg额外步骤无装完依赖后执行pip install dlib无两个小提醒Windows 上若提示找不到 ffmpeg说明它没进 PATH装完后用ffmpeg -version确认能输出版本即可WSL 用户若报库加载错误先执行export LD_LIBRARY_PATH/usr/lib/wsl/lib:$LD_LIBRARY_PATH再运行。把模型拿全SadTalker 的推理依赖多个模型文件仓库里不含这些大文件需要单独下载。好消息是项目自带一键脚本在项目根目录执行bash scripts/download_models.sh # 自动创建 checkpoints 和 gfpgan/weights 目录并下载全部模型脚本会下载 5 个核心模型外加 3 个增强组件的配套权重模型文件存放位置作用mapping_00109-model.pth.tarcheckpoints/音频转表情系数mapping_00229-model.pth.tarcheckpoints/音频转头部姿态SadTalker_V0.0.2_256.safetensorscheckpoints/256 分辨率人脸生成器safetensors 是 PyTorch 模型的一种存储格式SadTalker_V0.0.2_512.safetensorscheckpoints/512 分辨率生成器画面更清晰GFPGANv1.4.pthgfpgan/weights/人脸增强模型用于提升成片质量模型总大小约 2GB视网络情况耗时约 5~10 分钟。下载卡住了怎么办脚本用的是断点续传参数中断后直接重跑同一条命令即可从断点继续已完成的文件会自动跳过。验证环境跑出第一个动画怎么确认环境没问题执行三条验证命令python -c import torch; print(torch.__version__) # 预期输出2.x.x 这样的版本号 python -c import dlib; print(dlib.__version__) # 预期输出19.24.6 左右 ffmpeg -version # 预期输出ffmpeg version 4.x 开头的信息三条都能正常输出版本号基础环境就算配好了。然后执行第一条推理命令仓库自带的示例素材在 examples/ 目录python inference.py --driven_audio examples/driven_audio/chinese_news.wav --source_image examples/source_image/full_body_1.png --result_dir results--driven_audio指定驱动音频--source_image指定要说活的照片--result_dir指定结果输出目录。首次运行要加载多个模型请耐心等待进度走完成功后在results目录会得到一个 mp4人物口型会跟着音频动。报错急救包以下 6 个是新手高频报错格式统一为报错原文 → 原因 → 解决步骤。ffmpeg: command not found / 不是内部或外部命令→ ffmpeg 未安装或不在 PATH 中 → 按上一节平台表安装 ffmpegWindows 用户额外确认安装路径已加入系统 PATH。RuntimeError: CUDA out of memory.→ 显存不足通常是显存碎片化导致 → 在运行推理前设置环境变量Linux/macOS 执行export PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128Windows 执行set PYTORCH_CUDA_ALLOC_CONFmax_split_size_mb:128再跑推理命令。FileNotFoundError: ...checkpoints\BFM_Fitting\similarity_Lm3D_all.mat→ 模型文件没下全 → 重新执行bash scripts/download_models.sh然后确认 checkpoints 目录下文件齐全。ModuleNotFoundError: No module named ai→ 某个 checkpoint 文件损坏或不完整 → 删除对应可疑文件后重跑下载脚本并核对文件大小是否正常。RuntimeError: unexpected EOF, expected xxx more bytes. The file might be corrupted.→ 下载中断导致文件被截断 → 重跑下载脚本即可wget -nc会自动续传并跳过完整文件。Illegal Hardware ErrormacOS M1/M2→ dlib 预编译包与 Apple 芯片不兼容 → 单独执行pip install dlib重装一次。更多疑难杂症可查 FAQ 文档 和 安装文档。进阶玩法姿态参考与人脸增强两个参数能明显提升成片质量都基于第一条推理命令追加即可。python inference.py --driven_audio examples/driven_audio/chinese_poem1.wav --source_image examples/source_image/art_0.png --ref_pose examples/ref_video/WDA_AlexandriaOcasioCortez_000.mp4 --result_dir results_with_ref--ref_pose提供参考视频仓库 examples/ref_video/ 下自带两条让人物的头部姿态和眨眼节奏参考视频中的人动作更生动。python inference.py --driven_audio examples/driven_audio/imagine.wav --source_image examples/source_image/art_0.png --enhancer gfpgan --result_dir results_enhanced--enhancer gfpgan在生成后调用 GFPGAN 增强人脸成片细节更清晰代价是耗时变长。接下来可以探索换组合试效果examples/source_image/ 有 30 余张示例图、examples/driven_audio/ 有十余条中英文音频任意搭配调表情强度--expression_scale默认 1.0调大表情更夸张调小更平静处理不同构图的照片--preprocess crop近景或--preprocess full全身照切换裁剪策略查问题FAQ 和 安装文档 覆盖了更多平台细节【免费下载链接】SadTalker[CVPR 2023] SadTalkerLearning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation项目地址: https://gitcode.com/GitHub_Trending/sa/SadTalker创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考