三分钟让照片开口说话:FasterLivePortrait 实时肖像驱动完整上手指南

📅 2026/8/14 12:51:44
三分钟让照片开口说话:FasterLivePortrait 实时肖像驱动完整上手指南
三分钟让照片开口说话FasterLivePortrait 实时肖像驱动完整上手指南【免费下载链接】FasterLivePortraitBring portraits to life in Real Timeonnx/tensorrt support实时肖像驱动项目地址: https://gitcode.com/gh_mirrors/fa/FasterLivePortrait如果我说一张静止的照片能跟着你的摄像头实时做出表情——眨眼、撇嘴、转头全程不卡顿、不用等渲染你会不会觉得我在吹牛FasterLivePortrait 做的就是这件事它用 TensorRT 对 LivePortrait 全面加速在 RTX 3090 上把渲染一帧压到 30 毫秒以内30 FPS并额外扩展了动物驱动、音频驱动、文本驱动等玩法。这篇文章不讲晦涩原理只按痛点→部署→上手→进阶→调参的顺序带你把这条实时肖像驱动链路完整跑通。一、它解决了什么痛点让能用变成能实时玩先交代背景。LivePortrait 这个模型本身已经很惊艳从一张源图片提取身份特征再让另一段视频里的人脸表情迁移过来。但原版在消费级显卡上处理一帧往往要数百毫秒导出一段几十秒的视频得等上好几分钟想做实时交互几乎不可能。FasterLivePortrait 的核心贡献就一件事把整套模型转换为 ONNX再用 TensorRT 深度优化。注意它的速度指标是实际渲染出帧的速度包含裁剪、贴回等前后处理而不是纯模型推理时间。这一下就解锁了三个新玩法摄像头实时驱动你对着摄像头做表情照片里的人同步模仿像照了一面AI 魔镜多张人脸同时驱动合影里的每个人都能一起活过来即时二次创作拼接缝合、区域动画、眼部嘴部重定向全部可以边看边调。一句话记住它同一个算法从能跑变成了能实时玩。二、三条部署路线横向对比选一条适合自己的部署是整个项目里最容易劝退新手的环节但好消息是有三条路总有一条适合你。路线 AWindows 整合包一键安装最省心这是为 Windows 用户准备的免安装方案整个环境已经打包好你只需要三步安装 Git然后双击update.bat拉取最新代码双击scripts/all_onnx2trt.bat把 ONNX 模型转换为 TensorRT 格式这一步会花上一段时间耐心等双击webui.bat打开网页界面或者双击camera.bat直接进入摄像头实时模式。小贴士如果电脑上还没装 CUDA建议装 CUDA 12.2这是整合包验证过的版本再把 cuDNN 的 lib、bin、include 文件夹复制到 CUDA 安装目录下能避开 90% 的环境报错。路线 BDocker 免环境部署Linux 与开发者首选如果你不想碰 onnxruntime-gpu 和 TensorRT 的安装地狱Docker 镜像已经替你配好了一切docker pull shaoguo/faster_liveportrait:v3 docker run -it --gpusall \ --name faster_liveportrait \ -v $FasterLivePortrait_ROOT:/root/FasterLivePortrait \ --restartalways \ -p 9870:9870 \ shaoguo/faster_liveportrait:v3 \ /bin/bash记得把$FasterLivePortrait_ROOT换成项目在你本地的实际路径-p 9870:9870负责把网页端口映射出来。进容器后就能直接跑下文的所有命令。路线 C手动 Python 环境需要自由定制时对想改源码、接进自己项目的用户手动搭环境也不难git clone https://gitcode.com/gh_mirrors/fa/FasterLivePortrait pip install -r requirements.txt前提是先装好 ffmpeg创建 Python 3.10 虚拟环境然后下载模型文件huggingface-cli download warmshao/FasterLivePortrait --local-dir ./checkpoints。macOS 用户则安装requirements_macos.txt后用 ONNX 模式跑。对比结论求省事选 A求干净选 B求自由选 C。新手我强烈建议从 A 或 B 开始先看到效果再谈折腾。三、跑通第一个示例让图片跟着视频动起来环境就绪后最直观的实验是用一张图片 一段驱动视频。以 ONNX 配置为例python run.py \ --src_image assets/examples/source/s2.jpg \ --dri_video assets/examples/driving/d14.mp4 \ --cfg configs/onnx_infer.yaml命令跑完后结果会保存到./results/目录同时会生成一个.pkl文件——它保存了这段驱动视频的完整动作数据。下次想换一张源图做同样的动作直接用.pkl驱动就行省去重复提取动作的耗时python run.py --src_image assets/examples/source/s0.jpg \ --dri_video ./results/xxx/d14.mp4.pkl --cfg configs/onnx_infer.yaml如果想体验最核心的实时把驱动源换成摄像头并加--realtime参数python run.py --src_image assets/examples/source/s10.jpg \ --dri_video 0 --cfg configs/trt_infer.yaml --realtime这里--dri_video 0表示使用 0 号摄像头--cfg切换配置文件。想追求实时必须用configs/trt_infer.yamlONNX 模式在 CPU/低配 GPU 上会慢得让人怀疑人生。不想敲命令直接启动网页版python webui.py --mode trtTensorRT 模式或python webui.py --mode onnx然后浏览器打开http://localhost:9870/。左侧选源图右侧选驱动视频也支持图片、.pkl、音频点 Animate 按钮即可。四、进阶玩法从人脸到动物、声音和文本跑通基础后这个项目真正的乐趣才刚开始。它不再只是人像驱动——整套玩法已经扩成了一个创作工具箱。换成猫脸试试动物驱动对人脸版权敏感那试试动物模型。只需在命令末尾加--animal参数python run.py --src_image assets/examples/source/s39.jpg \ --dri_video 0 --cfg configs/trt_infer.yaml --realtime --animal在 WebUI 里勾选is_animal开关即可切换人脸识别换成了动物模型宠物照片也能对着摄像头活起来。上传一段音频让照片开口说话JoyVASA这是最惊艳的功能之一。下载 JoyVASA 与 chinese-hubert-base 两个模型后在 WebUI 的Drive Audio标签页上传音频文件照片的口型会跟着声音自然开合。建议源是视频时只驱动嘴部区域效果更自然。用一行文字指挥表情Kokoro-82M下载 Kokoro-82M 模型在 Linux 上先执行apt-get install espeak-ngWindows 需单独配置环境变量然后在Drive Text标签页输入文字就能生成对应的语音并驱动肖像说话——输入框里那句默认的 Hi, I am created by Faster LivePortrait! 就是给你的第一课。把能力打包成 API 服务想接入自己的应用一行命令python api.py即可启动 HTTP 服务默认端口 9871返回打包好的结果文件参考tests/test_api.py就能看懂调用方式支持人像和动物模型两套接口。五、老手才知道的调参和避坑指南最后分享几个让效果质变的小技巧都是从实战里踩出来的。用好实时模式的快捷键渲染窗口聚焦时Q退出S切换缝合模式Z切换相对运动X切换动画区域C裁剪驱动视频K/L调整源图缩放N/M调整驱动图缩放。懂几个关键配置参数configs/onnx_infer.yaml等文件flag_relative_motion相对运动模式只迁移表情、保留源图头部姿态大多数场景建议开启flag_pasteback是否贴回原图开着才能得到无缝融合的完整画面animation_region动画区域可选 exp表情/ pose姿态/ lip嘴/ eyes眼/ all全部精细控制哪里能动driving_multiplier驱动强度数值越大表情越夸张做鬼畜视频的秘诀就在这里。常见坑位提醒TensorRT 版本必须用 8.x10.x 以上不兼容CUDA 与 cuDNN 版本不对也会报错Windows 整合包以 CUDA 12.2 为准模型文件缺失时用huggingface-cli download warmshao/FasterLivePortrait --local-dir ./checkpoints补全速度慢先检查两件事是否用了--cfg configs/trt_infer.yaml以及显卡驱动是否正常工作。写在最后从一张照片开始还记得开头那张跟着摄像头眨眼的照片吗现在轮到你了。选一条最顺手的部署路线下载好模型从跑通第一个示例开始——先让图片跟着视频动再打开摄像头看它实时模仿你最后试试音频和文本驱动。每一个功能第一次跑通时的惊喜就是这个项目最值得的部分。祝你的第一张照片早日开口说话。【免费下载链接】FasterLivePortraitBring portraits to life in Real Timeonnx/tensorrt support实时肖像驱动项目地址: https://gitcode.com/gh_mirrors/fa/FasterLivePortrait创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考