ComfyUI-WanVideoWrapper 完整指南:WanVideo 系 AI 视频生成在 ComfyUI 中的落地方式

📅 2026/8/23 16:10:05
ComfyUI-WanVideoWrapper 完整指南:WanVideo 系 AI 视频生成在 ComfyUI 中的落地方式
ComfyUI-WanVideoWrapper 完整指南WanVideo 系 AI 视频生成在 ComfyUI 中的落地方式【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapperComfyUI-WanVideoWrapper 是一套 ComfyUI 自定义节点把 WanVideo 及其周边 20 多个视频生成技术整合进 ComfyUI 节点系统。它解决的实际问题是WanVideo 生态里的衍生模型控制、音频驱动、超分、重打光等数量多、依赖杂逐个手动集成成本高而且在消费级显卡上跑 14B 模型往往卡在显存上。这个插件把模型加载、文本编码、采样、VAE 解码和各类控制信号统一成节点并内置块交换block swap、FP8 量化等显存优化让中小显存的显卡也能跑起完整流程。能力总览输入模态到生成效果的对照先看它能做什么按输入类型划分输入能做的事对应功能文本文生视频T2V1.3B 快速档 / 14B 高质量档核心采样器 T5 文本编码单张图图生视频I2V首帧扩展、尾帧衔接FLF2V、参考主体复用WanVideoSetLatent、VACE、Phantom、Stand-In视频视频到视频重绘、视频换主体、超分辨率Mocha、FlashVSR音频音频驱动口型与动作单人/多人、带声音的视频生成FantasyTalking、HuMo、MultiTalk、Ovi、S2V姿态/骨骼按参考视频的姿态驱动新人物动作UniAnimate、SteadyDancer、SCAIL、One-to-All相机参数按相机轨迹重拍、自由控制镜头运动Fun Camera、ReCamMaster、Uni3C运动轨迹点指定物体在画面中沿轨迹移动ATI、WanMove所有功能共用同一套采样链路控制信号以嵌入embeds的形式叠加在正向/负向条件上再进入统一采样器。安装与模型准备环境要求已装好 ComfyUI 的环境Python 依赖 PyTorchCUDA 建议 2.0核心第三方依赖为diffusers0.33、accelerate、peft、gguf、einops等见 requirements.txt。安装步骤将仓库克隆到 ComfyUI 的custom_nodes目录cd /path/to/ComfyUI/custom_nodes git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper安装依赖cd ComfyUI-WanVideoWrapper pip install -r requirements.txtWindows 便携版则在ComfyUI_windows_portable目录下执行python_embeded\python.exe -m pip install -r ComfyUI\custom_nodes\ComfyUI-WanVideoWrapper\requirements.txt按模型类型放到对应目录模型下载位置见 readme.md 的 Models 章节作者推荐 fp8 scaled 版本模型放置目录文本编码器umt5-xxlComfyUI/models/text_encoders/视觉编码器CLIP visionComfyUI/models/clip_vision/主视频模型TransformerComfyUI/models/diffusion_models/VAEComfyUI/models/vae/文本编码器和 CLIP vision 也可以用 ComfyUI 原生加载节点替代不必单独放文件。主模型加载节点WanVideoModelLoader支持 GGUF 量化格式低显存环境可以优先考虑。第一次生成一条最简 T2V 工作流以最基础的文本到视频为例可参考 example_workflows/wanvideo_2_1_14B_T2V_example_03.json完整链路是 6 类节点WanVideoModelLoader加载 14B T2V 模型fp8 scaled 版本并挂接WanVideoBlockSwap指定交换块数示例中为 20。LoadWanVideoT5TextEncoder WanVideoTextEncode加载 umt5-xxl 编码器输入正向提示词和负向提示词负向建议覆盖静态、低质量、多余手指、画面发灰等产出文本嵌入。WanVideoEmptyEmbeds设定生成尺寸和帧数示例为 832×480、81 帧生成空潜变量这是视频生成的起点。WanVideoSampler核心采样器关键参数为 shift、steps、cfg、seed、调度器示例用dpm_sdeshift 6、5 步、cfg 1对应蒸馏 5 步模型。WanVideoVAELoader WanVideoDecode用 VAE 把潜变量解码为像素帧。视频合并输出用 ComfyUI-VideoHelperSuite 的VHS_VideoCombine导出视频。连接后点击队列生成输出即为一个短视频。后续所有高级功能都是在第 3、4 步之间插入控制嵌入节点采样链路本身不变。功能逐项拆解文本到视频T2V最基础也最通用的能力。1.3B 模型生成快适合调参数和快速预览14B 模型细节和运动质量更好适合出成品。长视频可以通过上下文窗口context window机制分段生成再拼接README 中给出的实测数据是用 81 帧窗口、16 帧重叠生成 1025 帧1.3B T2V 模型显存占用不到 5GB5090 上约 10 分钟。图像到视频I2V与参考主体I2V 把单张图片作为首帧扩展成视频WanVideoSetLatent系列节点支持首帧、尾帧同时给定FLF2V来控制运动起止。此外还有多条主体参考路线VACE 支持参考图遮罩的编辑式生成Phantom、Stand-In、MAGREF 等节点可以把已有主体搬进新场景。适合做产品展示、固定角色连续出片。音频驱动与带声音视频音频类功能覆盖几种典型需求FantasyTalking、HuMo 用参考图音频做口型同步的数字人MultiTalk 支持多人说话S2Vspeech-to-video支持音频首帧生成带动作的说话视频Ovi 走的是图生视频同时生成配套音频的路线自带音频 VAE 与 BigVGAN 声码器可产出 10 秒左右的音画同步片段。音频预处理响度归一化等在 nodes_utility.py 中有现成节点。控制类姿态、相机与轨迹姿态控制UniAnimate含 DWpose 提取、SteadyDancer、SCAIL、One-to-All 可把参考视频的身体姿态迁移到生成人物上。相机控制Fun Camera、ReCamMaster、Uni3C 按相机参数重新拍摄生成画面适合固定机位换运镜。运动轨迹ATI、WanMove 用轨迹点坐标控制物体在画面中的路径。ControlNet通用 ControlNet 接口支持深度、边缘等控制信号注入。质量增强FlashVSR 提供基于参考图的实时超分UniLumos 做重打光WanVideoEnhanceAVideoFEta用于增强画面一致性。这些节点串在解码前后即可使用。参数与性能显存策略和推荐值显存优化是这个插件的重点四个手段按优先级FP8 scaled 模型显存占用大幅下降画质损失小是作者的推荐配置。块交换WanVideoSetBlockSwap WanVideoBlockSwap把部分 Transformer 块换出到内存。README 给出的参考数据是 512×512×81 帧、14B 模型交换 20/40 块时约 16GB 显存。注意未合并的 LoRA 权重现在会并入块一起交换交换块数可能要比以前多 1~2 块。GGUF 量化低显存环境的保底方案。VAE tiling解码大分辨率时开启分块解码进一步压峰值。常用参数参考以 14B 为例具体随模型版本调整参数说明参考值steps采样步数蒸馏模型 4~5 步完整模型 30~50 步cfg无分类器引导强度蒸馏配置常用 1完整模型 3~5shift流匹配时间偏移5~6示例工作流为 6分辨率/帧数显存主要变量832×480×81 帧是 14B 的常用档位帧数取 4n1TeaCache 阈值缓存加速0.25~0.30新版阈值比旧版大 10 倍块交换数显存/速度权衡按显卡实测OOM 就加块数速度不够时还可以叠加 TeaCache 缓存cache_methods/与 FreeInitfreeinit/等免训练加速技术。常见问题排查现象更新后首次运行显存暴增可能原因torch.compile 依赖旧版 PyTorch/Triton 的编译缓存问题多见于 Windows。 解法升级 PyTorch 与 Triton 到较新版本清理 Triton 缓存目录C:\Users\用户名\.triton和C:\Users\用户名\AppData\Local\Temp\torchinductor_用户名后重新运行第二次起恢复正常。现象加了 LoRA 后显存比之前高甚至 OOM可能原因更新后未合并 LoRA 的权重改为挂载到模块 buffer 上不使用块交换时全部常驻显存。 解法启用或增加块交换块数按 README 的经验1GB 未合并 LoRA 大约让每块多占 25MB交换 20 块就多占约 500MB相应多换 1~2 块即可。现象某些节点如 ATI、Ovi在界面里找不到可能原因可选模块的依赖缺失导入失败只打印警告不报错见init.py 中的 OPTIONAL_MODULES 列表。 解法看启动日志中WanVideoWrapper WARNING: xxx nodes not available的具体报错补装对应依赖。现象日志提示发现重复的 WanVideoWrapper 目录可能原因custom_nodes下存在多份插件目录节点注册可能冲突。 解法删除多余目录只保留一份。现象视频运动呆板、开头几帧跳变可能原因步数太少或 TeaCache 阈值过于激进早期步数被跳过后运动会受损。 解法提高步数TeaCache 阈值回到 0.25~0.30 区间必要时让缓存从更晚的步数开始。现象画质不理想、细节发糊可能原因用了低质量档位1.3B、fp8、低分辨率或负向提示词缺失。 解法换 14B 模型提高分辨率与步数检查负向提示词是否覆盖低质量、多余手指、畸形等常见项。代码地图想深入源码时从这些入口入手路径作用readme.md安装、模型列表、显存更新说明项目入口文档init.py节点注册表REQUIRED_MODULES 是核心OPTIONAL_MODULES 是各功能模块nodes.py主节点嵌入构建、VAE 编解码、块交换、文本编码等nodes_sampler.py采样器实现所有控制信号的汇聚点predict_with_cfgnodes_model_loading.py模型加载、LoRA、GGUF、VAE 加载wanvideo/WanVideo 核心网络代码modules/model.py主干、modules/vae.py、modules/t5.py、schedulers/各采样调度器、modules/attention.py多种注意力后端cache_methods/TeaCache 等缓存加速context_windows/长视频上下文窗口调度gguf/GGUF 量化权重支持各功能目录ATI/、Ovi/、HuMo/、FlashVSR/、fantasytalking/、unianimate/、controlnet/、fun_camera/、recammaster/、s2v/ 等每个目录一个功能模型代码 nodes.py节点定义example_workflows/40 多个开箱即用的 JSON 工作流按模型和功能命名进阶与生态学习路径建议先跑通 T2V 示例工作流理解六个核心节点的分工再做 I2V 和 FLF2V体会嵌入叠加的思路之后按需进入音频驱动或姿态控制最后尝试长视频上下文窗口和缓存加速的组合。example_workflows/里每个 JSON 都是一个可拆解的教程直接加载就能看节点连线。需要说明一点作者自己的定位这个插件是作者的个人沙盒特点是新模型跟进快、代码长期处于演进中与 ComfyUI 原生 WanVideo 支持相比除非你要用的模型或功能原生还没有否则原生方案通常更稳定。官方 issue 区目前对新建账户关闭作者因刷机器账号关闭遇到问题先看已有 issue 和 ComfyUI 社区讨论。上手的最小行动建议克隆仓库、装依赖、放好一个 FP8 scaled 的 14B 模型和 VAE加载 T2V 示例工作流把提示词换成你自己的描述——第一个视频通常 10 分钟内就能出。【免费下载链接】ComfyUI-WanVideoWrapper项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考