ComfyUI-LTXVideo:LTX-2 视频生成的 2 条主流工作流 + 4 个显存与画质调优手段

📅 2026/8/24 22:57:07
ComfyUI-LTXVideo:LTX-2 视频生成的 2 条主流工作流 + 4 个显存与画质调优手段
ComfyUI-LTXVideoLTX-2 视频生成的 2 条主流工作流 4 个显存与画质调优手段【免费下载链接】ComfyUI-LTXVideoLTX-Video Support for ComfyUI项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideoComfyUI-LTXVideo 是 ComfyUI 的自定义节点包为 LTX-2 / LTX-2.3 视频生成模型提供 IC-LoRA 控制、两阶段上采样、HDR 输出与文本生成音频等节点。本文覆盖安装配置、文本/图像转视频工作流、LoRA 进阶控制以及显存不足和生成异常的排查。能力速览能力说明典型场景文/图转视频单、两阶段960×54430fps 基线采样两阶段可接空间上采样短视频、宣传片、动态海报IC-LoRA 控制单个 LoRA 同时接收深度图与边缘图控制条件在降采样潜在空间运行以省显存保持构图、镜头运动可控专用 IC-LoRAHDR、唇形重配音、运动轨迹、像素级 2×/4× 生成式上采样等十余种影视级 HDR、多语言配音、低分辨率草稿提分辨率文本生成音频T2A纯音频模式采样无需视频输出背景音乐、音效生成低显存加载器依赖输入串行化模型加载配合--reserve-vram控制在 32GB 内运行32GB VRAM 边缘机器环境与安装最小硬件与软件要求项目要求GPUCUDA 兼容32GB 显存低显存方案见low_vram_loaders.py内存16GB RAM磁盘100GB 可用空间模型 缓存软件ComfyUI 主程序 ComfyUI-Manager安装走 ComfyUI-Manager 即可无需手动 clone打开 ManagerCtrlM→ Install Custom Nodes → 搜索 LTXVideo → 安装 → 重启 ComfyUI新节点出现在 Lightricks 分类下。若手动部署在 ComfyUI 的custom_nodes目录执行git clone https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideo cd ComfyUI-LTXVideo pip install -r requirements.txt重启 ComfyUI 后节点加载失败时先看启动日志再补装依赖。需要下载的模型放入models/对应子目录LTX-2.3 检查点checkpoints/ltx-2.3-22b-dev.safetensors完整版或ltx-2.3-22b-distilled-1.1.safetensors蒸馏版空间上采样器latent_upscale_models/ltx-2.3-spatial-upscaler-x2-1.1.safetensors两阶段工作流必需时间上采样器latent_upscale_models/ltx-2.3-temporal-upscaler-x2-1.0.safetensors蒸馏 LoRAloras/ltx-2.3-22b-distilled-lora-384-1.1.safetensorsGemma 文本编码器text_encoders/gemma-3-12b-it-qat-q4_0-unquantized各类 IC-LoRAloras/union-control、motion-track、HDR、lipdub、pixel-spatial-upscaler 等按需下载示例工作流全部在example_workflows/2.3/目录下可直接拖入 ComfyUI 加载。核心工作流演示960×544 单阶段文本/图像转视频以example_workflows/2.3/LTX-2.3_T2V_I2V_Single_Stage_Distilled_Full.json为模板。参数设定分辨率 960×544121 帧30fps约 4 秒CFG 设为 1README 建议 CFG 保持在 1 附近过高会放大伪影采样器euler_ancestral_cfg_ppManualSigmas指定的 9 点 sigma 表蒸馏 LoRA 强度 0.5ltx-2.3-22b-distilled-lora-384-1.1.safetensors关键节点EmptyLTXVLatentVideo [960, 544, 121, 1]视频潜空间尺寸121 帧是 30fps 下 4 秒的整数倍长度避免尾帧抖动图像转视频时用LTXVImgToVideoConditionOnly强度 0.70.7 表示保留原图七成特征留三成给运动生成纯文生视频时跳过此节点负提示词固定为pc game, console game, video game, cartoon, childish, ugly这是 LTX-2 官方推荐的排除项压掉塑料感和卡通化解码用LTXVTiledVAEDecodetile 2×2overlap 6而非普通 VAE 解码分块解码把峰值显存切成小块22B 模型整帧解码很容易 OOM提示词用 Gemma 编码器长描述比短词效果更好例如 A traditional Japanese tea ceremony takes place in a tatami room… 这类带场景、动作、声音的句子预期输出30fps 的 4 秒 960×544 视频SaveVideo节点输出output_F同步生成一条环境音轨。首次运行会按提示下载缺失模型。两阶段上采样先定构图再提分辨率以LTX-2.3_T2V_I2V_Two_Stage_Distilled.json为模板流程是草稿 → 放大参数设定第一阶段同上第二阶段接LTXVLatentUpsamplerltx-2.3-spatial-upscaler-x2-1.1.safetensors分辨率翻倍到 1920×1088ManualSigmas换成 4 点的低噪声表0.85, 0.7250, 0.4219, 0.0关键节点LTXVImgToVideoConditionOnly第二阶段强度改为 1完全锁定画面内容图像经ResizeImageMaskNode缩到长边 1536 再进模型为什么这样设第一阶段用少量步数锁死构图和运动第二阶段只补高频细节总耗时低于直接跑全分辨率且小分辨率阶段的参数更容易调好预期输出1088p 视频细节比单阶段锐利工作流内 Note 节点也提醒按硬件调整 tile 数与 overlap——tile 越少越快但越吃显存进阶控制与调优问题一想控制构图和运动但多个控制条件要装多个 LoRA手段Union IC-LoRAltx-2.3-22b-ic-lora-union-control-ref0.5把深度图和 Canny 边缘图合并进单个 LoRA由LTXAddVideoICLoRAGuide节点接入。参考工作流见example_workflows/2.3/LTX-2.3_ICLoRA_Union_Control_Distilled.json。效果一个 LoRA 同时响应两种控制信号且它在降采样的潜在空间上运行显存占用更低、推理更快质量基本不损失。问题二低分辨率草稿满意但不敢直接交付手段Pixel Spatial Upscaler IC-LoRA2× 或 4× 两个变体工作流在example_workflows/2.3/LTX-2.3_ICLoRA_Pixel_Spatial_Upscaler_Distilled.json。约 280p 出草稿锁定构图运动后用它出终稿。效果模型是合成细节而非插值放大。LoRA 强度、CFG、步数三个旋钮控制保真度——调低更贴近原片调高则允许更多生成式细节。注意它是创作型放大器不保证逐像素还原。问题三32GB 显存仍偶发 OOM手段把CheckpointLoaderSimple等换成low_vram_loaders.py里的LowVRAMCheckpointLoader用dependencies输入把各加载器串成串行启动 ComfyUI 时加python main.py --reserve-vram 5解码继续用LTXVTiledVAEDecode并减小 tile 数。效果三管齐下后 22B 模型可在 32GB 内完成生成代价是加载顺序变慢。对比速查特性输入适用场景Union IC-LoRA深度图 / 边缘图构图与运动控制HDR IC-LoRA视频 LTXVHDRDecodePostprocess解码需调色、EXR 输出的影视流程Lipdub IC-LoRA源视频 目标台词文本多语言配音、同语言改台词实战场景给产品图生成 4 秒环绕展示视频加载LTX-2.3_T2V_I2V_Two_Stage_Distilled.jsonLoadImage换成产品图长边缩到 1536LTXVImgToVideoConditionOnly强度设 0.7提示词写环绕运动camera slowly orbits around the product, studio lighting第一出 960×544 草稿确认构图不满意改提示词重跑此时步数少、代价低满意后跑第二阶段到 1088p 出终稿约 15 分钟量级口播视频改英文台词加载example_workflows/2.3/LTX-2.3_ICLoRA_Lipdub_Two_Stage_Distilled.json输入含人脸与语音的源视频提示词写目标台词文本LTXVSetAudioRefTokens保留说话人参考音第一阶段出基础分辨率的新口型与音频第二阶段上采样时音频冻结输出即为台词替换后的视频说话人音色保持一致性能与排错质量 vs 速度速查配置耗时量级质量适用场景蒸馏模型 单阶段2–5 分钟良好草稿、参数调试完整模型 单阶段5–15 分钟优秀日常出片蒸馏 两阶段上采样15–30 分钟很高交付级成品完整 两阶段 HDR30 分钟以上顶级影视级、需调色高频故障排查节点没出现✅ ComfyUI-Manager 里搜 LTXVideo 重装装完必须重启 ComfyUI✅ 确认节点在 Lightricks 分类下而非 LTXVideo✅ 手动安装时检查目录必须放在ComfyUI/custom_nodes/下模型加载失败 / 运行中断✅ 检查文件是否下完整22B 检查点为几十 GB 量级下断会缺尾部✅ 检查模型是否在正确的子目录checkpoints//loras//latent_upscale_models//text_encoders/✅ 磁盘剩余空间是否够 100GB模型 缓存生成结果模糊或画面抖动✅ CFG 是否偏离 1 过多保持 1 附近✅ 是否用LTXVTiledVAEDecode且 tile/overlap 未随硬件调整✅ 帧数是否为采样周期整数倍121 帧 / 30fps收尾把你调通的一组参数分辨率、帧数、CFG、sigma 表、LoRA 强度从工作流里另存为预设 JSON放到presets/习惯目录下次改完提示词一键复现不用再逐格重填。【免费下载链接】ComfyUI-LTXVideoLTX-Video Support for ComfyUI项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-LTXVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考