MiniMax H3:ComfyUI 工作流示例

📅 2026/8/4 14:43:27
MiniMax H3:ComfyUI 工作流示例
了解如何在 ComfyUI 中使用开源权重模型 MiniMax H3通过原生工作流实现文生视频、图生视频和参考生视频所有功能均支持原生立体声音频。MiniMax H3 是 MiniMax 的通用全能生成模型现已以开源权重形式提供。它能在单一上下文中联合理解文本、图像、视频和音频并生成带有原生立体声音频的视频——语音、音效和音乐在单次前向传播中一同建模而非事后叠加。输出可达 2K 分辨率、24fps时长约 15 秒。ComfyUI 原生支持 MiniMax H3。模板库目前内置了三个示例工作流分别涵盖一种生成模式文生视频T2V根据文本提示生成视频图生视频I2V根据输入图像生成视频支持可选的首帧/尾帧控制参考生视频R2V生成锁定角色、风格、动作、镜头运动或声音的视频基于参考图像、视频和音频你可以通过MiniMaxH3ImageToVideo节点进行图像生成通过MiniMaxH3ReferenceToVideo节点进行参考驱动生成并利用这些节点构建更多自定义工作流。关键特性原生立体声音频对话、音效和音乐与视频一同生成同步输出为单个 MP4 文件多模态上下文可在一次生成中组合文本、图像、视频和音频引用参考驱动生成从参考素材中锁定角色身份、风格、运动、镜头运动或声音指令遵循用自然语言描述参考素材与目标镜头之间的关系精确文字渲染拼写文字和品牌元素可清晰渲染开源权重在 ComfyUI 中本地运行完全掌控每个参数快速开始MiniMax H3 已在 ComfyUI 中通过开源权重得到支持。要开始使用请按以下步骤操作将 ComfyUI 更新到0.30.0 或更高版本进入模板库Template Library 视频Video选择任意 MiniMax H3 工作流按照弹窗提示下载模型并运行工作流设置输出分辨率每个工作流都使用分辨率选择器Resolution Selector节点来控制整体输出尺寸。该节点根据三项设置计算宽度和高度其输出直接连接到 MiniMax H3 节点的宽度和高度输入宽高比Aspect ratio选择预设值如 16:9宽屏、9:16竖屏宽幅或 1:1方形百万像素数Megapixels目标总像素数。数值越高画面越大数值越低运行越快倍数Multiple计算出的分辨率将四舍五入到该数值的最近倍数。请保持为32以匹配 H3 的分辨率网格在 16:9 比例下设为 1.0大约得到1344×768这是 H3 的原生画布短边为 768px上限为 768×1344 像素。ComfyUI 原生工作流MiniMax H3 文生视频T2V从文本提示生成视频支持原生立体声音频。模型下载模型存储路径textComfyUI/ ├── models/ │ ├── diffusion_models/ │ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors │ ├── text_encoders/ │ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors │ └── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors │ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧描述完整场景先描述整体场景地点、角色、正在发生的事然后拆分为分段镜头镜头、运镜和音频在一个提示块中同时描述镜头、运镜以及伴随的音频对话、音效、音乐分辨率H3 的原生画布为 768px 短边上限 768×1344 像素四舍五入到 32 的倍数时长时长输入将对齐到模型在 24fps 下的每块 17 帧17k5网格首帧/尾帧将图像连接到MiniMaxH3ImageToVideo节点的first_frame和/或last_frame即可将此工作流转变为首帧/尾帧图生视频MiniMax H3 图生视频I2V从输入图像生成视频支持可选的首帧/尾帧关键帧。模型下载模型存储路径textComfyUI/ ├── models/ │ ├── diffusion_models/ │ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors │ ├── text_encoders/ │ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors │ └── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors │ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧关键帧first_frame和last_frame输入为可选项模型会生成两者之间的运动提示词在一个提示块中描述镜头、运动以及伴随的音频对话、音效、音乐分辨率H3 的原生画布为 768px 短边上限 768×1344 像素四舍五入到 32 的倍数时长时长输入将对齐到模型在 24fps 下的每块 17 帧17k5网格MiniMax H3 参考生视频R2V从参考图像、视频和音频的任意组合中生成锁定角色、风格、运动、镜头运动或声音的视频。模型下载模型存储路径textComfyUI/ ├── models/ │ ├── diffusion_models/ │ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors │ ├── text_encoders/ │ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors │ └── vae/ │ ├── minimax_h3_video_vae_fp16.safetensors │ └── minimax_h3_audio_vae_fp32.safetensors提示词技巧按标签引用按照连接的确切顺序用标签引用每个输入例如img1、vid1为每个参考分配任务说明哪个参考驱动镜头的哪个部分身份、风格、运动、镜头、声音。明确分配效果会更好限制最多9 张参考图像、3 段参考视频每段可携带自己的音轨和3 段独立参考音频片段ref_image_sizematch可将参考图像缩放到生成分辨率以提升速度max可保持短边最高 2048px以获得更强的身份保真度但会牺牲速度采样器对于参考密集的提示词使用res_multistep配合beta或normal调度器通常优于simple注意R2V 使用ref2va扩散模型这是一套与 T2V 和 I2V 工作流使用的fl2va模型不同的权重