ComfyUI_MiniMaxH3_Director 原生长立体声音频生成 / 原声 / 静音三模式完整指南【免费下载链接】ComfyUI_MiniMaxH3_DirectorMulti-segment MiniMax H3 Director for official ComfyUI MiniMax-H3项目地址: https://gitcode.com/gh_mirrors/com/ComfyUI_MiniMaxH3_DirectorComfyUI_MiniMaxH3_Director是 ComfyUI 官方 MiniMax H3 的多段音视频导演台插件其最大亮点之一是原生长立体声音频声音与画面在同一次采样中生成无需外挂音频模型。本指南带你快速掌握输出栏「声音」下拉框的三档模式——生成声音、使用原声、静音以及各模式下该怎么写提示词、怎么挂素材。一、原生立体声音频是怎么来的MiniMax H3 是「音视频联合生成」模型画面 latent 和音频 latent 在一次采样里同时产生再分别经 Video VAE 与 Audio VAE 解码。插件直接接管这条官方链路把解码出的音频与画面按帧对齐后封装输出输出格式统一为44.1 kHz 立体声通过节点的audio输出口送出默认采样参数中音频端使用shift_audio 3.0画面上为 12.0与官方工作流保持一致音频 VAE 使用minimax_h3_audio_vae_fp32.safetensors放入models/vae/。下图是插件主界面注意时间轴下方「输出」区域中的声音下拉框图中为「使用原声」它就是三模式切换入口二、三模式速览表模式输出音频来源参考/源音频还起什么作用适用任务 生成声音默认模型从 AV latent 解码生成作条件驱动口型/节律全部任务 使用原声从源视频音轨按帧抽取或原样拼入该段参考音频仍作条件让画面贴住原声v2v/rv2v/r2v 静音44.1 kHz 静音轨仅条件不输出声音全部任务模式解析逻辑见 resolve_audio_modesource只对v2v / rv2v / r2v生效其它任务如t2v选了「使用原声」会自动按「生成」处理。三、模式 1生成声音默认输出为模型生成的声音由提示词控制内容台词、环境音、BGM 都可以写进 prompt参考音频Audio 1…Audio 3此时是条件输入通过 Audio VAE 编码进 AV latent驱动画面口型与节律但不会直接出现在成片里兜底机制i2v / fl2v / r2v / v2v / rv2v任务中若某段模型音频为空会自动回退抽取源音频填补避免整段无声见 task_passes_source_audio。四、模式 2使用原声这是重混、配音对齐类工作流的核心v2v / rv2v源视频编辑插件按时间轴逐段从源视频抽音轨逻辑帧 → 源帧 → PCM 时钟对齐精确到帧只裁剪/补齐绝不拉伸 PTS不会听出「加速读完」的怪味。抽取实现见 lib/audio_io.py。r2v参考主体生视频没有源视频时间轴输出音频 该段第一条参考音频原样混流mux 前自动归一化到 44.1 kHz 立体声任意输入格式都可以没挂参考音频的段输出静音。提示词要点r2v 原声模式prompt 的 audio 标签建议写fully_copy且台词必须与音频逐字一致否则口型会错位生成模式则写reference。详见专题说明 docs/r2v-source-audio.md。安全回退若原声模式下抽不到音轨如源视频无声插件会回退为静音并在运行报告里写明原因而不是偷换成模型生成音保证你一定能察觉异常。 参考音频槽位可以直接选一个视频文件插件会立即提取其首条音轨为 FLAC 存到input/上传规则与 ComfyUI 保持一致同名同内容复用、不覆盖。五、模式 3静音输出 44.1 kHz 静音轨画面链路完全不变适合先出画面、后期单独混音或批量生成时省却无效音频渲染报告口report会明确标注Audio: muted。六、常见问题与实用技巧 多段「全部导出」会怎样各段音频会按时间轴顺序拼接成完整音轨缺音频的段用静音填充不会拿别段的音去顶避免音画错位拼接逻辑见 _merge_generated_segment_audios。选择运行部分段后音频还准吗会按各段真实帧长对齐拼接不会把整条时间轴均分给部分音频若发现不同步重跑全部段落刷新音频缓存即可。声音下拉框为什么消失了「使用原声」只在v2v / rv2v / r2v下显示见 minimax_timeline.js其它任务只出现「生成/静音」。立体声保证无论模型音频、源抽取还是参考音频最终都会对齐为 2 声道输出单声道会复制补齐。七、相关文件索引 内容路径三模式解析与音频导出核心director/audio_export.py源视频音轨按帧抽取lib/audio_io.py参考音频槽位音频1–3 /Audio Nlib/ref_audios.pyr2v 原声专题说明docs/r2v-source-audio.md前端「声音」下拉框与时间轴web/js/minimax_timeline.js默认参数与模型清单README.md八、小结ComfyUI_MiniMaxH3_Director 的音频链路可以一句话概括一次采样音画同出。日常创作用「生成声音」让模型自由发挥改配音、重混音类需求切「使用原声」获得帧级对齐的原声输出需要后期混音就「静音」占位。三个档位切换只需在下拉框点一下剩下的对齐、归一化与回退都由插件自动完成。【免费下载链接】ComfyUI_MiniMaxH3_DirectorMulti-segment MiniMax H3 Director for official ComfyUI MiniMax-H3项目地址: https://gitcode.com/gh_mirrors/com/ComfyUI_MiniMaxH3_Director创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考