MiniMax 全模态生成模型 H3 来袭,承诺开源权重,成本降低且应用场景广泛!

📅 2026/8/1 7:48:06
MiniMax 全模态生成模型 H3 来袭,承诺开源权重,成本降低且应用场景广泛!
MiniMax 上个月凭借 M3 在文本模型领域崭露头角今日又推出全模态生成模型 H3并承诺几天内开源权重。H3 能力出众成本降低但也存在一定短板。强大的能力边界H3 可接受文本、图像、视频、声音任意组合作为输入输出带原生双声道音频的视频最高 15 秒 2K 分辨率。例如输入参考视频、人物图片和歌声录音用自然语言告知需求H3 就能自行完成。训练范式的变革MiniMax 之前的两代视频模型按任务拆分维护成本高。H3 采用“任务泛化”思路将多种任务塞进同一预训练框架用自然语言描述任务关系还换了新架构端到端训练吞吐提升近 30%。关键技术亮点一是 H3 - VAETokenizer 重写压缩率带来 4 倍序列长度收益降低推理成本二是 In - context Regeneration让基座模型结合原始上下文重生成高分辨率版本补回细节。价格优势与开源利好2K 分辨率下每秒价格不到主流模型的 1/3768P 下不到 1/2。未来几天将在合规前提下开放模型权重且考虑了国产芯片兼容性利好国内开发者。应用场景与短板展示了电影片头、游戏 UI 动画等四个应用方向文字渲染和品牌信息呈现提升明显。不过多模态上下文理解、画面精细度和模型规模能力仍需提升未来将融合 H 与 M 系列能力。编辑观点H3 亮点颇多开源和低价格有望推动行业发展虽有短板但融合计划值得期待或为多模态领域带来新突破。