2026年7月31日,MiniMax发布新一代多模态生成模型MiniMax H3,并宣布近期开源。在我们看来,这可能是一个和DeepSeek R1开源时同样重要的时刻——开源领域终于有了一个真正意义上的"全模态"统一模型,且能力无限逼近了闭源最强模型。
在我们的实测中,H3是一个和Seedance 2.0能打得有来有回的模型,生成速度更快,价格也更低(官方定价0.8元/秒,仅为业内同类旗舰的三分之一)。
H3支持原生的多模态理解与生成,用户可以上传文字、图片、音频、视频等多种输入,也可以直接让H3生成缺失的那个模态。例如,上传一段动画作为参考视频、一张街景作为参考图片,H3会识别球状屏幕的几何特性并让人物运动遵循球面变形规律,同时自动补齐音频。
在编辑能力方面,H3表现出强大的广义编辑能力。给视频里的人物配音、改变台词,H3能同时适配音色和嘴形。在导演级指令跟随测试中,H3能精确执行复杂的灯光变化指令——烛光、硬光、彩虹折射、红蓝对打、金色逆光依次出现且过渡平滑。
MiniMax对H3进行了彻底的架构重构,提出了Contextual Omni Representation、H3-VAE、H3-Omni Transformer和In-context Regeneration四项核心工作。其核心设计理念是尽可能早地去掉任务、能力、模态之间的"隔离",用语言统一所有任务的中间层,从而长出更泛化的多模态能力。
MiniMax官方博客写道:"长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。"H3的开源将推动整个多模态领域共同迈上一个台阶。
上一篇:MiniMax第三代视频模型开源,视频编辑能力全球第一
下一篇:港股通科技ETF鹏华(159751)、恒生科技ETF鹏华(520590)涨近1%,MiniMax H3正式开源,海光DCU同步完成Day0适配