8月3日,MiniMax H3模型正式开源。早在7月31日,MiniMax就发布了H3,H3能在多模态上下文中统一理解创作意图,支持2K分辨率直出,可生成最长15秒的音画内容。据MiniMax官方,在价格上H3能做到仅为业内同类旗舰视频模型的三分之一。截至发稿,MiniMax股价涨超7%,报246.8港元/股。
值得一提的是,H3是MiniMax自海螺AI视频产品上线以来迭代的第三代视频生成模型。据悉,研发H3时MiniMax将重点从单项能力提升转向任务统一和泛化。MiniMax官方介绍,不同于Hailuo 01和Hailuo 02两代视频模型的架构,H3应用了最新的H3-Context-IR模型架构,这一架构能理解文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成结果之间的关系。
而应用这一架构、得益于以任务泛化为导向的系统设计,H3在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。目前在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面H3都表现出色,可实现精准、可控的多模态内容编辑与生成,并广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。
在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名也位居全球第一。
在价格方面,MiniMax H3视频生成价格为0.8元/秒(2K分辨率),仅为业内同类旗舰视频模型的三分之一。据悉,MiniMax系通过高压缩Tokenizer降低视频生成所需的Token数量,实现了成本优化与效率的提升。
基础设施方面,华为昇腾、摩尔线程、沐曦、海光信息、昆仑芯、天数智芯、壁仞科技、AMD、Intel等国内外芯片厂商,Hugging Face、魔搭 ModelScope、ComfyUI、RunningHub、fal等开发社区和云推理平台,另有 vLLM-Omni、SGLang等推理框架,均在H3开源同日完成了相关适配支持。
采写:南都N视频记者 林文琪