
2023年8月3日(中国时间),MiniMax发布了通用AI模型「MiniMax-H3」的权重文件,已在Hugging Face平台公开。该模型能够综合理解文本、图像、视频和音频等多种素材,生成最高2K分辨率并带有立体声的视频。
MiniMax-H3采用MiniMax-H3社区许可协议,允许商业使用,但需注明许可信息。若年销售额超过2000万美元(约合31亿元人民币,按1美元兑155日元计算),则需事先获得MiniMax的书面许可。欧盟、英国、韩国和美国等地区不适用该许可,使用前需与MiniMax公司进行额外协商。
该模型不仅支持从文本生成视频,还能同步生成与画面匹配的立体声音频,支持从起始和结束图像进行视频插帧,且能处理多参考视频和音频,实现复杂指令的视频生成。它兼容多种开发和部署环境,支持Diffusers、ComfyUI、SGLang、vLLM等主流推理框架,同时提供Web体验平台Hailuo AI及开发者专用的MiniMax开放平台API。
生成视频时长范围为4秒至15秒,支持21:9、16:9、4:3、1:1、9:16等多种宽高比,帧率为24FPS,音频输出为32kHz立体声。支持包括日语、英语、中文、韩语、法语、德语在内的11种语言。
此次开源的权重文件包含两个版本:
- 「H3-Base-FL2VA」支持从文本生成视频,并可基于最多两张输入图片指定起止帧进行视频生成。
- 「H3-Base-Ref2VA」作为全参考模式,支持最多9张图片、3段视频和3段音频的组合输入,最多可同时处理12个文件。
系统由三大模块构成:
- 预处理模块「H3-Context-IR」将复杂的多模态指令转换为模型易于理解的中间表示。
- 核心模型「H3-Base」基于中间表示同时预测视频和32kHz立体声音频,生成标准768p分辨率内容。
- 「H3-Regenerate-2K」模块利用768p生成结果和原始上下文信息,重新生成最高2K分辨率的高质量视频,细节保留良好。
模型主引擎采用拥有330亿参数的Dense单流Transformer「H3-Omni-Transformer」,时空位置编码引入了三维多模态旋转位置嵌入(MM-RoPE)。文本编码器则采用了「Qwen3-VL-32B」的权重。
此外,相关硬件如「GeForce RTX 5090」也在市场上受到关注,支持高性能AI模型的运行。


