2026年8月3日,人工智能公司 MiniMax 正式开源通用多模态视频生成模型 MiniMax H3。该模型支持文本、图像、视频、音频联合理解与生成,可输出最高2K分辨率、最长15秒、24FPS、32kHz立体声的视频,兼容11种语言及多种宽高比。H3采用模块化设计,含Context-IR指令解析、Base基础生成和Regenerate-2K超分三部分,提供首尾帧、全模态参考等多种输入模式。项目基于 MiniMax H3 Community License 发布,开源地址已同步上线 Hugging Face。