MiniMax 发布 H3:原生立体声视频生成的新纪元
2026 年 7 月 31 日,MiniMax 正式推出了其最新的多模态生成系统——MiniMax H3。与以往专注于单一模态或特定任务(如纯文本对话或纯代码生成)的模型不同,H3 被定义为一种“通用多模态生成系统”(general-purpose, omni-modal system),其核心能力在于能够理解多种媒体类型的上下文,并同步生成带有原生立体声(native stereo audio)的短视频。
核心突破:H3 vs M3 vs Hailuo 2.3
在 MiniMax 的产品矩阵中,H3、M3 与 Hailuo 系列常被混淆。官方明确界定了三者的本质区别:
1. MiniMax H3:视听内容生成引擎
- 定位:通用多模态生成系统。
- 核心任务:基于文本、图像、视频或音频输入,生成 4-15 秒的视频片段及配套的 32kHz 立体声音频。
- API 标识:
MiniMax-H3。 - 适用场景:产品宣传片、参考图视频化、动态海报生成、基于音频指令的视觉创作。
2. MiniMax M3:智能编码与 Agent 模型
- 定位:独立的编码与智能体(Agent)模型。
- 核心任务:专注于代码生成、长上下文推理、计算机视觉操作及复杂任务规划。
- 输入支持:虽接受图像和视频输入,但其输出是代码、分析报告或任务执行结果,而非视频流。
- 关键指标:上下文窗口可达百万级 Token。
3. Hailuo 系列:产品与早期模型
- Hailuo AI:面向用户的 Web 应用入口,提供媒体生成的交互界面。
- Hailuo 2.3:2025 年 10 月发布的早期视频模型,侧重于物理运动、角色微表情及运动指令响应,并非 H3 的代名词。
技术规格与功能特性
H3 的架构设计旨在实现“文/图/视/音”到“视频 + 立体声”的端到端映射,具体规格如下:
- 输入上下文:支持文本、图像、视频片段及音频片段的多模态组合输入。
- 输出格式:
- 视频分辨率:基础版(H3-Base)原生支持 768p,通过 Regenerate-2K 或端到端 API 可输出至 2K。
- 帧率:24 fps。
- 音频规格:32 kHz 立体声,实现视频与声音的同步生成。
- 开源计划:H3-Base 模型权重已发布,采用 FL2VA 和 Ref2VA 架构,在自定义许可下开放。
开发者价值与应用场景
对于开发者而言,H3 的发布标志着视频生成 API 的重大升级。它不再需要分别调用视频生成模型和音频合成模型,而是通过统一的 MiniMax-H3 API 完成全链路创作。
- 自动化内容生产:企业可快速将产品图片、设计草图或营销文案转化为高质量的短视频素材。
- 交互式娱乐:结合音频输入,可开发“听音作画”或“语音讲故事”的交互式应用。
- 智能体协作:M3 可负责复杂的逻辑规划与代码编写,而 H3 则负责将规划结果可视化,两者结合可构建完整的数字人或虚拟演示系统。
MiniMax 强调,H3 并非 M3 的视频版,也不是 Hailuo 2.3 的简单迭代,而是一个专注于视听联合生成的独立系统。这一清晰的边界划分,将帮助开发者更精准地选择工具,构建高效的多模态应用生态。