MiniMax 发布 H3 开源权重:FL2VA 与 Ref2VA 本地生成能力详解
MiniMax 在 2026 年 7 月 31 日推出 H3 系统,并于 8 月 2 日率先公开了核心生成部分的权重文件。此次发布在 AI 开源社区引发了广泛关注,因为它清晰地界定了“开源权重”(Open Weights)与“完全开源”(Fully Open Source)之间的关键界限。
核心突破:开源的边界与能力
MiniMax 明确表示,H3 并非完全开源。虽然核心生成模块的权重已公开,但系统的完整训练流程、部分生产级模块及数据并未完全披露。这种策略旨在平衡社区创新与商业保护。
1. 开源部分:H3-Base 生成权重
本次公开的核心资产是 H3-Base 的两个特定任务检查点(Checkpoints),均支持本地运行 768p 分辨率的视频与立体声音频生成:
- H3-Base FL2VA (First-and-Last-Frame-to-Audio-Video):
- 输入控制:支持纯文本生成,或结合 0/1/2 张端点图片(首帧/尾帧)进行引导。
- 应用场景:适合需要精确控制视频起止画面的创意生成任务。
- H3-Base Ref2VA (Reference-to-Audio-Video):
- 输入控制:支持文本、参考图片、参考视频及可选音频的组合输入。
- 应用场景:适用于基于多模态参考素材的二次创作与风格迁移。
2. 架构细节:Omni Transformer
MiniMax 披露了 H3 的核心架构为 Omni Transformer,这是一个稠密单流(Dense, Single-Stream)模型,能够同时预测视频和音频的潜在表示(Latents)。
- 基座模型:文本编码器基于 Qwen3-VL-32B,具备强大的多模态理解能力。
- 组件构成:包含专门的多模态输入处理器、H3 专用 Tokenizer、视觉 VAE(用于视频潜变量)和独立的音频 VAE(用于立体声音频潜变量)。
- 精度规格:官方文档指出原始检查点采用 BF16 精度,并提供了 Diffusers 兼容的文件格式。
3. 未开源部分:托管系统与高清路径
为了构建完整的官方 H3 系统,以下关键组件目前仍由 MiniMax 托管,不可直接下载修改:
- Context-IR:负责多模态上下文的前处理与编排系统。开发者无法直接获取其源代码,但可通过官方 API 调用或自行设计预处理逻辑。
- Regenerate-2K:用于将本地生成的 768p 结果重绘为官方 2K 分辨率的模块。目前不在公开权重中,需通过官方混合工作流(Hybrid Workflow)调用托管服务。
对开发者的实际价值
尽管不是“完全开源”,H3-Base 的发布为开发者提供了宝贵的本地化实验能力:
- 本地化推理与微调:开发者可以部署 H3-Base 进行离线实验,探索不同提示词策略对音视频生成的影响,而无需依赖云端 API。
- 构建自定义管线:结合开源的 FL2VA 和 Ref2VA 权重,开发者可以构建属于自己的视频生成工作流,例如将 Context-IR 的预处理逻辑替换为自研方案,实现更灵活的输入控制。
- 技术复现与学习:Omni Transformer 的架构设计为研究多模态联合生成提供了新的参考,特别是其单流预测音视频潜变量的机制。
MiniMax 强调,当前的发布是“有意义的”,它允许社区在受控范围内探索技术边界,同时保留了核心系统架构的商业机密。对于希望深入理解多模态生成技术细节的开发者而言,这是一个兼具开放性与专业性的里程碑。
官方引言: "Public weights let developers inspect, run, modify, and integrate released model components under the license. They do not automatically provide the complete training process, every production module, or unrestricted usage rights."
关键指标 (Metrics)
- 版本状态:H3-Base FL2VA & Ref2VA 权重已公开
- 生成分辨率:本地支持 768p,官方路径支持 2K
- 输出模态:视频 + 立体声音频
- 基座模型:Qwen3-VL-32B 文本编码器
- 架构类型:Omni Transformer (稠密单流)
- 许可证:自定义社区许可证 (Custom Community License)