MiniMax 发布 H3 开源权重:FL2VA 与 Ref2VA 本地生成能力详解

ADK DomoAI官方 / ADK编译 2024-11-01 5 分钟 33 次浏览
速览导读 / Summary

MiniMax 正式开源 H3 模型的核心生成权重,包括支持文本及首尾帧控制的 FL2VA 和参考视频生成的 Ref2VA。此次发布明确了“开源权重”与“完全开源”的区别,公开了基于 Qwen3-VL-32B 的 Omni Transformer 架构及 768p 音视频生成能力,但 Context-IR 预处理系统与 Regenerate-2K 高清重绘模块仍由官方托管。开发者可借此构建本地化多模态生成管线。

开源组件 H3-Base FL2VA & Ref2VA 核心生成权重已公开,支持本地推理
生成分辨率 768p (本地) / 2K (官方) 本地仅支持 768p,2K 需调用托管服务
基座模型 Qwen3-VL-32B 用于多模态上下文理解
架构类型 Omni Transformer 稠密单流模型,联合预测音视频

Key Insights / 核心看点

  • 1 MiniMax 正式开源 H3 模型的核心生成权重,包括 FL2VA 和 Ref2VA 两个检查点,支持本地 768p 音视频生成。
  • 2 明确了'开源权重'与'完全开源'的区别,Context-IR 预处理系统与 Regenerate-2K 高清重绘模块仍由官方托管。
  • 3 披露了基于 Qwen3-VL-32B 的 Omni Transformer 架构,采用稠密单流设计同时预测视频和音频潜变量。
  • 4 开发者可利用开源权重构建本地化多模态生成管线,但无法直接复现完整的官方 2K 端到端流程。

MiniMax 发布 H3 开源权重:FL2VA 与 Ref2VA 本地生成能力详解

MiniMax 在 2026 年 7 月 31 日推出 H3 系统,并于 8 月 2 日率先公开了核心生成部分的权重文件。此次发布在 AI 开源社区引发了广泛关注,因为它清晰地界定了“开源权重”(Open Weights)与“完全开源”(Fully Open Source)之间的关键界限。

核心突破:开源的边界与能力

MiniMax 明确表示,H3 并非完全开源。虽然核心生成模块的权重已公开,但系统的完整训练流程、部分生产级模块及数据并未完全披露。这种策略旨在平衡社区创新与商业保护。

1. 开源部分:H3-Base 生成权重

本次公开的核心资产是 H3-Base 的两个特定任务检查点(Checkpoints),均支持本地运行 768p 分辨率的视频与立体声音频生成:

  • H3-Base FL2VA (First-and-Last-Frame-to-Audio-Video):
    • 输入控制:支持纯文本生成,或结合 0/1/2 张端点图片(首帧/尾帧)进行引导。
    • 应用场景:适合需要精确控制视频起止画面的创意生成任务。
  • H3-Base Ref2VA (Reference-to-Audio-Video):
    • 输入控制:支持文本、参考图片、参考视频及可选音频的组合输入。
    • 应用场景:适用于基于多模态参考素材的二次创作与风格迁移。

2. 架构细节:Omni Transformer

MiniMax 披露了 H3 的核心架构为 Omni Transformer,这是一个稠密单流(Dense, Single-Stream)模型,能够同时预测视频和音频的潜在表示(Latents)。

  • 基座模型:文本编码器基于 Qwen3-VL-32B,具备强大的多模态理解能力。
  • 组件构成:包含专门的多模态输入处理器、H3 专用 Tokenizer、视觉 VAE(用于视频潜变量)和独立的音频 VAE(用于立体声音频潜变量)。
  • 精度规格:官方文档指出原始检查点采用 BF16 精度,并提供了 Diffusers 兼容的文件格式。

3. 未开源部分:托管系统与高清路径

为了构建完整的官方 H3 系统,以下关键组件目前仍由 MiniMax 托管,不可直接下载修改:

  • Context-IR:负责多模态上下文的前处理与编排系统。开发者无法直接获取其源代码,但可通过官方 API 调用或自行设计预处理逻辑。
  • Regenerate-2K:用于将本地生成的 768p 结果重绘为官方 2K 分辨率的模块。目前不在公开权重中,需通过官方混合工作流(Hybrid Workflow)调用托管服务。

对开发者的实际价值

尽管不是“完全开源”,H3-Base 的发布为开发者提供了宝贵的本地化实验能力:

  1. 本地化推理与微调:开发者可以部署 H3-Base 进行离线实验,探索不同提示词策略对音视频生成的影响,而无需依赖云端 API。
  2. 构建自定义管线:结合开源的 FL2VA 和 Ref2VA 权重,开发者可以构建属于自己的视频生成工作流,例如将 Context-IR 的预处理逻辑替换为自研方案,实现更灵活的输入控制。
  3. 技术复现与学习:Omni Transformer 的架构设计为研究多模态联合生成提供了新的参考,特别是其单流预测音视频潜变量的机制。

MiniMax 强调,当前的发布是“有意义的”,它允许社区在受控范围内探索技术边界,同时保留了核心系统架构的商业机密。对于希望深入理解多模态生成技术细节的开发者而言,这是一个兼具开放性与专业性的里程碑。

官方引言: "Public weights let developers inspect, run, modify, and integrate released model components under the license. They do not automatically provide the complete training process, every production module, or unrestricted usage rights."


关键指标 (Metrics)

  • 版本状态:H3-Base FL2VA & Ref2VA 权重已公开
  • 生成分辨率:本地支持 768p,官方路径支持 2K
  • 输出模态:视频 + 立体声音频
  • 基座模型:Qwen3-VL-32B 文本编码器
  • 架构类型:Omni Transformer (稠密单流)
  • 许可证:自定义社区许可证 (Custom Community License)

“Public weights let developers inspect, run, modify, and integrate released model components under the license. They do not automatically provide the complete training process, every production module, or unrestricted usage rights.”

— MiniMax 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
video · 付费
★ 5.0 · 120评测
D

DomoAI

一站式AI视频与动画创作平台

DomoAI是映刻科技推出的一站式的AI 视频与动画创作平台,国际版名为DomoAI,国内版为滴墨AI(大画家Domo)。DomoAI支持将文本、图像或视频快速转化为高质量的动漫、写实或艺术视觉内容。平台支持多种功能,如视频转视频、图像转视频、文本转视频等。DomoAI 操作直观,无需复杂软件能产出专业级作品,适合内容创作者、品牌团队等多类用户,助力高效创作,让创意轻松落地,赋能每个人的创意旅程。

查看 DomoAI 使用教程与功能