MiniMax H3 视频生成 V2 发布:Ref2VA 多模态参考引导新范式

ADK DomoAI官方 / ADK编译 2024-11-01 5 分钟 96 次浏览
速览导读 / Summary

MiniMax 正式推出 H3 视频生成 V2 API,核心亮点为引入 Ref2VA(Reference-to-Video)模式,支持通过图片、视频、音频等多模态素材精准引导视频生成的外观、运动及声音。该模式强调“单一职责”原则,将素材角色化(如图片定构图、视频定运镜、音频定音色),解决了多源素材冲突问题。官方明确了 API 调用限制与最佳实践,为开发者提供了从素材筛选到提示词规划的完整工作流。

参考图片上限 9 张 Ref2VA 模式单次请求最大支持图片数量
参考视频上限 3 段 每段时长 2-15 秒,总时长不超过 15 秒
参考音频上限 3 段 每段时长 2-15 秒,总时长不超过 15 秒
总媒体文件限制 12 个 本地混合 Ref2VA 媒体文件总数上限

Key Insights / 核心看点

  • 1 推出 Ref2VA 模式,支持图片、视频、音频多模态素材的精细化引导,区分外观、运动与声音角色。
  • 2 明确 FL2VA 与 Ref2VA 的互斥性,API 请求中不可混合使用端点帧角色与参考媒体角色。
  • 3 引入‘单一职责’原则与‘参考任务清单’,帮助开发者规划素材优先级并解决多源冲突。
  • 4 设定严格的 API 限制(如最多 9 张图片、3 段视频),并明确了音频必须伴随视频/图片使用的规则。

MiniMax H3 视频生成 V2 发布:Ref2VA 多模态参考引导新范式

MiniMax 在最新的技术更新中正式推出了其 H3 视频生成模型的 V2 版本,并重点发布了 Reference-to-Video (Ref2VA) 模式。这一更新标志着视频生成领域从简单的“图生视频”或“文生视频”,迈向了更精细化的“多模态参考引导”阶段。开发者可以通过图片、视频和音频等多种参考源,更精准地控制生成视频的外观、运动轨迹、镜头语言甚至声音特征。

核心突破:Ref2VA 与 FL2VA 的双模架构

H3 视频生成 V2 API 将参考模式分为两类,开发者需根据需求选择:

  • FL2VA (First/Last Frame to Video):适用于需要严格锁定首帧或末帧的场景。例如,要求视频必须从一张特定的图片开始,或结束于另一张特定的图片。此模式将参考图片视为固定的“检查点”(Checkpoint)。
  • Ref2VA (Reference-to-Video):适用于需要利用多源素材引导视频属性,但不作为固定端点的场景。在此模式下,开发者可以将图片、视频、音频分配不同的“工作角色”(Job)。

关键区别:官方明确指出,Ref2VA 与 FL2VA 在 API 请求中是互斥的。开发者不能在一个请求中同时混合使用“端点帧角色”和“参考媒体角色”。

多模态素材的“单一职责”原则

Ref2VA 的核心哲学是 “给每个参考源分配一个明确的单一任务”。官方文档建议,不同类型的素材应承担不同的职责:

  • 图片 (Picture):负责定义外观、构图、空间布局或光照。它不应被期望承担运动或时间结构的责任。
  • 视频 (Video):负责引导运动模式、运镜路径、剪辑节奏或时间结构。它不应被期望承担像素级复制或物理一致性。
  • 音频 (Audio):负责定义音色、节奏、对话信号或音效特征。它不应被期望承担完美口型同步(Lip-sync)或作为唯一的本地输入。

推荐的工作流:素材任务清单

在编写提示词之前,开发者应使用官方提供的“参考任务清单”(Reference Job Sheet)进行规划:

  1. 明确角色:为每个上传的素材(如图片 1、视频 1)定义其 Primary Job(主要任务)和 Secondary Job(次要任务)。
  2. 冲突解决:当多个素材对同一属性有不同指示时(例如,图片 1 显示银色瓶盖,图片 2 显示黑色瓶盖),必须在提示词中明确优先级,指定哪个素材控制该属性。
  3. 保留与转移:明确哪些属性需要“保留”(Retain,如几何形状),哪些需要“转移”(Transfer,如环境色调),哪些需要“改变”(Change)。

技术规格与限制

MiniMax 为 Ref2VA 模式设定了严格的本地与 API 限制,以确保推理效率与质量:

  • 图片限制:最多支持 9 张 参考图片。
  • 视频限制:最多支持 3 段 参考视频,每段 2-15 秒,总时长不超过 15 秒。
  • 音频限制:最多支持 3 段 参考音频,每段 2-15 秒,总时长不超过 15 秒。
  • 总文件数:本地混合 Ref2VA 媒体文件总数不得超过 12 个。
  • 音频规则:音频必须伴随图片或视频使用,不能单独作为输入。
  • API 格式:参考图片支持 JPG, PNG, WEBP, HEIC 等格式;视频支持 MP4, MOV;音频支持 WAV, MP3。

开发者建议:从素材筛选到提示词规划

官方强调,高质量的生成结果始于高质量的素材筛选。在上传前,建议进行“五步过滤”:

  1. 权限检查:确保拥有素材的使用权或版权。
  2. 相关性:素材是否清晰展示了你想要引导的属性?
  3. 清晰度:主体、运动或声音事件是否易于识别?
  4. 兼容性:素材是否符合当前的 API 或本地推理限制?
  5. 优先级:当不同素材存在冲突时,你能明确指定谁说了算吗?

此外,官方还推荐在收集素材前进行 AI 故事板规划,将构图、动作和运镜决策在动画开始前分离开来,从而避免生成过程中的逻辑混乱。

MiniMax 的这一更新不仅丰富了 H3 模型的表达能力,更为复杂商业场景(如产品视频生成、角色一致性维护)提供了标准化的技术解决方案。

“Give Every Reference One Clear Primary Job. It is a planning method, not a technical one-asset limit.”

— MiniMax H3 Official Documentation

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
video · 付费
★ 5.0 · 120评测
D

DomoAI

一站式AI视频与动画创作平台

DomoAI是映刻科技推出的一站式的AI 视频与动画创作平台,国际版名为DomoAI,国内版为滴墨AI(大画家Domo)。DomoAI支持将文本、图像或视频快速转化为高质量的动漫、写实或艺术视觉内容。平台支持多种功能,如视频转视频、图像转视频、文本转视频等。DomoAI 操作直观,无需复杂软件能产出专业级作品,适合内容创作者、品牌团队等多类用户,助力高效创作,让创意轻松落地,赋能每个人的创意旅程。

查看 DomoAI 使用教程与功能