MiniMax H3 视频生成 V2 发布:Ref2VA 多模态参考引导新范式
MiniMax 在最新的技术更新中正式推出了其 H3 视频生成模型的 V2 版本,并重点发布了 Reference-to-Video (Ref2VA) 模式。这一更新标志着视频生成领域从简单的“图生视频”或“文生视频”,迈向了更精细化的“多模态参考引导”阶段。开发者可以通过图片、视频和音频等多种参考源,更精准地控制生成视频的外观、运动轨迹、镜头语言甚至声音特征。
核心突破:Ref2VA 与 FL2VA 的双模架构
H3 视频生成 V2 API 将参考模式分为两类,开发者需根据需求选择:
- FL2VA (First/Last Frame to Video):适用于需要严格锁定首帧或末帧的场景。例如,要求视频必须从一张特定的图片开始,或结束于另一张特定的图片。此模式将参考图片视为固定的“检查点”(Checkpoint)。
- Ref2VA (Reference-to-Video):适用于需要利用多源素材引导视频属性,但不作为固定端点的场景。在此模式下,开发者可以将图片、视频、音频分配不同的“工作角色”(Job)。
关键区别:官方明确指出,Ref2VA 与 FL2VA 在 API 请求中是互斥的。开发者不能在一个请求中同时混合使用“端点帧角色”和“参考媒体角色”。
多模态素材的“单一职责”原则
Ref2VA 的核心哲学是 “给每个参考源分配一个明确的单一任务”。官方文档建议,不同类型的素材应承担不同的职责:
- 图片 (Picture):负责定义外观、构图、空间布局或光照。它不应被期望承担运动或时间结构的责任。
- 视频 (Video):负责引导运动模式、运镜路径、剪辑节奏或时间结构。它不应被期望承担像素级复制或物理一致性。
- 音频 (Audio):负责定义音色、节奏、对话信号或音效特征。它不应被期望承担完美口型同步(Lip-sync)或作为唯一的本地输入。
推荐的工作流:素材任务清单
在编写提示词之前,开发者应使用官方提供的“参考任务清单”(Reference Job Sheet)进行规划:
- 明确角色:为每个上传的素材(如图片 1、视频 1)定义其 Primary Job(主要任务)和 Secondary Job(次要任务)。
- 冲突解决:当多个素材对同一属性有不同指示时(例如,图片 1 显示银色瓶盖,图片 2 显示黑色瓶盖),必须在提示词中明确优先级,指定哪个素材控制该属性。
- 保留与转移:明确哪些属性需要“保留”(Retain,如几何形状),哪些需要“转移”(Transfer,如环境色调),哪些需要“改变”(Change)。
技术规格与限制
MiniMax 为 Ref2VA 模式设定了严格的本地与 API 限制,以确保推理效率与质量:
- 图片限制:最多支持 9 张 参考图片。
- 视频限制:最多支持 3 段 参考视频,每段 2-15 秒,总时长不超过 15 秒。
- 音频限制:最多支持 3 段 参考音频,每段 2-15 秒,总时长不超过 15 秒。
- 总文件数:本地混合 Ref2VA 媒体文件总数不得超过 12 个。
- 音频规则:音频必须伴随图片或视频使用,不能单独作为输入。
- API 格式:参考图片支持 JPG, PNG, WEBP, HEIC 等格式;视频支持 MP4, MOV;音频支持 WAV, MP3。
开发者建议:从素材筛选到提示词规划
官方强调,高质量的生成结果始于高质量的素材筛选。在上传前,建议进行“五步过滤”:
- 权限检查:确保拥有素材的使用权或版权。
- 相关性:素材是否清晰展示了你想要引导的属性?
- 清晰度:主体、运动或声音事件是否易于识别?
- 兼容性:素材是否符合当前的 API 或本地推理限制?
- 优先级:当不同素材存在冲突时,你能明确指定谁说了算吗?
此外,官方还推荐在收集素材前进行 AI 故事板规划,将构图、动作和运镜决策在动画开始前分离开来,从而避免生成过程中的逻辑混乱。
MiniMax 的这一更新不仅丰富了 H3 模型的表达能力,更为复杂商业场景(如产品视频生成、角色一致性维护)提供了标准化的技术解决方案。