献丑 AI 接入 MiniMax H3:原生多模态视频模型赋能文图音视频统一创作
更新背景
随着 AIGC 视频生成技术从单一图像动画向复杂视听叙事演进,创作者面临着多模态素材(文本、图片、视频、音频)理解割裂的痛点。MiniMax 推出的 H3 模型作为开放通用的多模态视频模型,旨在解决这一难题。献丑 AI 此次重磅接入 MiniMax H3,标志着其视频创作能力从“静态图动效”正式迈向“全链路视听创作系统”,让品牌大片、短剧、电商素材及 UI 动效等多元场景在同一个画布中无缝流转。
核心突破:原生多模态理解与生成
MiniMax H3 的核心价值在于其原生多模态理解能力。它不再局限于传统的“文生视频”或简单的“首帧图生视频”,而是能够同时解析文本指令、参考图片、参考视频片段甚至音频信号。
- 统一创作上下文:H3 能将人物设定、动作逻辑、声音情绪、镜头调度及叙事意图融合在一次生成中。这意味着创作者无需在不同工具间切换,只需在一个 Prompt 里整合所有参考素材,即可生成符合特定气质与节奏的视频。
- 三大核心能力:
- 复杂素材理解:支持将角色、产品、Logo 及氛围参考图统一输入,确保生成内容“长得像、动得对”。
- 精准编辑与控制:通过明确的指令遵循能力,允许用户指定多张参考图(如人物资产、包袋细节、Ending Logo),实现高保真的参考创作。
- 商用级场景覆盖:从影视级品牌大片到竖屏短剧预告,再到电商广告与 UI/UX 动效演示,H3 提供了一站式解决方案。
关键功能特性
献丑 AI 已将 H3 深度集成至画布工作流,支持以下三种主要生成模式:
1. 文生视频 (Text-to-Video)
适合从零创意的阶段。用户仅需输入包含运镜指令的 Prompt,即可生成全新镜头。
- 示例:"镜头拍摄一位女性坐在咖啡馆里,抬头看向窗外,镜头缓缓移到窗外街道;暖色调,氛围轻松惬意,轻微推轨。"
2. 首帧/尾帧图生视频 (Image-to-Video with Start/End Frames)
利用首尾帧锁定画面,生成自然过渡的动态效果,适用于产品图动效或人物变装叙事。
- 示例:上传首尾帧人物图,配合提示词 "A little girl grows up."
3. 全能参考生成 (Full Reference Generation)
最强模式。支持最多 9 张参考图、3 段参考视频及音频输入,严格约束角色、动作与风格。
- 优势:可组合参考视频与音频,精准控制剪辑节奏与情绪基调。
技术参数与应用价值
- 输出规格:支持 768p / 2K 分辨率,时长 5~15 秒(整数秒),兼容多种宽高比(21:9, 16:9, 9:16 等)。
- 输入限制:提示词上限 7000 字符;参考图最多 9 张;参考视频总时长不超过 15 秒。
- 实际价值:对于开发者而言,这意味着无需维护多套工具链即可服务不同交付物;对于创作者,则意味着在献丑画布中即可直接试制高质量成片,极大提升了从创意到落地的效率。
"好模型不该只停在文档页——它应该出现在你的下一条成片里。" —— 献丑 AI 团队
典型场景提示词策略
- 品牌大片:分离氛围、人物、产品、Logo 参考,明确故事节拍与气质(如“高级、冷感”)。
- 竖屏短剧:固定 9:16 比例,利用参考图锁定男女主,强调眼神与对峙的张力。
- 电商广告:使用极简棚拍约束环境,保持模特面部细节与产品材质的一致性。
- UI 动效:指明产品主视觉,要求模型理解“界面在动”而非“拍摄真人”。
献丑 AI 现已支持 MiniMax H3,用户可立即在画布中开启新的视频创作之旅。