DomoAI 发布 Omni Reference:单生成支持 50 路多模态参考,重塑长视频创作边界
DomoAI 在近日推出了其最具野心的视频生成工具——Omni Reference。这一全新模块并非对现有功能的简单修补,而是基于字节跳动开源模型 Seedance 2.5 的深度集成,旨在解决当前 AI 视频创作中“角色崩坏”与“动作不连贯”的核心痛点。
突破单图局限:从“参考”到“指令”
传统的 AI 视频工具通常仅允许用户上传一张参考图或一段起止帧,这在长达 30 秒的视频生成中往往难以维持角色的面部特征与肢体动作的一致性。
Omni Reference 彻底改变了这一规则。它允许用户在一个生成任务中同时挂载多达 50 路 参考素材:
- 30 张图片:用于定义角色外观、场景细节。
- 10 段视频片段:用于捕捉特定的运动轨迹与动态效果。
- 10 段音频文件:用于精确控制口型同步与声音节奏。
更重要的是,系统不再被动接收素材,而是要求用户为每一路素材分配明确的“工作指令”。例如,你可以指定某张图片负责角色身份,某段视频负责行走动作,某段音频负责背景音乐节奏。这种结构化指令机制让模型能够精准理解并执行,大幅减少了猜测带来的误差。
核心技术规格与能力边界
Omni Reference 在性能与灵活性上进行了重新定义,具体技术指标如下:
- 生成时长:支持 4 至 30 秒 的视频生成,是现有 Seedance 2.0 版本(15 秒上限)的两倍。
- 分辨率:提供 480P 和 720P 两种选项。虽然牺牲了部分分辨率上限以换取更长的生成时长与更强的参考控制力,但对于中长视频叙事已足够清晰。
- 参考时长:单段视频/音频参考最长 30 秒,但所有参考素材的总时长合计不得超过 30 秒。
- 画面比例:支持自动识别及 3:4, 4:3, 9:16, 16:9, 1:1 等多种比例。
实际应用场景与生态价值
Omni Reference 的推出标志着 AI 视频创作从“短片段特效”向“长镜头叙事”的跨越,其适用场景极为广泛:
- 复杂角色一致性:创作者可上传多张不同角度的角色图,确保视频全程角色形象统一,无需频繁重绘。
- 商业广告与 Vlog:通过输入真实的口型音频和视频片段,可实现高保真的口型同步与动作复刻,极大降低商业制作成本。
- 音频驱动创作:用户甚至可以不依赖任何图像或视频,仅凭一段音频即可生成匹配的视频内容,拓展了声音艺术家的创作边界。
未来展望:MiniMax H3 即将加入
DomoAI 明确表示,Omni Reference 只是其视频创作平台的起点。未来,MiniMax H3 模型将接入同一平台,届时用户可根据具体需求——是需要超长时长的多参考序列,还是高分辨率的短平快输出——灵活切换模型,无需重新整理素材库。
目前,该功能已对 DomoAI 所有账号开放,新用户可获得 30 积分体验一次 480P 4 秒的生成。随着 MiniMax H3 的加入,Omni Reference 有望成为构建高质量长视频内容的核心引擎。