Gemini Omni Flash:Google 重新定义视频生成的交互范式
2026 年 7 月,Google DeepMind 正式推出了 Gemini Omni Flash,这是其 Omni 模型家族中首个面向视频生成的“任意到任意”(any-to-any)多模态模型。与 OpenAI 将“Omni”定义为单一模型内的多模态感知不同,Google 的 Omni 架构旨在通过统一表示空间,原生处理任意输入模态(文本、图像、音频等)并生成任意输出模态。
Gemini Omni Flash 的核心杀手锏并非单纯的画质提升,而是其跨多轮对话的有状态视频编辑能力。它打破了传统视频生成工具“一次提示词对应一段片段”的线性模式,允许开发者通过连续对话对视频进行增量修改,仿佛在与一位智能剪辑师协作。
核心突破:对话式多轮编辑
Gemini Omni Flash 通过引入 previous_interaction_id 参数,实现了上下文感知的多轮交互。用户无需重新生成整个片段,只需下达修改指令(如更换场景、调整服装、改变镜头角度),模型即可在保留原有内容的基础上进行迭代。
- 工作流示例:先生成一段咖啡馆场景,随后通过对话将其移至屋顶露台、拉远镜头并添加环境音,每一轮指令都基于上一轮的结果进行微调。
- 编辑上限:目前模型能可靠保持约 4 轮的连贯性,第 5 轮后可能出现角色一致性漂移。建议策略为:先用 Veo 3.1 或 Seedance 2.0 生成高保真基础片段,再用 Omni Flash 进行精修。
差异化优势:同步音频与 AI Avatar
除了编辑能力,Gemini Omni Flash 在音频与角色生成上也具备独特优势:
- 原生同步音频:模型在推理过程中即生成同步音频,而非后期拼接。基于物理建模的声音模拟能精准匹配唇形与环境音,适用于 4-10 秒的片段。
- AI Avatar 功能:支持通过人脸参考图与语音样本生成照片级真实感的说话视频。该功能已获 Adobe Firefly 等企业采用,但严格遵循内容政策,禁止深度伪造及未经授权的肖像使用,并带有 SynthID 水印。
技术规格与竞品对比
| 特性 | Gemini Omni Flash | Veo 3.1 | Seedance 2.0 |
|---|---|---|---|
| 分辨率 | 720p | 最高 4K | 最高 1080p |
| 多轮编辑 | 支持 (有状态) | 不支持 | 不支持 |
| 同步音频 | 支持 | 支持 | 不支持 |
| AI Avatar | 支持 | 不支持 | 不支持 |
| 成本 (约) | $0.10/秒 | $0.40-$0.75/秒 | 可变 |
尽管在动作物理效果上略逊于 Seedance 2.0,且分辨率上限为 720p,但 Omni Flash 在编辑灵活性与成本效率上(约为 Veo 的 1/4)展现出巨大潜力,特别适合短视频创作与快速原型设计。
开发者接入
Gemini Omni Flash 目前可通过 Gemini API(模型字符串:gemini-omni-flash-preview)及 Google AI Studio 调用。对于希望快速体验且无需配置 Google Cloud IAM 的开发者,Happycapy 提供了便捷的集成方案,支持与其他 150 多个模型进行对比测试。
“Gemini Omni Flash 的设计理念是:编辑视频应该感觉像是在和一位协作者对话,而不是每次想改动就重新提交一张工单。” —— Google DeepMind 团队
随着 Omni Pro 版本的规划,未来该架构有望支持更高分辨率与更长时长的生成,进一步重塑视频内容生产的工作流。