Gemini Omni Flash 发布:Google 推出首款支持对话式多轮编辑的视频模型

ADK happycapy官方 / ADK编译 2026-09-06 5 分钟 174 次浏览
速览导读 / Summary

Google DeepMind 正式发布 Gemini Omni Flash,作为其 Omni 模型家族的首个视频生成版本。该模型不仅支持 720p 视频与同步音频的一体化生成,更核心突破在于支持基于多轮对话的有状态视频编辑。开发者可通过 API 实现类似真人剪辑师的迭代工作流,显著降低社交内容制作与产品演示的门槛。

模型名称 Gemini Omni Flash Google DeepMind Omni 家族首个视频模型
输出分辨率 720p 支持 16:9、9:16、1:1 比例,时长 4-10 秒
编辑轮次上限 约 4 轮 超过此轮次可能出现角色一致性漂移
成本估算 约 $0.10/秒 显著低于 Veo 3.1 的 $0.40-$0.75/秒
API 状态 公开预览 模型字符串:gemini-omni-flash-preview

Key Insights / 核心看点

  • 1 支持基于多轮对话的有状态视频编辑,允许用户通过连续指令对视频进行增量修改,无需重新生成。
  • 2 原生集成同步音频生成能力,视频与声音在同一推理过程中完成,唇形同步精度极高。
  • 3 内置 AI Avatar 功能,支持通过人脸与语音样本生成高保真说话视频,适用于营销与本地化场景。
  • 4 相比竞品 Veo 3.1 成本更低(约 $0.10/秒),且具备独特的对话式交互体验,适合社交内容快速迭代。

Gemini Omni Flash:Google 重新定义视频生成的交互范式

2026 年 7 月,Google DeepMind 正式推出了 Gemini Omni Flash,这是其 Omni 模型家族中首个面向视频生成的“任意到任意”(any-to-any)多模态模型。与 OpenAI 将“Omni”定义为单一模型内的多模态感知不同,Google 的 Omni 架构旨在通过统一表示空间,原生处理任意输入模态(文本、图像、音频等)并生成任意输出模态。

Gemini Omni Flash 的核心杀手锏并非单纯的画质提升,而是其跨多轮对话的有状态视频编辑能力。它打破了传统视频生成工具“一次提示词对应一段片段”的线性模式,允许开发者通过连续对话对视频进行增量修改,仿佛在与一位智能剪辑师协作。

核心突破:对话式多轮编辑

Gemini Omni Flash 通过引入 previous_interaction_id 参数,实现了上下文感知的多轮交互。用户无需重新生成整个片段,只需下达修改指令(如更换场景、调整服装、改变镜头角度),模型即可在保留原有内容的基础上进行迭代。

  • 工作流示例:先生成一段咖啡馆场景,随后通过对话将其移至屋顶露台、拉远镜头并添加环境音,每一轮指令都基于上一轮的结果进行微调。
  • 编辑上限:目前模型能可靠保持约 4 轮的连贯性,第 5 轮后可能出现角色一致性漂移。建议策略为:先用 Veo 3.1 或 Seedance 2.0 生成高保真基础片段,再用 Omni Flash 进行精修。

差异化优势:同步音频与 AI Avatar

除了编辑能力,Gemini Omni Flash 在音频与角色生成上也具备独特优势:

  1. 原生同步音频:模型在推理过程中即生成同步音频,而非后期拼接。基于物理建模的声音模拟能精准匹配唇形与环境音,适用于 4-10 秒的片段。
  2. AI Avatar 功能:支持通过人脸参考图与语音样本生成照片级真实感的说话视频。该功能已获 Adobe Firefly 等企业采用,但严格遵循内容政策,禁止深度伪造及未经授权的肖像使用,并带有 SynthID 水印。

技术规格与竞品对比

特性 Gemini Omni Flash Veo 3.1 Seedance 2.0
分辨率 720p 最高 4K 最高 1080p
多轮编辑 支持 (有状态) 不支持 不支持
同步音频 支持 支持 不支持
AI Avatar 支持 不支持 不支持
成本 (约) $0.10/秒 $0.40-$0.75/秒 可变

尽管在动作物理效果上略逊于 Seedance 2.0,且分辨率上限为 720p,但 Omni Flash 在编辑灵活性与成本效率上(约为 Veo 的 1/4)展现出巨大潜力,特别适合短视频创作与快速原型设计。

开发者接入

Gemini Omni Flash 目前可通过 Gemini API(模型字符串:gemini-omni-flash-preview)及 Google AI Studio 调用。对于希望快速体验且无需配置 Google Cloud IAM 的开发者,Happycapy 提供了便捷的集成方案,支持与其他 150 多个模型进行对比测试。

“Gemini Omni Flash 的设计理念是:编辑视频应该感觉像是在和一位协作者对话,而不是每次想改动就重新提交一张工单。” —— Google DeepMind 团队

随着 Omni Pro 版本的规划,未来该架构有望支持更高分辨率与更长时长的生成,进一步重塑视频内容生产的工作流。

编辑视频应该感觉像是在和一位协作者对话,而不是每次想改动就重新提交一张工单。

Google DeepMind 团队

同主题深度资讯

查看更多 →
AI 工具 2026-09-07

WatermarkRemover 发布全新 AI 去水印工具:一键清除多水印,保留原图画质

WatermarkRemover 正式推出基于先进 AI 技术的免费图像去水印解决方案。该工具通过自动检测与智能修复技术,支持批量移除多色水印,同时保留图像原始质量。无需专业修图技能,用户即可在数秒内完成去水印操作,并支持批量处理,极大提升了内容创作者与商业用户的效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 发布:AI 驱动的高效去水印工具,重塑图像版权与分享体验

WatermarkRemover 推出全新 AI 驱动的去水印解决方案,旨在解决传统裁剪法无法保留原图质量及水印影响专业度的痛点。该工具无需安装,支持一键上传与自动检测,承诺在去除水印的同时完美保留图像分辨率与细节。文章强调,去除水印不仅是技术操作,更是保护摄影师声誉、提升社交媒体互动率及避免版权纠纷的关键策略。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 2025 版上线:AI 驱动一键去除 TikTok 水印,助力创作者跨平台分发

WatermarkRemover 于 2025 年推出全新 TikTok 水印去除功能,利用先进的 AI 图像修复与视频处理技术,帮助用户轻松移除嵌入的视频水印。该工具支持直接粘贴 URL 即可一键处理,解决了创作者在 Instagram Reels 等平台上分发内容时的合规与美观难题。核心亮点包括智能背景重构、无损画质保留及极速处理速度,显著提升了内容再创作效率。

WatermarkRemover官方 / ADK编译 3 分钟
AI 工具 2026-09-07

WatermarkRemover 上线:AI 驱动一键清除截图水印,重塑图像纯净度

WatermarkRemover 正式推出全新 AI 驱动的水印移除功能,专为处理截图与照片设计。通过先进的图像分析与内容重构算法,用户无需专业修图技能即可一键清除复杂水印。该工具主打免费、高效与高保真输出,显著降低了图像去水印的技术门槛,为内容创作者与开发者提供了便捷的图像净化方案。

WatermarkRemover官方 / ADK编译 3 分钟
agent · 免费+付费
★ 5.0 · 120评测
h

happycapy

Trickle 团队推出的云端 AI Agent 计算机

happycapy 是Trickle团队推出的基于Claude Code云端AI Agent原生计算机。happycapy 提供浏览器端的可视化桌面环境,让用户无需配置即可运行Claude Code和OpenClaw替代方案。happycapy 提供18万+Skill技能商店、Capy Mail邮件指令交互、自动化定时任务等功能。主打”让AI适应人而非人适应AI”,将命令行工具转化为直观的WYSIWYG图形界面,让普通用户通过对话能完成编程、写作、数据分析等复杂任务,真正实现开箱即用的AI生产力工具。

查看 happycapy 使用教程与功能