Gemini 3.8 Flash TTS 发布:Google 旗舰语音模型与 Pexo 视频智能体深度整合

ADK Pexo官方 / ADK编译 2026-10-07 5 分钟 106 次浏览
速览导读 / Summary

Google 正式发布 Gemini 3.8 Flash TTS,作为其旗舰级创意文本转语音模型,支持 130 种语言、2000+ 现成音色及 30 秒语音克隆,在 Hume AI 盲测中得分 71.4。Pexo 作为 AI 视频智能体,无需 API Key 即可将 Gemini 3.8 Flash TTS 生成的专业级人声无缝嵌入视频,提供包含旁白、配乐与音效的完整三层音轨,解决了开发者与创作者在音频素材整合上的痛点。

Hume AI 语音设计基准分 71.4 盲测中表现优异
支持语言数量 130 覆盖全球主要语言
现成语音模型 2000+ 大幅扩充音色库
语音克隆样本 30 秒 仅需短样本即可克隆

Key Insights / 核心看点

  • 1 Gemini 3.8 Flash TTS 在 Hume AI 盲测中得分 71.4,支持 130 种语言与 2000+ 现成音色,提供工作室级语音质量。
  • 2 Pexo 智能体无需 API Key 即可将 Gemini 3.8 Flash TTS 生成的旁白无缝嵌入视频,自动处理配乐与音效。
  • 3 支持 30 秒语音克隆与内联语音事件控制(如笑声、叹息),并集成至 Claude Code、Cursor 等主流开发工具。

Gemini 3.8 Flash TTS 发布:Google 旗舰语音模型与 Pexo 视频智能体深度整合

2026 年 9 月 23 日,Google 正式推出了其旗舰级创意文本转语音(Text-to-Speech, TTS)模型——Gemini 3.8 Flash TTS。该模型旨在提供工作室级别的语音保真度、富有表现力的演绎能力以及稳定的长篇幅旁白支持。与此同时,AI 视频智能体 Pexo 宣布深度整合此模型,为创作者提供了一种无需 API Key 即可生成高质量视频旁白的全新工作流。

核心突破:从 API 到成品视频的跨越

Gemini 3.8 Flash TTS 本身是一个强大的 API 产品,但它并非唯一的使用路径。Google 与 Pexo 的联合发布,实际上构建了三种针对不同需求的解决方案:

  1. API 直连(开发者路径):开发者直接调用 Gemini API,获取原始 WAV 文件,自行处理脚本、配乐与剪辑。适合需要高度定制音频流的应用。
  2. 智能体编排(Pexo 路径):Pexo 作为一个 AI 视频智能体,接受自然语言描述或脚本,自动调用 Gemini 3.8 Flash TTS 生成旁白,并结合 Seedance 2.0、Kling 3.0 等视频引擎生成画面,最终输出包含旁白、背景音乐与 Foley 音效的完整视频片段。这是 Pexo 的核心护城河,它将语音作为视频输出的一个完整层级,而非独立文件。
  3. 专用引擎(ElevenLabs 路径):对于仅需大规模独立旁白文件的团队,ElevenLabs 等专用 TTS 引擎仍是更优选择。

关键技术指标与能力

Gemini 3.8 Flash TTS 在技术指标上实现了显著跃升,特别是在人类偏好测试中表现优异:

  • Hume AI 盲测成绩:在 Hume AI 的总体质量指数盲测中,Gemini 3.8 Flash TTS 与 Flash-Lite 分别位列第一和第二,Flash TTS 在语音设计基准测试中得分高达 71.4。
  • 语言与音色支持:支持 130 种语言,内置 2000+ 现成语音模型(此前仅为 30 个固定音色),并支持基于 30 秒样本的语音克隆。
  • 输出格式:默认输出 WAV 格式,同时支持 L16、mu-law、A-law 等格式,并附带 SynthID 水印及 C2PA 认证。
  • 交互控制:支持通过 speech_metadata.style 字段控制交付风格,允许插入 <laugh>、<sigh> 等内联语音事件,甚至支持使用国际音标(IPA)标签纠正发音。

开发者与创作者的实际价值

对于 Pexo 用户而言,最大的价值在于工作流的自动化与去门槛化:

  • 无需 API Key:创作者只需描述视频内容或提供 URL,Pexo 即可自动完成旁白生成与视频剪辑,无需配置复杂的 API 密钥。
  • 全栈音频设计:Pexo 不仅生成旁白,还自动匹配背景音乐与音效,输出 16:9、9:16 或 1:1 等多种比例的视频,直接作为可安装的技能集成到 Claude Code、Cursor 等开发工具中。
  • 成本与性能平衡:Gemini 3.8 Flash TTS 提供两种计费模式。Flash 版本($9.00/M tokens)主打高质量叙事与角色演绎;Flash-Lite 版本($6.00/M tokens)则专注于去重、朗读代理等对延迟和成本敏感的场景。

总结

Gemini 3.8 Flash TTS 的发布标志着 Google 在语音合成领域的进一步成熟,而 Pexo 的整合则展示了如何将顶级模型能力转化为即用的生产力工具。对于需要高质量音频内容的创作者,这提供了一个从“脚本”到“成品视频”的一站式解决方案。

"There is no single best way to reach this class of voice: it depends on what you are building." —— Google 官方团队

“There is no single best way to reach this class of voice: it depends on what you are building.”

— Google 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
video · 免费+付费
★ 5.0 · 120评测
P

Pexo

AI 视频创作Agent,个人 AI 视频伙伴

Pexo 是AI 视频创作Agent,个人专属的 AI 视频伙伴。用户无需写复杂提示词,AI能自动完成脚本、分镜、配音、剪辑全流程,交付可直接发布的完整视频。Pexo 支持图生视频、文生视频、虚拟人等功能,单次最长生成2分钟。Pexo已接入OpenClaw,支持在飞书/钉钉里调用,适合制作产品广告、UGC种草、品牌宣传片、动漫短剧、音乐MV等内容。

查看 Pexo 使用教程与功能