Google DeepMind 发布 Lyria 3.5:支持 184 秒长曲与 expressive 人声,重塑音乐生成工作流

ADK APIMart官方 / ADK编译 2024-11-01 5 分钟 86 次浏览
速览导读 / Summary

Google DeepMind 正式推出 Lyria 3.5,在 Google Flow Music 平台上线。此次更新核心突破在于将最大生成时长从 30 秒扩展至 184 秒(约 3 分 4 秒),并显著提升了人声的情感表达力、多语言发音清晰度及长曲结构连贯性。该版本专为广告、游戏配乐及教育场景设计,支持通过结构化提示词(如 [Verse]、[Chorus])和精确的时间戳控制歌曲编排,大幅降低长曲生成的试错成本。

最大生成时长 184 秒 从 30 秒扩展至 3 分 4 秒,支持完整歌曲结构
支持语言数量 8 种 涵盖英、德、西、法、印地、日、韩、葡语
结构控制精度 时间戳 + 段落标签 支持如 [0:50 - 1:10] Chorus 等精确指令

Key Insights / 核心看点

  • 1 支持生成长达 184 秒的完整歌曲,解决了长曲结构连贯性的核心难题。
  • 2 显著提升人声表现力,支持气声、沙哑等细腻情感动态,并优化了 8 种语言的发音清晰度。
  • 3 引入结构化提示词机制,通过段落标签和时间戳实现类似传统作曲的编排控制。
  • 4 专为广告、游戏和教育场景设计,大幅缩短从 Demo 到可发布成品的工作流时间。
  • 5 在复杂编曲中增强了人声与乐器的分离度,确保歌词在长曲中始终清晰可辨。

Google DeepMind 发布 Lyria 3.5:长曲生成与人声表现的双重突破

Google DeepMind 近日在 Google Flow Music 平台推出了其音乐生成模型 Lyria 3.5。与上一代仅适用于 30 秒短视频的 Lyria 3 Clip 不同,Lyria 3.5 旨在解决长曲生成中的核心痛点:人声的情感细腻度全曲结构的连贯性。此次更新标志着 AI 音乐生成从“片段创作”向“完整作品交付”的重要跨越。

核心突破:184 秒长曲与结构化控制

Lyria 3.5 最显著的技术指标是支持生成长达 184 秒(3 分 4 秒)的完整歌曲。这一突破并非简单的时长堆叠,而是涉及了模型对音乐结构的深层理解。

  • 结构化提示词支持:用户可通过 [Verse][Chorus][Bridge] 等标签,结合精确的时间戳(如 [0:50 - 1:10] Chorus)来引导模型生成。模型会在生成音频前进行结构规划,确保不同段落间的过渡自然,避免长曲中常见的节奏漂移或主题混乱。
  • 参数化控制:用户可在生成前设定 Tempo(速度)和 Key(调性),确保从钢琴独奏到弦乐合奏的编排中,核心旋律动机保持一致,实现真正的“一气呵成”。

人声质量跃升:从“机械”到“有表现力”

官方强调,Lyria 3.5 在人声表现力(Expressive Vocals)上进行了重大优化,使其更适用于需要清晰歌词和真实情感的场景。

  • 动态与情感:模型能够处理更细腻的人声动态,包括气声(breathy)、沙哑感(raspy)及轻和声。测试显示,人声在整首歌曲中的表现更加自然,不再出现生硬的“机器音”感。
  • 多语言发音优化:针对全球市场,模型针对 8 种语言(英语、德语、西班牙语、法语、印地语、日语、韩语、葡萄牙语)进行了发音调优。在复杂的编曲中,人声与乐器的分离度(Vocal Separation)得到提升,确保歌词清晰可辨。

应用场景与工作流变革

Lyria 3.5 的更新直接针对了广告、游戏和教育领域的实际工作流需求,解决了以往长曲生成需要大量后期修补的问题。

  • 广告与游戏:需要稳定的重复段落和清晰的 Hook,Lyria 3.5 能在一键生成中完成从 Demo 到可发布版本的全流程。
  • 教育内容:清晰的歌词发音和稳定的节奏对于教学素材至关重要。
  • 创作者效率:虽然目前不支持多轮编辑(Multi-turn editing),即单次生成不可修改,但通过重新运行提示词(Rerun the prompt)即可快速迭代,大幅缩短了从草稿到成品的时间。

关键指标对比

特性 Lyria 3 Clip Lyria 3.5 / Pro
最大时长 30 秒 184 秒 (3 分 4 秒)
结构控制 基础 (循环/预览) 高级 (段落标签 + 时间戳)
人声表现 基础 高 (情感动态、多语言清晰)
适用场景 社交媒体片段、UI 音效 完整歌曲、游戏配乐、广告

Google DeepMind 表示,Lyria 3.5 的核心价值在于回答一个简单的问题:“当我从短 Demo 转向可发布的长曲时,它能否真正节省时间?” 随着音乐生成技术的成熟,Lyria 3.5 正致力于让 AI 成为创作者手中可靠的长曲制作伙伴。

Lyria 3.5 looks most useful when I need clearer singing, better lyric delivery, and songs that hold together for up to 184 seconds.

Google DeepMind Model Insights

同主题深度资讯

查看更多 →
产品动态 2026-09-15

Topview 发布 Codex 插件工作流:在 ChatGPT 生态内实现 AI 视频生成

Topview 正式宣布其插件工作流集成至 OpenAI 的 Codex 代理系统,支持在本地桌面端或 CLI 中直接调用生成式模型创建 AI 视频。文章详细区分了 ChatGPT 网页版插件目录与 Codex 本地代理的架构差异,明确了安装路径、OAuth 认证流程及 Canvas 画布工作流。该更新旨在解决开发者在 ChatGPT 生态内调用视频生成模型(如 Seedance, Wan 3.0 等)的碎片化问题,强调 Pro 及以上订阅计划对自动化工作流的必要性。

Topview官方 / ADK编译 5 分钟
产品动态 2026-09-06

Adobe Photoshop 与 Upscale.media 联手:AI 驱动图像超分辨率技术深度解析

Adobe Photoshop 与 AI 图像增强工具 Upscale.media 宣布深度整合,旨在为专业用户提供更高效的图像超分辨率解决方案。此次合作利用先进的 AI 算法,在不依赖复杂软件学习曲线的情况下,实现从低分辨率到高清图像的无损转换。文章详细阐述了该技术在保留细节、修复模糊以及支持多格式处理方面的核心优势,并展示了从上传到下载的完整操作流程,标志着图像增强领域向更智能化、便捷化方向迈出了重要一步。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Adobe Photoshop 2025 图像分辨率优化指南:超分辨率与智能放大技巧

Adobe Photoshop 2025 在图像分辨率处理上带来了显著优化,重点介绍了如何利用内置的“超分辨率”功能无损放大 JPEG 图像。本文详细解析了从基础图像尺寸调整到高级 Camera Raw 滤镜应用的完整流程,帮助设计师和摄影师在保持画质的前提下提升输出质量。

Upscale.media官方 / ADK编译 4 分钟
产品动态 2026-09-06

Upscale.media 发布智能图像增强方案:AI 驱动高清修复与细节重构

Upscale.media 推出全新图像增强指南,详解如何利用 AI 技术将低分辨率图片转化为高清视觉内容。文章解析了图像上采(Upscaling)的核心原理,涵盖分辨率、锐度、色彩准确性等关键质量指标,并展示了该工具在商业展示、印刷输出及个人创作中的实际应用价值,旨在帮助用户摆脱像素化困扰,实现无损画质提升。

Upscale.media官方 / ADK编译 4 分钟
code · 免费
★ 5.0 · 120评测
A

APIMart

一站式 AI API 平台,多主流模型统一访问

APIMart是一站式 AI API 平台,提供对 500 多个主流 AI 模型的统一访问,涵盖聊天、视频生成、图像生成等多类 AI 能力。与 OpenAI 的 API 格式完全兼容,用户只需修改一行代码即可从 OpenAI 迁移到 APIMart,享受更低的成本和更高的性能。APIMart核心优势在于高性价比,相比竞品可节省 30% 至 70% 的成本,同时提供 99.9% 的高可用性。智能路由技术确保低延迟响应,支持超高并发,适合大规模应用场景。APIMart提供详细的用量分析和成本跟踪,帮助用户优化费用。

查看 APIMart 使用教程与功能