Google DeepMind 发布 Lyria 3.5:长曲生成与人声表现的双重突破
Google DeepMind 近日在 Google Flow Music 平台推出了其音乐生成模型 Lyria 3.5。与上一代仅适用于 30 秒短视频的 Lyria 3 Clip 不同,Lyria 3.5 旨在解决长曲生成中的核心痛点:人声的情感细腻度与全曲结构的连贯性。此次更新标志着 AI 音乐生成从“片段创作”向“完整作品交付”的重要跨越。
核心突破:184 秒长曲与结构化控制
Lyria 3.5 最显著的技术指标是支持生成长达 184 秒(3 分 4 秒)的完整歌曲。这一突破并非简单的时长堆叠,而是涉及了模型对音乐结构的深层理解。
- 结构化提示词支持:用户可通过
[Verse]、[Chorus]、[Bridge]等标签,结合精确的时间戳(如[0:50 - 1:10] Chorus)来引导模型生成。模型会在生成音频前进行结构规划,确保不同段落间的过渡自然,避免长曲中常见的节奏漂移或主题混乱。 - 参数化控制:用户可在生成前设定 Tempo(速度)和 Key(调性),确保从钢琴独奏到弦乐合奏的编排中,核心旋律动机保持一致,实现真正的“一气呵成”。
人声质量跃升:从“机械”到“有表现力”
官方强调,Lyria 3.5 在人声表现力(Expressive Vocals)上进行了重大优化,使其更适用于需要清晰歌词和真实情感的场景。
- 动态与情感:模型能够处理更细腻的人声动态,包括气声(breathy)、沙哑感(raspy)及轻和声。测试显示,人声在整首歌曲中的表现更加自然,不再出现生硬的“机器音”感。
- 多语言发音优化:针对全球市场,模型针对 8 种语言(英语、德语、西班牙语、法语、印地语、日语、韩语、葡萄牙语)进行了发音调优。在复杂的编曲中,人声与乐器的分离度(Vocal Separation)得到提升,确保歌词清晰可辨。
应用场景与工作流变革
Lyria 3.5 的更新直接针对了广告、游戏和教育领域的实际工作流需求,解决了以往长曲生成需要大量后期修补的问题。
- 广告与游戏:需要稳定的重复段落和清晰的 Hook,Lyria 3.5 能在一键生成中完成从 Demo 到可发布版本的全流程。
- 教育内容:清晰的歌词发音和稳定的节奏对于教学素材至关重要。
- 创作者效率:虽然目前不支持多轮编辑(Multi-turn editing),即单次生成不可修改,但通过重新运行提示词(Rerun the prompt)即可快速迭代,大幅缩短了从草稿到成品的时间。
关键指标对比
| 特性 | Lyria 3 Clip | Lyria 3.5 / Pro |
|---|---|---|
| 最大时长 | 30 秒 | 184 秒 (3 分 4 秒) |
| 结构控制 | 基础 (循环/预览) | 高级 (段落标签 + 时间戳) |
| 人声表现 | 基础 | 高 (情感动态、多语言清晰) |
| 适用场景 | 社交媒体片段、UI 音效 | 完整歌曲、游戏配乐、广告 |
Google DeepMind 表示,Lyria 3.5 的核心价值在于回答一个简单的问题:“当我从短 Demo 转向可发布的长曲时,它能否真正节省时间?” 随着音乐生成技术的成熟,Lyria 3.5 正致力于让 AI 成为创作者手中可靠的长曲制作伙伴。