Udio 发布 Voices 功能:实现跨歌曲人声复刻与风格融合新玩法

ADK Udio官方 / ADK编译 2025-09-11 4 分钟 137 次浏览
速览导读 / Summary

Udio 正式推出 Voices 功能,允许用户将一首歌的人声特征(Voice)迁移至新创作中,或结合特定风格(Style)生成新曲目。该功能区分于现有的 Style 功能,支持在 Playground 和 Create 流程中使用,并允许保存自定义人声。开发者可通过调整 Strength 参数控制人声相似度,同时支持多首歌曲的人声混合(Blending)。

功能类型 人声特征迁移 (Voice Cloning) 区别于 Style 模仿,专注于人声音色复刻
支持来源 Voices 库 + 用户原创歌曲 排除用户上传音频及 2024 年 6 月前歌曲
混合能力 双曲人声混合 (2-way Blend) 支持两首参考歌曲的人声比例调节

Key Insights / 核心看点

  • 1 推出 Voices 功能,支持将一首歌的人声特征迁移至新创作,实现跨歌曲人声复刻。
  • 2 引入 Voices Blending 混合模式,允许用户按比例融合两首歌曲的人声特征。
  • 3 建立人声保存与复用机制,用户可将自定义人声保存并在后续创作中随时调用。
  • 4 区分 Playground 与 Create 流程的使用逻辑,支持 Strength 参数精细调节人声相似度。
  • 5 明确限制:仅支持 Udio 原生库声音,不支持用户上传音频或早期歌曲作为人声源。

Udio 发布 Voices 功能:实现跨歌曲人声复刻与风格融合新玩法

Udio 近日在其官方博客宣布了一项重大更新——Voices功能。这一功能标志着 AI 音乐生成从单纯的“风格模仿”迈向了更精细的“人声特征迁移”阶段,允许创作者将一首歌曲中独特的人声特质(Voice)应用到新的创作中,甚至与其他歌曲的人声进行混合。

核心突破:Voice vs. Style

Udio 明确区分了本次发布的 Voices 功能与其互补的 Styles 功能:

  • Styles: 用于让新歌曲匹配现有的音乐风格(如流行、爵士等)。
  • Voices: 专注于捕捉并复用特定的人声特征,无论该人声来自 Udio 的 Voices 库还是用户自己的歌曲。

功能特性与使用场景

1. 灵活的创作入口

Voices 功能可在两个主要工作流中使用:

  • Playground (游乐场): 适合快速实验。用户可随机搭配 Voice & Style,或手动选择。需注意,在此模式下无法指定精确歌词,仅能描述大致主题。
  • Create (创作): 适合深度定制。用户可选择文本提示或风格参考,并在此激活 Voice Control,通过拖拽或点击添加人声。

2. 高级控制与混合

  • Strength 调节: 用户可调整人声的强度(Strength)。官方提示默认设置通常效果最佳,且最大强度并不一定代表最高相似度,需根据流派和风格进行实验。
  • Voices Blending (人声混合): 允许用户选择两首参考歌曲,通过滑块指定每首歌曲对人声特征的贡献比例,创造出独一无二的混合音色。

3. 人声保存与复用机制

这是该功能的一大亮点,解决了“一次性使用”的痛点:

  1. 使用: 在创作中激活 Voice Control 并选择目标人声。
  2. 保存: 使用后可将人声保存至“Saved”标签页。
  3. 复用: 后续创作中,可从 Saved 列表重新加载该人声,甚至可重命名以便管理。

限制与注意事项

尽管功能强大,Udio 也设定了明确的边界,以确保模型训练的稳定性:

  • 来源限制: 仅支持使用 Voices 库中的声音或 Udio 原生歌曲的声音。不支持用户上传自己的音频文件作为人声源。
  • 时间窗口: 2024 年 6 月及之前创建的歌曲无法作为人声源。
  • 版权隔离: 非用户本人创作的歌曲(即非原创歌曲)无法被提取人声特征。
  • 关联音频: 任何与用户上传音频关联的歌曲(如 Remix、Extension)均不可用。

开发者价值与应用前景

对于开发者而言,Voices 功能提供了更细粒度的控制参数(如 Strength),便于构建基于人声克隆的 API 服务。对于普通用户,这极大地降低了“模仿特定歌手”的门槛,无需依赖外部工具即可在 Udio 内部完成人声迁移和混合创作。正如 Udio 团队在文末幽默地透露,这些声音背后是工程师的辛勤工作,而非所谓的“会唱歌的仓鼠”,体现了其在音频建模技术上的深厚积累。


注:目前 Voices 功能已在网页端及移动端网页版上线,iOS App 暂未支持。

“The Voices feature enables you to craft new songs featuring a voice from our Voices library or from one of your previously-created songs!”

— Udio 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
audio · 免费+付费
★ 5.0 · 120评测
U

Udio

免费的AI音乐创作工具,每月可生成1200首歌曲

Udio是一款由前Google DeepMind研究人员创立的人工智能音乐生成器,旨在让任何人都能够轻松地创作出具有情感共鸣的音乐。该AI音乐生成工具能够根据用户输入的文本提示,包括音乐风格、主题、歌词等信息,快速生成包含人声的完整音轨。Udio不仅支持多种音乐风格和流派,还能够捕捉并表达音乐中的情感,创造出既逼真又具有创意的音乐作品。 Udio的设计理念是作为一个“超级乐器”,放大人类的创造力。适合音乐家和业余爱好者使用,提供了一个平台,让用户可以通过简单的文本输入,体验从零到创作出音乐的“魔法时刻”。Udio拥有与Suno类似的从文本提示创建完整曲目的能力,但具有更好的声音和更自然的声音。

查看 Udio 使用教程与功能