LALAL.AI 语音克隆系统升级:从单次购买转向‘插槽’订阅制,支持多语言与音色微调

ADK LALAL.AI官方 / ADK编译 2026-09-08 4 分钟 107 次浏览
速览导读 / Summary

LALAL.AI 正式宣布语音克隆(Voice Cloner)计费模式重大变革,由单次购买语音包(Voice Pack)升级为基于‘插槽’(Voice Pack Slots)的订阅制。新系统支持多语言克隆、音色(Tonality)与口音(Accent)微调,并允许用户免费替换已训练好的克隆体。Lite 和 Pro 套餐分别提供 1 个和 3 个插槽,旧版一次性购买用户资产不受影响,实现了更灵活的资产管理与生态扩展。

订阅套餐 Lite ($10/mo) | Pro ($20/mo) 分别提供 1 个和 3 个语音包插槽
样本要求 10-50 分钟 需清晰、无背景噪音、无音乐
兼容性 多语言 支持任意语言克隆,但处理工具仅限单语言

Key Insights / 核心看点

  • 1 计费模式重构:从单次购买语音包升级为基于‘插槽’的订阅制,支持 Lite 和 Pro 两种套餐配置。
  • 2 多语言克隆支持:用户可使用任意语言的样本训练克隆体,并针对目标语言调整口音与音色。
  • 3 资产灵活管理:允许用户免费替换已训练的克隆体,旧版一次性购买用户资产不受新政策影响。
  • 4 技术边界明确:目前仅支持语音转语音(S2S),不支持文本转语音(TTS),且单次处理仅限单语言。

LALAL.AI 语音克隆系统升级:从单次购买转向‘插槽’订阅制

LALAL.AI 近期在其官方博客发布了一份详尽的常见问题解答(FAQ),标志着其核心语音克隆功能迎来了重大架构与商业模式的双重升级。此次更新不仅重构了用户的计费逻辑,还显著增强了克隆体的可控性与多语言适应能力,旨在为内容创作者提供更灵活、专业的语音合成解决方案。

核心变革:从‘一次性购买’到‘插槽订阅’

此次更新最引人注目的变化在于计费模式的转型。LALAL.AI 宣布弃用传统的单次语音包购买模式,转而采用Voice Pack Slots(语音包插槽)机制。

  • 订阅制管理:语音包现在作为订阅计划的一部分。用户无需为每个克隆体单独付费,只需支付订阅费即可获得预留的插槽,用于存储、交换和管理已训练的克隆体。
  • 灵活的插槽配置:
    • Lite 套餐 ($10/月):包含 1 个插槽,提供 90 分钟快速队列处理时间,支持批量处理及结果下载。
    • Pro 套餐 ($20/月):包含 3 个插槽,提供 250 分钟快速队列时间,额外赠送 VST 插件、本地 Lyra 模型处理权限及 API 访问权。
  • 平滑过渡:对于旧版一次性购买的用户,其拥有的语音包将永久保留,不占用新系统的插槽配额。订阅用户的新增插槽将叠加在原有资产之上。

技术突破:多语言支持与精细控制

除了商业模式的优化,LALAL.AI 在技术层面也带来了显著的功能增强,特别是针对多语言场景的适配。

1. 真正的多语言克隆

Voice Cloner 现已支持任何语言。用户可以使用任意语言的音频或视频样本训练克隆体,生成的语音包也完全对应该语言。这意味着创作者可以轻松克隆非母语发音,只需确保样本音频/视频的高质量即可。

2. 精细化的音色与口音控制

在 Voice Changer 工具中,用户现在可以针对克隆体进行更深层的参数调整:

  • Tonality(音色):微调声音的质感与情感色彩。
  • Accent(口音):定义单词的发音方式,实现从原声口音到目标口音的平滑过渡。
  • De-echo(去回音):在克隆过程中自动处理录音中的回声与混响问题。

开发者与用户价值

此次升级对生态参与者具有多重价值:

  1. 资产管理优化:对于需要管理多个角色或项目声音的创作者,插槽机制允许他们像管理软件许可证一样管理自己的声音资产,无需重复付费。
  2. 迭代成本低:如果用户后来训练出了更完美的版本,可以免费将新克隆体替换到同一插槽中,且支持在 30 天内申请恢复被覆盖的旧版本。
  3. 工作流集成:结合新的 API 访问权限和 VST 插件支持,开发者可以更容易地将 LALAL.AI 的克隆能力集成到自己的应用程序或本地工作流中。

局限性与注意事项

尽管功能强大,LALAL.AI 仍明确界定了其技术边界:

  • 非 TTS 工具:Voice Cloner 目前仅支持语音转语音(Speech-to-Speech),即上传录音后转换为克隆声音,不支持文本转语音(Text-to-Speech)。
  • 单语言处理:虽然支持多语言克隆,但在 Voice Changer 中,工具一次只能处理一种语言。混合语言(如同时处理俄语和英语)的录音无法被正确识别和处理。
  • 样本要求:为了获得最佳效果,建议上传 10-50 分钟、无背景噪音、无音乐且清晰的音频样本。

LALAL.AI 表示,这一变革旨在消除用户在使用过程中的不确定性,通过标准化的插槽管理和增强的技术控制力,让语音克隆技术真正服务于多元化的内容创作需求。

“我们希望通过 Voice Pack Slots 的引入,让用户能够更自由地管理自己的声音资产,无论是用于个人项目还是商业合作,都能获得一致且灵活的服务体验。” —— LALAL.AI 官方团队

“Voice Packs are now part of the LALAL.AI subscription. Instead of buying each voice separately, your plan includes Voice Pack Slots, reserved spaces in your account where you store, swap, and manage your trained voices.”

— 官方 FAQ 公告

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
audio · 付费
★ 5.0 · 120评测
L

LALAL.AI

AI人声乐器分离和提取

LALAL.AI是AI音乐音频处理工具,能快速、精准地将音频或视频中的人声、伴奏、鼓、贝斯等不同音轨分离,支持多种音频和视频格式(如MP3、WAV、MP4等)。工具提供免费的批量上传功能,用户能上传多达20个文件进行处理。LALAL.AI具备去除回音、混响和降噪等功能,能有效提升音频处理质量。工具提供数字声音克隆功能,帮助用户创建个性化的数字声音副本。

查看 LALAL.AI 使用教程与功能