LALAL.AI 发布 Andromeda:音频源分离技术的第六代飞跃
After years of refining its audio source separation technology through multiple generations of neural networks, LALAL.AI introduces Andromeda — its most advanced and meticulously engineered model to date. This update marks a significant milestone in the evolution of AI audio processing, reflecting the culmination of six generations of research in digital signal processing and machine learning.
核心突破:从 Perseus 到 Andromeda
Andromeda 并非简单的参数堆叠,而是基于 Transformer 架构的深度重构。与之前的 Perseus 模型相比,Andromeda 在训练数据规模上增加了约 4 倍,并采用了多阶段数据清洗流程,结合 LALAL.AI 团队自主研发的最新数字信号处理(DSP)技术。
1. 统一架构:终结“二选一”困境
在 LALAL.AI 的历史上,用户曾面临一个经典难题:在“清晰切割(Clear Cut)”和“深度提取(Deep Extraction)”模式之间做选择。前者侧重减少交叉混响(cross-bleed),后者侧重保留细节,往往难以兼得。
Andromeda 首次打破了这一限制,将两者合并为一个统一网络。
- 智能平衡:模型不再需要用户手动切换模式,而是智能地在最小化泄漏和最大化细节之间找到最佳平衡点。
- 消除妥协:交叉混响(vocal bleed into other instruments)这一曾经不可避免的问题,在 Andromeda 中几乎被完全消除。
2. 性能飞跃:速度与精度的双重提升
Andromeda 在处理复杂音频时展现出卓越的能力,特别是在处理人声、乐器和背景噪音的复杂交互时。
- 处理速度:相比前代,Andromeda 实现了高达 40% 的处理速度提升,显著降低了用户等待时间。
- 音质指标:在基准测试数据集上,Andromeda 的 SDR(信号失真比) 相比 Perseus 提升了 10%。
- 频率响应:保持了高达 22 kHz 的立体声处理频率范围,确保高保真分离。
3. 细分工具增强:鼓与贝斯的深度解析
自 2026 年 3 月起,Andromeda 已扩展至支持 四轨分离(人声、乐器、鼓、贝斯),进一步丰富了应用场景。
- 贝斯分离:Andromeda 捕捉了更宽的频率范围,保留了泛音、手指噪音、合成器纹理及细微的饱和感。这使得分离出的贝斯部分听起来更加饱满、自然,而非单薄。
- 鼓点分离:显著提高了鼓点的细节、隔离度和一致性。它有效减少了贝斯和其他乐器的干扰(bleed),即使在歌曲的弱拍或突然的静音段落,也能稳定地捕捉鼓点内容,大幅减少了元素丢失的情况。
实际应用价值
Andromeda 已深度集成到 LALAL.AI 的多个核心服务中,包括 Stem Splitter、Lead & Back Vocal Splitter、Echo & Reverb Remover 以及 Voice Cleaner。
对于音乐制作人和音频工程师而言,这意味着:
- 减少后期工作量:许多过去需要在数字音频工作站(DAW)中进行的手工清理步骤(如手动去除人声混入乐器的痕迹)现在变得不再必要。
- 更精准的混音:即使是安静的背景人声(soft backing vocals)也能被提取得更加清晰,便于后续混音。
- 更广泛的适用性:得益于更大的训练数据集,Andromeda 能更好地处理各种复杂的音频源和混合场景。
结语
Andromeda 代表了 LALAL.AI 在音频 AI 领域的长期投入与技术创新。正如官方所言,这不仅是技术的迭代,更是用户体验的重塑——让高质量的音频源分离变得更快、更准、更简单。