Pika 发布 Pika Music:多模态音乐生成新范式
在 AI 音乐领域,创作者往往需要在不同的工具间切换——用 A 工具写词,用 B 工具配曲,再用 C 工具换声线。Pika 团队今天宣布推出 Pika Music,旨在打破这一割裂,通过一个统一的模型,将创意方向、歌词、人声特征甚至参考曲目整合进单一工作流,让创作者从灵感瞬间直达成品。
核心突破:四模态输入与深度条件控制
Pika Music 的核心在于其灵活的输入架构,它不再将歌词视为后处理的对齐结果,而是将其作为去噪目标的一部分。这意味着模型能够理解结构标签(如 [Verse], [Chorus]),并根据提示词动态调整旋律与和声。
1. 文本提示 (Prompt)
从描述到完整曲目。用户只需输入风格、情绪、乐器配置及人声特质,模型即可生成连贯的完整歌曲,而非短小的纹理片段。
2. 歌词输入 (Lyrics)
歌词作为条件令牌直接参与生成过程。独特的设计允许用户固定歌词,仅通过修改提示词来改变曲风——同一首歌词可以瞬间从 R&B 转为电子舞曲,或从民谣变为电影原声。
3. 声音条件 (Voice Condition)
通过短音频参考,模型可以精准捕捉人声的音色、质感、演绎方式及能量感。这不仅仅是叠加人声,而是让参考音频参与整个表演生成的条件化过程。
4. 音乐参考 (Music Reference)
对于难以用语言描述的“氛围感”,Pika Music 允许用户上传参考曲目。系统会分离并归一化参考曲中的音乐特质(如配器、能量、整体感觉),将其作为新歌曲的基调,而提示词则决定歌曲的具体内容。
性能指标:极速迭代,重塑创作流
Pika Music 最引人注目的特性是其惊人的生成速度。在本地测试中,生成一首 90 秒的歌曲平均仅需 6.21 秒,约为正常播放速度的 14.5 倍。这一性能突破使得创作者无需离开创作循环,即可快速尝试新的歌词、人声或编曲方案。
技术架构与未来展望
Pika Music 的底层逻辑是将多种控制信号(语言描述、歌词结构、声音参考、音乐参考、时长与种子)进行组合。这种架构不仅解决了多输入可能产生的冲突问题,更为未来的音乐创作提供了无限可能。
“我们想要模型能够接住人们想法的每一个起点。有时是一个句子,有时是一页完整的歌词,有时是决定成败的人声或旋律。Pika Music 将这些视为通往同一目的地——你渴望听到的那首歌——的不同路径。”
—— Pika 团队
对于开发者而言,Pika Music 提供了丰富的 API 接口,支持将多模态音乐生成集成到现有的数字音频工作站 (DAW) 或流媒体平台中,开启音乐制作的自动化新篇章。