Pika 发布 Pika Music:多模态输入实现从灵感到完整歌曲的极速创作
更新背景
在当前的 AI 音乐创作领域,创作者往往需要切换多个工具来完成不同阶段的任务:先用文本生成旋律,再用歌词生成伴奏,最后进行人声合成。这种割裂的工作流不仅降低了效率,也阻碍了创意的连贯性。
针对这一痛点,Pika 团队推出了全新的 Pika Music。其核心理念是“一个模型,多种创作路径”,旨在将创作意图(无论是文字描述、完整歌词、参考人声还是现有曲目)统一到一个工作流中,让创作者无论灵感从何开始,都能直接生成完整的歌曲。
核心突破与功能特性
Pika Music 支持四种核心输入模态,并采用条件生成(Conditioning)技术,将歌词作为去噪目标的一部分,而非后期对齐步骤,从而实现了更自然的结构控制。
1. 文本生成 (Text-to-Music)
创作者只需输入描述性的提示词,即可生成包含完整结构(主歌、副歌等)的歌曲。提示词可涵盖流派、情绪、配器、人声特征及编曲走向。
- 示例:输入“现代流行 R&B,降 B 小调,69 BPM,柔和摇摆节奏……”,模型即可生成包含深钢琴旋律、黑胶底噪及温暖贝斯的完整曲目。
2. 歌词驱动 (Lyrics Conditioning)
歌词作为条件令牌与提示词一同输入,直接参与去噪过程。结构标签(如 [Verse], [Chorus])被模型识别为结构信息,指导旋律走向。
- 灵活性:创作者可以固定歌词,仅调整提示词来改变曲风(如从 R&B 变为电影原声),或固定风格,仅修改歌词内容,实现无限迭代。
3. 人声参考 (Voice Condition)
通过上传短音频片段,模型可学习并模仿特定的人声音色、质感、演绎方式及能量感。这并非简单的“套壳”,而是让参考人声深度参与表演生成。
4. 音乐参考 (Music Reference)
对于难以用文字描述的“感觉”,Pika Music 允许上传参考曲目。模型会提取并归一化参考曲的纹理、配器、能量等音乐特质,作为新歌曲的“氛围基底”,而提示词和歌词则决定歌曲的具体内容。
技术亮点与性能指标
Pika Music 在保持高保真度的同时,展现了惊人的生成速度,彻底改变了创作节奏。
- 极速生成:在本地测试中,Pika Music 平均仅需 6.21 秒 即可生成一首 90 秒 的歌曲。
- 实时迭代:生成速度约为 14.5 倍 于人耳听觉速度,创作者可以在不中断创作流的情况下,尝试新的歌词、人声或编曲方案。
实际应用价值
对于独立音乐人、广告制作商及内容创作者而言,Pika Music 的价值在于其全链路自动化。它消除了传统工具链中的摩擦成本,使得“一句话”或“一段旋律”就能直接转化为可发布的音乐作品。无论是快速制作 Demo,还是进行精细的后期编曲探索,Pika Music 都提供了一个前所未有的高效入口。
“我们希望这个模型能陪伴创作者,无论他们的灵感始于一个句子、一份歌词、一个声音,还是一首现有的曲目。” —— Pika 团队
注:使用人声参考或音乐参考时,用户需确认拥有相应版权。