Pika 发布 Soundtrack:视频生成新维度,实现毫秒级视听同步
在 AIGC 视频生成领域,图像与声音的割裂一直是长期痛点。Pika 今天正式推出了 Pika Soundtrack,这是一款能够根据视频内容自动生成同步、完整场景音效的模型。它不再仅仅是为视频添加背景音乐,而是深入理解画面中的物体、动作、材质及环境,生成包含音效(Foley)、人声、音乐及环境音的完整听觉体验。
核心突破:从“配乐”到“视听同步”
Pika Soundtrack 的核心价值在于解决了传统视频生成中“音画不同步”的难题。系统通过提取视频的视觉与时间信息,结合用户指令,生成受条件约束的音频轨道。
其技术架构基于 Transformer 基于潜变量的扩散模型(Latent Diffusion Model),具体流程如下:
- 视频压缩:将原始视频压缩为视觉潜变量(Visual Latent Tokens),保留时间、物体运动及帧级动作线索。
- 语义编码:将文本提示词编码为语义 Token,描述所需的音效类型(如脚步声、风声)或排除项。
- 潜变量生成:音频在压缩的潜空间中进行生成,而非直接输出波形。模型在去噪过程中,实时关注视频 Token 和文本 Token,决定“生成什么声音”以及“何时发生”。
关键技术指标与优势
Pika Soundtrack 在架构优化与训练策略上进行了深度创新,使其在长视频生成中依然保持高效与精准:
- 成本效率提升:得益于优化的推理栈,Pika Soundtrack 在本地评估中比竞品视频转音频模型 成本降低 2 倍(2× more cost-efficient)。
- 时序强对齐:采用 流匹配(Flow-matching) 与扩散去噪损失,强制音频轨迹与可见运动及场景变化严格对齐,彻底解决长视频中的音画漂移问题。
- 长场景一致性:通过蒸馏、激活与上下文缓存(Activation and Context Caching)以及稀疏注意力(Sparse Attention)技术,大幅减少重复计算,支持长视频的低延迟交互生成。
实际应用场景
Pika Soundtrack 适用于对视听体验要求极高的场景:
- 影视后期辅助:快速生成符合镜头情绪的配乐与音效,减少人工剪辑时间。
- 交互式视频创作:创作者可上传视频片段,一键获得包含环境音与动作音效的完整作品。
- 沉浸式内容生成:为游戏过场或虚拟人视频提供逼真的空间音频体验。
正如 Pika 团队所言:"Sound that understands what happens—and when."(理解发生了什么以及何时发生的音效)。Pika Soundtrack 标志着 AI 视频生成从单纯的视觉呈现,迈向了真正的视听统一新纪元。
示例演示
Prompt: 一段持续 30 秒的激烈鼓独奏,无其他乐器。前四拍后节奏逐渐加强,直至达到疯狂的峰值:清脆的军鼓、快速的踩镲、深沉的贝斯、撕裂的定音鼓填充、撞击的钹、滚奏,最后落在一次沉重的军鼓与钹的合击上。强度如鞭挞般强烈,近距离录音,每一击都紧凑有力。
该 Prompt 输入后,Pika Soundtrack 能够精准还原鼓点的节奏变化与空间感,使声音与画面动作完美契合。