Pika 发布 Speech 模型:3B 参数实现秒级生成,成本较主流竞品降低 9 倍
Pika 团队于 2026 年 8 月 18 日发布了其最新语音生成模型 Pika Speech。作为一款基于流匹配(Flow Matching)架构的文本转语音(TTS)系统,Pika Speech 不仅实现了录音室级的 48kHz 音质,更在生成速度与成本控制上取得了突破性进展。
核心突破:极速生成与极致性价比
Pika Speech 的核心架构是一个 3B 参数的流匹配 Transformer。与传统扩散模型不同,它利用流匹配技术将噪声到语音的映射过程平滑化,仅需 8 个去噪步骤 即可完成生成。在实际测试中,生成 3 分钟的语音仅需 0.02 秒的推理因子(Real-time Factor),这意味着生成速度甚至快于用户输入文本的时间。
这种极致的速度直接转化为成本优势。根据官方数据,Pika Speech 的成本效率是 ElevenLabs v3 的 9 倍,是 Cartesia 和 ElevenLabs Turbo 的 4.5 倍,更是 Fish Audio 的 2 倍。这使得大规模语音生成应用在经济上变得极具可行性。
技术亮点详解
1. 分布匹配蒸馏(Speech DMD)
为了在保持音质的同时进一步加速,Pika Speech 采用了 分布匹配蒸馏(Distribution Matching Distillation, DMD) 技术。不同于传统的轨迹蒸馏,DMD 不要求学生模型模仿教师的每一步轨迹,而是直接匹配教师的输出分布。通过冻结教师分数和训练批评分数,模型在纯净语音空间中直接获得梯度,从而在极少的步骤内复现教师模型的音色、风格和时长行为。
2. EOS Latent:精确控制时长与语速
大多数 TTS 系统通过裁剪或变速处理来控制时长,而 Pika Speech 在模型内部引入了 EOS Latent(End-of-Speech Latent) 机制。
- 原理:在输入序列前添加一个干净的潜在向量(Latent),该向量携带“语音结束”的语义,并赋予其目标帧对应的 RoPE 位置编码。
- 效果:模型“看到”了句子必须在特定帧结束,从而自然地压缩或拉长发音。滑动该锚点即可改变语速和总时长,无需后处理。
- 流式支持:对于流式生成,模型还集成了每帧 EOS 头,能在句子结束的瞬间立即停止生成,而非等待预设缓冲区。
3. 高质量训练数据与处理流程
Pika Speech 的训练集包含 403,000 小时 经过严格筛选的语音数据,涵盖英语和中文的对话、朗读及表达性语音。数据处理流程包括:
- 语音活动检测(VAD)分割
- 去噪与响度标准化
- 基于 DNSMOS 和美学评分的质量过滤
- ASR 转录与结构化标注
实际应用价值
对于开发者而言,Pika Speech 提供了极高的性价比和灵活性。其 API 支持从 5 秒参考音频克隆任意音色,并允许用户通过预设(Preset)或自定义指令控制风格、语调和持续时间。无论是用于视频配音、有声书生成还是实时聊天机器人,Pika Speech 都能提供接近原生录音的音质体验,同时大幅降低算力与运营成本。
"Pika Speech 的速度如此之快,以至于打字输入文字的时间比生成语音还要长。" —— Pika 团队
目前,开发者可以通过 Pika API Club 体验该模型的最新能力。