Pika 发布 Speech 模型:3B 参数实现秒级生成,成本较主流竞品降低 9 倍
Pika 正式推出 Pika Speech,一款基于 3B 参数流匹配(Flow Matching)架构的文本转语音模型。该模型能在极少的去噪步骤中生成 48kHz 录音室级音质语音,支持从 5 秒参考音频克隆音色。实测中,3 分钟语音生成仅需 0.02 秒推理因子,成本效率比 ElevenLabs v3 高出 9 倍,并创新性地通过 EOS Latent 机制实现了对语速和时长的精确控制。
Pika Labs推出的AI视频生成和编辑工具
Pika 正式推出 Pika Speech,一款基于 3B 参数流匹配(Flow Matching)架构的文本转语音模型。该模型能在极少的去噪步骤中生成 48kHz 录音室级音质语音,支持从 5 秒参考音频克隆音色。实测中,3 分钟语音生成仅需 0.02 秒推理因子,成本效率比 ElevenLabs v3 高出 9 倍,并创新性地通过 EOS Latent 机制实现了对语速和时长的精确控制。
Pika 正式推出 Pika SFX,一款能将自然语言描述转化为生产级音效的实时生成模型。该模型采用文本条件扩散 Transformer 架构,结合流匹配训练与教师 - 学生蒸馏技术,在保持高保真音频质量的同时,将端到端生成延迟优化至平均 0.847 秒,显著优于行业竞品。
Pika 于 2026 年 8 月推出 Pika Music,一款支持文本、歌词、声音参考及音乐参考的多模态音乐生成模型。该模型实现了从创意方向到完整歌曲的单一工作流,支持在保持歌词固定的情况下实时调整编曲风格,并将 90 秒歌曲的生成速度提升至平均 6.21 秒,实现了创作闭环的高效迭代。
Pika 正式推出 Pika Soundtrack,一款能将视频转化为同步、全场景声音景观的生成式 AI 模型。该模型通过理解视频中的动作、材质与环境,自动生成包含音效、人声、音乐及环境音的完整音频轨道。相比竞品,Pika Soundtrack 在本地评估中成本效率提升 2 倍,实现了从“零提示”到“完整场景音频”的跨越,为视频创作者提供了前所未有的沉浸式体验。
Pika 于 2026 年 8 月正式发布 Pika Audio 系列,涵盖 Pika Soundtrack、Pika Music、Pika SFX 及 Pika Speech 四大前沿音频模型。该系列通过高效的训练与推理技术,将生成成本降低至市场同类产品的 1/20 至 1/9,显著提升了创作者的迭代效率。Pika Soundtrack 实现了视频与音频的强语义对齐,Pika Music 支持多模态输入生成完整乐曲,Pika SFX 专注于精准音效生成,Pika Speech 提供高表现力语音克隆。目前仅通过 Pika API Club 独家开放。
Pika 于 2026 年 8 月正式推出 Pika API Club,旨在解决生成式媒体(Gen Media)成本高昂的问题。该计划通过统一 API 接入 100+ 领先模型(包括 Seedance 2.0、Kling 3.0、Veo 3.1 等),提供最高 88% 的价格优惠。采用$10/月会员费 + 按需付费模式,并具备 Agent 原生架构,大幅降低开发者与独立创作者的试错成本。
Pika 正式推出终极“创始人启动套件”(Founder Starter Kit),通过集成四大专用技能(Build-a-brand, App Store Screens, App Sizzle Video, Founder Video),赋能技术型创始人利用 MCP 协议快速构建品牌身份、生成高转化应用截图、制作 15 秒营销视频及创始人自述视频。该套件旨在解决技术团队缺乏营销能力的痛点,实现从代码到商业落地的无缝衔接。
Pika Labs 正式推出“Pika Experiments”公开实验计划,率先发布 Generative UI(生成式 UI)原型。该突破允许 Agent 在对话中实时生成并动态调整视觉界面,打破传统 Chat 交互局限。开发者可通过 GitHub 获取源码,通过 Pika MCP 工具链参与测试与二次开发,共同探索下一代智能体交互边界。
Pika 于 2026 年 4 月宣布重大变革,首次允许用户构建的 AI Self Agent 通过对话与技能使用赚取真实收益。该更新颠覆了传统 AI 平台“用户付费、平台获利”的单向经济模型,转向“用户投资、AI 回报”的共赢机制。用户可通过训练个性化 Agent、赋予独特技能来增加其市场价值,从而获得可兑换现金的代币奖励。
Pika 正式推出 PikaStream 1.0,旨在解决现有视频生成模型无法支持实时交互的痛点。该引擎在单张 H100 GPU 上实现了 24 FPS、480p 的实时视频生成,端到端语音转视频延迟低至 1.5 秒。通过 FlashVAE、9B DiT 及多奖励 RLHF 技术,Pika 让 AI Agent 具备面部表情、自然手势和持久记忆,真正实现了类人化的实时视频对话体验。