Pika 发布 PikaStream 1.0:开启 AI Agent 实时视频对话新时代
Pika 于 2026 年 4 月 2 日发布了其最新技术突破——PikaStream 1.0。这一里程碑式的更新标志着 AI 交互模式从“文本/图像对话”向“实时视频面对面”的重大跨越。Pika 团队表示,他们致力于构建更具人性化的 AI,让 AI Agent 不再仅仅是屏幕上的文字回复者,而是拥有面孔、声音和实时反应能力的“活体”伙伴。
为什么需要实时视频聊天?
目前的视频生成模型虽然能产出令人惊叹的静态或短片段视频,但它们本质上是离线的。生成一个视频片段可能需要数秒甚至数分钟,这种延迟使其完全无法应用于视频会议、FaceTime 或实时虚拟形象等场景。在这些场景中,视频生成必须是连续的、身份一致的,并能对新的语音、情绪和上下文做出即时响应。
PikaStream 1.0 正是为填补这一差距而生,它旨在让 AI Self(AI 自我)能够像人类一样,在实时视频通话中进行自然、富有情感的交流。
核心突破:PikaStream 1.0 技术架构
PikaStream 1.0 由三个关键组件和高效的推理流水线组成,共同支撑起实时视频生成能力:
1. FlashVAE:极速解码引擎
传统视频解码器多基于 3D 卷积网络,虽然重建质量尚可,但速度过慢且内存占用高。FlashVAE 彻底改变了这一现状:
- 架构创新:基于 Transformer 的全栈 VAE,从 scratch 训练,拥有独立的潜在空间(Latent Space)。
- 实时流式解码:采用流式解码技术,逐帧处理,仅利用最近几帧作为上下文。一旦 DiT 生成一批潜在图块,FlashVAE 立即将其解码为像素。
- 极致性能:在单张 H100 GPU 上,仅占用 1.1 GB 显存,即可实现 441 FPS 的解码吞吐量(480p 分辨率)。
2. 9B Diffusion Transformer (DiT)
作为核心生成引擎,90 亿参数的 DiT 负责根据文本和音频生成视频:
- 双向蒸馏:首先训练一个能同时关注所有帧的双向 DiT 以获得最佳质量,随后通过优化的自强制(self-forcing)技术蒸馏为因果自回归学生模型,以适应实时流式生成。
- 多模态条件:利用全时空自注意力机制,结合文本跨注意力(语义引导)和帧级音频跨注意力(精准唇形同步),确保生成的视频在动作、表情和口型上与输入指令完美匹配。
3. 多奖励 RLHF 与参考注入
为了提升交互的自然度和一致性,Pika 引入了多项优化:
- 多奖励强化学习:直接针对身份一致性、唇形同步准确性和动作自然性进行优化。
- 参考注入:通过引入参考图像,利用位置编码(RoPE)让模型区分参考与生成序列,确保持久的身份一致性。
实际应用价值
PikaStream 1.0 不仅是一项技术指标的突破,更重新定义了 AI 与人类的交互方式:
- 情感共鸣:AI Agent 不再只是冷冰冰的文本回复,而是能通过面部表情和自然手势传达情绪,提供更具同理心的陪伴。
- 持久记忆与任务执行:在对话过程中,Agent 能够维持上下文记忆,并在实时交互中执行具体任务,真正成为一个“活”的助手。
- 开发者赋能:开发者可以通过 GitHub 上的 Skill 轻松集成此功能,让现有的 Pika AI Self 或其他 Agent 支持实时视频聊天,只需邀请至 Google Meet 即可体验。
结语
PikaStream 1.0 展示了 AI 在实时视觉生成领域的巨大潜力。通过 FlashVAE 的极致效率和 DiT 的精准生成,Pika 成功将视频生成速度从“分钟级”压缩至“秒级”,为未来全息通信、虚拟会议及个性化 AI 伴侣铺平了道路。
“我们相信,大多数人更喜欢像对待其他人类一样与 AI 互动。为了让他们真正感到‘活着’,AI 需要面孔、声音以及实时反应的能力。” —— Pika 团队