Pika 发布 PikaStream 1.0:开启 Agent 实时视频交互新纪元
更新背景:从文本对话到“面对面”交互的跨越
在 AI 发展的进程中,文本与图像生成已相对成熟,但实时视频交互(Real-time Video Interaction)一直是制约 AI Agent 情感化与具身化的瓶颈。现有的视频生成模型通常采用离线推理模式,生成一段视频需要数秒甚至数分钟,且难以保证身份一致性(Identity Consistency)和即时响应能力。这导致 AI 无法像人类一样参与 FaceTime 或 Google Meet 等实时会议。
Pika 团队认为,要让 AI Self 真正“活”起来,不仅需要语言,更需要面孔、声音以及对实时语境(Context)的即时反应。因此,Pika 推出了PikaStream 1.0,一款专为实时视觉引擎构建的突破性系统。
核心突破:PikaStream 1.0 架构详解
PikaStream 1.0 的核心目标是在单张 H100 GPU 上实现24 FPS的实时视频流,并达成~1.5 秒的端到端语音到视频延迟。其技术架构由三大关键组件与高效推理管道组成:
1. FlashVAE:突破性的 Transformer 解码器
传统视频解码依赖耗时的 3D 卷积网络,而 Pika 自研的 FlashVAE 完全基于 Transformer 架构训练。它摒弃了批量解码模式,采用流式解码(Streaming Decoding),仅利用最近几帧作为上下文即可逐帧处理。
- 性能指标:在 480p 分辨率下,单卡 H100 内存占用仅1.1 GB,解码吞吐量高达441 FPS。
- 优势:实现了与 3D 卷积解码器相当的 PSNR 和 LPIPS 重建质量,同时速度提升 10 倍以上。
2. 9B Diffusion Transformer (DiT):双向蒸馏与因果回归
系统 backbone 是一个90 亿参数的 DiT 模型。为了兼顾质量与实时性,团队采用了自回归蒸馏(Autoregressive Distillation)技术:
- Teacher:一个双向 DiT,能同时关注所有帧以生成最高质量视频。
- Student:通过优化Self-forcing技术蒸馏出的因果自回归模型,支持按块(Chunk-by-Chunk)实时生成。
- 多模态条件:模型具备文本交叉注意力(Text Cross-Attention)和帧级音频交叉注意力(Frame-wise Audio Cross-Attention),支持动态调整动作与表情,并实现精准的唇形同步(Lip-sync)。
3. 参考注入与记忆保持
为确保生成的视频人物与目标身份高度一致,系统引入了参考注入(Reference Injection)机制。通过位置编码(RoPE),模型能区分参考图像与生成序列,使身份特征贯穿整个生成过程。同时,系统内置了持久化记忆模块,确保 Agent 在长时对话中保持上下文连贯。
实际应用价值
PikaStream 1.0 的发布将彻底改变 AI 工具的使用方式:
- 开发者:可通过 GitHub 技能包(Skill)将实时视频能力集成到自定义 Agent 中,构建具备情感表达能力的虚拟助手。
- 用户:可以直接邀请 AI Self 参加 Google Meet,体验与拥有独立人格、能实时回应情绪变化的 AI 进行面对面交流,而无需等待视频渲染。
“我们认为,大多数人更倾向于像对待真人一样与 AI 互动。PikaStream 1.0 正是为了填补这一差距而生。” —— Pika 团队
通过 FlashVAE 的高效解码与 DiT 的精准生成,Pika 成功将视频生成从‘离线渲染’推向了‘实时流媒体’时代,为未来具身智能与沉浸式 AI 应用奠定了坚实基础。