Pika 发布 PikaStream 1.0:实现 Agent 实时视频通话与零延迟交互

ADK Pika官方 / ADK编译 2026-04-02 5 分钟 171 次浏览
速览导读 / Summary

Pika 正式推出 PikaStream 1.0,旨在解决现有视频生成模型无法支持实时交互的痛点。该系统通过 FlashVAE 与 9B DiT 架构,在单卡 H100 上实现了 24FPS 的实时视频流与~1.5 秒端到端延迟,支持 Agent 进行 Face-to-Face 视频通话、自然手势表达及持续记忆上下文,标志着 AI 从文本交互迈向具身智能交互的新阶段。

实时帧率 24 FPS 支持流畅的实时视频交互
端到端延迟 ~1.5 秒 语音到视频的响应速度
显存占用 1.1 GB 单张 H100 GPU 峰值内存
模型参数量 9B Diffusion Transformer 主干参数

Key Insights / 核心看点

  • 1 发布 PikaStream 1.0,实现单卡 H100 上 24 FPS 的实时视频流生成,彻底解决离线渲染延迟问题。
  • 2 创新引入 FlashVAE 架构,利用 Transformer 流式解码技术,将内存占用降至 1.1 GB,解码速度提升 10 倍。
  • 3 采用 9B 参数 DiT 模型结合自回归蒸馏技术,支持动态文本控制、精准唇形同步及持久化记忆上下文。
  • 4 支持 Agent 进行 Face-to-Face 实时视频通话,具备自然手势与情感表达,提升交互拟人化程度。

Pika 发布 PikaStream 1.0:开启 Agent 实时视频交互新纪元

更新背景:从文本对话到“面对面”交互的跨越

在 AI 发展的进程中,文本与图像生成已相对成熟,但实时视频交互(Real-time Video Interaction)一直是制约 AI Agent 情感化与具身化的瓶颈。现有的视频生成模型通常采用离线推理模式,生成一段视频需要数秒甚至数分钟,且难以保证身份一致性(Identity Consistency)和即时响应能力。这导致 AI 无法像人类一样参与 FaceTime 或 Google Meet 等实时会议。

Pika 团队认为,要让 AI Self 真正“活”起来,不仅需要语言,更需要面孔、声音以及对实时语境(Context)的即时反应。因此,Pika 推出了PikaStream 1.0,一款专为实时视觉引擎构建的突破性系统。

核心突破:PikaStream 1.0 架构详解

PikaStream 1.0 的核心目标是在单张 H100 GPU 上实现24 FPS的实时视频流,并达成~1.5 秒的端到端语音到视频延迟。其技术架构由三大关键组件与高效推理管道组成:

1. FlashVAE:突破性的 Transformer 解码器

传统视频解码依赖耗时的 3D 卷积网络,而 Pika 自研的 FlashVAE 完全基于 Transformer 架构训练。它摒弃了批量解码模式,采用流式解码(Streaming Decoding),仅利用最近几帧作为上下文即可逐帧处理。

  • 性能指标:在 480p 分辨率下,单卡 H100 内存占用仅1.1 GB,解码吞吐量高达441 FPS。
  • 优势:实现了与 3D 卷积解码器相当的 PSNR 和 LPIPS 重建质量,同时速度提升 10 倍以上。

2. 9B Diffusion Transformer (DiT):双向蒸馏与因果回归

系统 backbone 是一个90 亿参数的 DiT 模型。为了兼顾质量与实时性,团队采用了自回归蒸馏(Autoregressive Distillation)技术:

  • Teacher:一个双向 DiT,能同时关注所有帧以生成最高质量视频。
  • Student:通过优化Self-forcing技术蒸馏出的因果自回归模型,支持按块(Chunk-by-Chunk)实时生成。
  • 多模态条件:模型具备文本交叉注意力(Text Cross-Attention)和帧级音频交叉注意力(Frame-wise Audio Cross-Attention),支持动态调整动作与表情,并实现精准的唇形同步(Lip-sync)。

3. 参考注入与记忆保持

为确保生成的视频人物与目标身份高度一致,系统引入了参考注入(Reference Injection)机制。通过位置编码(RoPE),模型能区分参考图像与生成序列,使身份特征贯穿整个生成过程。同时,系统内置了持久化记忆模块,确保 Agent 在长时对话中保持上下文连贯。

实际应用价值

PikaStream 1.0 的发布将彻底改变 AI 工具的使用方式:

  • 开发者:可通过 GitHub 技能包(Skill)将实时视频能力集成到自定义 Agent 中,构建具备情感表达能力的虚拟助手。
  • 用户:可以直接邀请 AI Self 参加 Google Meet,体验与拥有独立人格、能实时回应情绪变化的 AI 进行面对面交流,而无需等待视频渲染。

“我们认为,大多数人更倾向于像对待真人一样与 AI 互动。PikaStream 1.0 正是为了填补这一差距而生。” —— Pika 团队

通过 FlashVAE 的高效解码与 DiT 的精准生成,Pika 成功将视频生成从‘离线渲染’推向了‘实时流媒体’时代,为未来具身智能与沉浸式 AI 应用奠定了坚实基础。

“Because we believe that most people would prefer to interact with AI as they do with other humans.”

— Pika Team

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
video · 免费+付费
★ 5.0 · 120评测
P

Pika

Pika Labs推出的AI视频生成和编辑工具

Pika是近期热门的人工智能初创公司Pika Labs推出的AI视频生成和编辑工具,该工具可以将任何创意转化为视频,用户只需输入文字或图像,即可快速生成3D动画、动漫、卡通、电影等风格的视频。该AI视频生成工具最早于2023年4月下旬推出测试版,累计已经超过50万名早期用户使用,每周都在生成数百万个视频。不过,目前Pika还在进一步完善中,实际使用来看离大规模投入到真正的生产环境中还有一定的距离。

查看 Pika 使用教程与功能