HeyGen 推出 LiveAvatar:实时对话 AI 数字人新范式
HeyGen 近日在其官方博客宣布推出 LiveAvatar,标志着其在 AI 数字人领域从静态生成向实时交互的重大跨越。作为其前代产品 Interactive Avatar 的继任者,LiveAvatar 旨在打造高度拟真、能够进行实时语音对话的数字人体验,彻底改变了传统 AI 视频生成的交互逻辑。
核心突破:从静态生成到实时交互
LiveAvatar 的核心价值在于将 lip-synced video stream(唇形同步视频流)与 conversational AI(对话式 AI)深度融合。在一个会话中,系统能够实时处理用户输入,经由大语言模型生成回复,合成语音,并渲染出与之完美同步的视频画面。这种全链路实时处理能力,使得数字人不再是单向播报的屏幕,而是具备独立人格和即时反应能力的交互伙伴。
双模式架构:灵活适配不同开发需求
LiveAvatar 提供了两种灵活的集成模式,以应对不同的技术栈和场景需求:
1. FULL Mode(全托管模式)
适合希望快速落地且无需维护复杂音频/AI 管道的团队。该模式由 HeyGen 托管核心组件,包括:
- Voice Activity Detection(语音活动检测)
- Speech-to-Text 与 Text-to-Speech 处理
- Large Language Model 推理
- WebRTC 流媒体编排
开发者只需配置数字人形象、语音音色及会话上下文,HeyGen 将自动协调底层实时基础设施,大幅降低开发门槛。
2. LITE Mode(轻量级模式)
适合已拥有成熟 AI 架构或需要极致控制权的团队。在此模式下,开发者负责构建语音识别、LLM 推理及对话逻辑,LiveAvatar 仅作为视觉层(Visual Layer)工作,将音频转化为同步视频。该模式支持集成 LiveKit、Pipecat、OpenAI Realtime 等主流实时通信框架,赋予开发者对对话流程的完全掌控。
数字人形态与记忆系统
LiveAvatar 支持丰富的数字人形态,满足从标准化演示到高度定制化的需求:
- Stock Avatars:提供无需定制身份的库存数字人,部分支持绿幕背景替换,便于嵌入自有品牌界面。
- Custom Video Avatars:基于 2 分钟真人视频训练,可克隆面部表情、动作甚至声线(Voice Clone),但需占用付费额度。
- Custom Image Avatars:支持单图生成数字人,解决了此前无法仅用图片创建实时数字人的痛点,但需手动指定语音。
此外,LiveAvatar 引入了可选的记忆系统(Opt-in Memory System)。默认情况下会话是隔离的,但开发者可显式链接会话以共享记忆,使数字人能够跨对话总结关键信息,实现更连贯的长期交互体验。
迁移提示与生态展望
HeyGen 确认 Interactive Avatar 正在向 LiveAvatar 迁移,部分资产(如知识库)已自动迁移。但官方建议现有用户务必登录 LiveAvatar 仪表盘核实自身资产状态,以确保所有配置、语音及集成完整无损。
LiveAvatar 的推出不仅巩固了 HeyGen 在实时视频生成领域的领先地位,更为虚拟销售助手、智能培训导师及 Web 端沉浸式体验提供了标准化的开发接口,预计将推动 AI 数字人在 B 端应用中的规模化落地。