Dzine 发布多角色 AI 唇形同步技术,重塑虚拟数字人创作流程
在 AI 视频生成领域,Lip Sync(唇形同步)技术正从单一功能的辅助工具演变为构建沉浸式数字内容的核心引擎。近日,知名 AI 平台 Dzine 发布了其最新的唇形同步功能,不仅支持单角色的高精度同步,更重磅推出了单视频内多角色同步的能力,标志着 AI 视频制作迈入了“批量生成”的新阶段。
技术突破:从单点到多点的同步革命
传统的唇形同步主要依赖人工逐帧调整或单一的 AI 模型处理,在处理包含多个角色的复杂场景(如动画电影、游戏过场、虚拟直播)时,效率极低且难以保证一致性。
Dzine 此次更新的核心突破在于其多角色面部识别与同步引擎:
- 多角色并发处理:用户只需上传一张包含最多 4 个人物的图像或视频,系统即可自动识别并分别处理每个人物的口型,实现“一次生成,全员开口”。
- 跨模态兼容:支持真人、动物、卡通、动漫等多种风格的视觉素材,打破了 AI 唇形同步仅适用于真人或特定卡通风格的限制。
- 自动化音素映射:底层算法深入分析音频波形,精准匹配音素(Phonemes)与口型单元(Visemes),确保不同角色在听到同一台词时,口型动作自然且符合各自角色特征。
极简工作流:从脚本到多角色视频的分钟级交付
Dzine 将原本需要数天甚至数周的后期制作流程,压缩为几分钟的自动化操作。开发者与创作者只需遵循以下四步即可生成高质量的多角色口型视频:
- Step 1: 素材上传:选择“Lip Sync Playground”,上传包含多张面孔的图像或视频(支持 4 人以内)。
- Step 2: 角色选择:系统自动识别画面中的人物、动物或虚拟角色,无需手动标记。
- Step 3: 语音生成:选择支持的语言(目前涵盖 9 种语言)及音色,输入脚本或上传音频文件,AI 将生成完美的对口型音频。
- Step 4: 一键生成:点击生成按钮,系统自动计算并调整所有角色的面部动作,输出最终视频。
应用场景:赋能影视、游戏与元宇宙
Dzine 的多角色唇形同步技术广泛适用于以下场景:
- 影视与游戏本地化:在电影或游戏进行多语言配音(Dubbing)时,无需重新拍摄演员,只需将新配音同步至原视频中的多位角色,极大降低制作成本。
- 虚拟数字人运营:为元宇宙中的虚拟主播、NPC 或虚拟偶像批量生成多语言互动视频,提升交互体验。
- 社交媒体内容创作:创作者可快速制作包含多个角色的趣味短视频,模仿热门歌曲或剧情,提升内容产出效率。
- 自动对白替换(ADR):针对拍摄中口型不佳的片段,利用 AI 快速修正多位角色的口型,无需重新录制。
行业意义
Dzine 的这一更新,标志着 AI 视频生成从“单点突破”走向“系统化生产”。它解决了传统动画制作中口型绘制耗时耗力的痛点,让中小团队和独立开发者也能以极低的成本,达到专业级影视制作的标准。随着多角色同步能力的成熟,AI 将不再仅仅是内容的辅助工具,而是成为内容生产的核心流水线。
“我们的目标是将唇形同步从一项繁琐的手动工作,转变为像写代码一样简单的自动化流程。” —— Dzine 技术团队
通过这一技术,Dzine 正在重新定义虚拟数字人与 AI 视频生成的边界,为未来的沉浸式媒体体验奠定坚实基础。