Viggle V4 发布:基于 3D 世界模型重塑角色运动控制与一致性
Viggle 近日发布了其最新一代模型 Viggle V4,标志着其在 AI 视频生成领域的又一次重大技术跨越。与以往基于扩散模型(Diffusion-based)的帧级操作不同,V4 核心引入了 Viggle 专有的 JST(Just So Story? 注:原文语境指代其专有 3D 世界模型架构),一种真正的 3D World Model。这一架构变革使得 Viggle 能够从根本上理解运动的物理结构,从而在角色一致性、复杂动作捕捉及多角色交互上实现了质的飞跃。
核心突破:从“帧级拼接”到“3D 结构理解”
Viggle V4 最显著的优势在于其底层逻辑的转变。传统的 AI 视频模型往往在每一帧之间进行像素级的预测,导致长时间或剧烈运动时出现“抖动”和形变。而 Viggle V4 通过 3D 世界模型,为角色构建了结构化的空间理解。
- 复杂运动的高保真还原:V4 能够精准捕捉高速动作、翻转、倒立及体操类高难度运动。即使在角色位于画面边缘或被部分遮挡时,也能大幅减少画面抖动(Shakiness),生成物理上连贯且稳定的运动轨迹。
- 彻底解决“角色漂移”(Character Drift):在之前的版本中,非人类角色(如动物、外星人、机器人)在生成过程中容易向通用的人形特征漂移。V4 利用持久的 3D 角色表征,确保角色在整个视频中的比例、服装细节及视觉身份保持高度一致,彻底消除了这一痛点。
关键新功能:Character Refine 与多角色场景
为了赋予创作者更精细的控制权,Viggle V4 引入了 Character Refine 功能。
- 多视角自动建模:用户只需上传一张角色图片,系统会自动生成 5 个不同角度的参考图,并将其融合为统一的角色参考。这种多视角理解机制,使得 V4 能在各种运动、姿态和镜头角度下,精准还原角色的形状与特征,特别适合处理纹理丰富或设计独特的非人类角色。
- 多角色场景与多轨道支持:V4 在多角色场景中表现卓越,能够准确保留每位角色的身份、时间同步及空间关系,避免角色混淆。配合 Multi-track 功能,创作者可以追踪长达 1 分钟的视频,精准选中并替换特定角色,同时保持背景、运镜及其他角色动作不变。这在群舞、对话及复杂互动场景中极具实用价值。
性能指标与创作效率
Viggle V4 不仅在质量上领先,在效率上也极具竞争力:
- 极速渲染:相比其他需要数分钟甚至数小时渲染的 AI 视频工具,Viggle V4 通常在几秒到一分钟内即可完成生成。
- 超长时长支持:支持生成长达 1 分钟 的视频(文件大小低于 100MB),远超大多数竞品仅支持 15 秒左右的限制,极大地提升了实际创作工作流的可行性。
结语
Viggle V4 通过引入 3D 世界模型,重新定义了 AI 角色动画的边界。对于需要高精度角色控制、复杂动作捕捉及长视频生成的开发者而言,V4 提供了一个稳定、高效且可控的解决方案。
"Viggle V4 允许您无缝地将参考视频中的动作转移到上传的角色图像上,我们在 V4 中大幅提升了整体性能,包括对复杂运动的更强支持以及更自然的表情。" —— Viggle 官方团队