HeyGen 发布 Avatar IV/V 自定义动作提示:实现更自然的微表情与手势控制
HeyGen 近日在其官方博客宣布,针对 Avatar IV 和 Avatar V 引擎推出了全新的自定义动作提示(Custom Motion Prompts)功能。这一更新旨在赋予创作者更精细的虚拟人控制能力,通过自然语言描述来驱动虚拟角色的面部表情、肢体语言及视线变化,从而制作出更具动态感和真实感的视频内容。
核心突破:从预设到自然语言驱动
此次更新的核心在于将传统的结构化预设(Preset)扩展为灵活的文本指令系统。
- Avatar IV 的进化:支持基于脚本的场景化动作渲染。用户只需输入自然语言描述(如"右臂抬起挥手,热情友好"),系统即可解析并生成相应的动作。虽然功能强大,但受限于单次生成的时长。
- Avatar V 的增强:在保留自然语言控制的同时,引入了专门的Expression(表情)、Gesture(手势)和Gaze(视线)预设标签。用户可以在这些结构化选项基础上,叠加自定义文本指令,实现更精准的微调。
可控维度与边界
HeyGen 明确了自定义动作提示的控制边界,确保用户理解其适用范围:
✅ 可控制维度
- 面部表情 (Facial Expression):包括平静、热情、严肃、温暖、自信、真诚、悲伤、强烈等情绪状态。
- 手部手势 (Hand Gestures):涵盖挥手、指点、竖大拇指、手捂胸口、和平手势、交叉双臂、OK 手势、合十礼、张开双臂、握拳、敬礼、鼓掌、耸肩等。
- 身体姿态 (Body Posture):如前倾、稳重、开放温暖、端庄等。
- 视线方向 (Gaze):直视镜头、移开视线、看向侧方。
- 静止状态 (Stillness):控制手部是否完全静止或减少动作幅度。
❌ 不可控制维度
值得注意的是,该功能不包含场景级控制。用户无法通过此功能控制:
- 相机运动(推拉摇移)
- 场景切换或位置移动(如走到厨房、走出房间)
- 道具交互(喝咖啡、吸烟、拿手机)
- 起立、行走或背景/灯光变化
这些功能需在 HeyGen 编辑器中的其他模块单独配置。
最佳实践:如何编写高效的 Motion Prompt
为了获得最自然的动画效果,HeyGen 提供了具体的编写指南:
- 结构清晰:遵循
[身体部位] + [动作] + [情绪/强度]的公式。- 示例:"Avatar smiles softly while raising a hand."
- 保持简洁:每个提示词最好只描述一个主要手势或情绪。虽然可以组合短句(如"点头然后指向前方"),但避免堆砌过多动作会导致生成不稳定。
- 利用 Avatar V 预设:在 Avatar V 中,可以先选择预设的表情或手势标签,再辅以简短的文本指令进行微调。
- 注意时长限制:自定义动作提示的最大生成时长为 10 秒。若应用于长场景,系统会对前 10 秒生成动作,其余部分可能循环或静止。
- 技巧:对于长视频,建议主体部分使用默认运动,仅在需要强调特定动作时插入 10 秒的自定义提示,以避免循环感。
技术价值与应用场景
这一更新标志着 HeyGen 在Fine-tuning和Prompt Engineering领域的进一步深耕。通过理解自然语言中的细微差别(如"warm and open"vs"composed"),模型能够输出更细腻的微表情和肢体语言。
对于开发者而言,这为构建更智能的虚拟数字人提供了新的 API 交互范式;对于内容创作者,这意味着无需复杂的动作捕捉设备,仅凭文字描述即可实现专业级的虚拟表演效果,极大地降低了高质量虚拟视频的生产门槛。
官方引言:"Properly setting your motion prompts brings your Avatar IV & Avatar V creations to life by giving you more control over expression." —— HeyGen 官方团队
通过这一功能,HeyGen 继续巩固其作为全球领先 AI 视频生成工具的地位,让虚拟人的每一次‘表演’都更加生动自然。