DomoAI 发布图像转视频提示词新指南:聚焦单一核心动作
在 AI 视频生成的实践中,用户常面临一个痛点:输入包含多个动作的复杂提示词(Prompt),导致模型生成的视频动作冲突、逻辑混乱或时间线错乱。DomoAI 近期在其官方博客中发布了一篇深度技术文章,揭示了提升图像转视频质量的关键——“一次只给一个清晰的主动作”。
核心原则:提示词是方向,而非分镜脚本
DomoAI 指出,图像转视频模型并非电影剪辑师,无法处理复杂的时序调度。当提示词要求展示五个独立的变化时,模型往往会合并、重排或忽略部分指令。
关键洞察:提示词不应是完整的剧情时间表,而应明确告诉观众:“这个镜头主要展示了什么?”
源图像已经定义了主体、构图、光照和初始状态。用户的提示词职责仅在于解释第一帧之后发生了什么变化。例如,描述“咖啡馆里的女人”几乎不提供运动指导,因为静态图像已包含该场景;而描述“女人将咖啡杯举到嘴边”则提供了一个可见的动画事件。
结构化提示词:Start-Action-End 框架
为了构建高质量的提示词,DomoAI 建议采用三段式结构:
- Start (起始状态):描述图像中已呈现的内容。
- Action (单一动作):定义一个单一的物理事件及其可见状态。
- End (结束状态):描述该动作完成后的可见结果。
示例对比:
- 低效提示:女人拿咖啡、喝掉、站起来、走到窗边、转身、微笑、放下杯子。(要求短片段完成整个场景)
- 高效提示:锁定中景。女人用右手从桌上拿起白色咖啡杯,肘部弯曲,将杯口送至唇边。停顿片刻,蒸汽上升,头发微动。暖光从左侧窗户射入。持续 5 秒,16:9 比例。无相机抖动,无额外杯子,无手部变形。
分领域优化建议
1. 角色动作 (Character Movement)
避免让角色同时完成多个复杂动作。应指定一条清晰的路径和一个可读的终点。
- Bad: 男人走路、挥手、转身、坐下。
- Better: 男人缓慢向镜头迈两步,双脚可见后停止。
- 原理: 模型接收的是可见的关节路径,而非抽象的情绪描述。
2. 产品运动 (Product Movement)
控制物体的运动轨迹,避免旋转、开启、变形等同时发生。
- Bad: 瓶子旋转、打开、溅水、变成花朵。
- Better: 瓶子在底座上顺时针旋转 90 度并停止,正面标签朝向相机。
- 注意: 若源产品几何形状有误,应先修复静态图,而非在动画中修正。
3. 相机运动 (Camera Movement)
每个镜头的相机意图应单一明确。
- Bad: 左摇、推近、环绕、拉远。
- Better: 从 medium shot 缓慢推近至 close-up,主体保持静止。
- 策略: 当主体动作本身包含多个移动部件时,使用锁定相机(Locked Camera)更容易看清手部与物体的接触细节。
4. 面部动作 (Facial Action)
避免使用“更富有情感”等模糊词汇。
- Bad: 变得情绪化且富有表现力。
- Better: 中性表情变为微小的闭口微笑,同时保持与镜头的眼神接触。
实际应用价值
对于开发者而言,DomoAI 的这篇指南提供了构建高质量 Prompt Engineering 工作流的理论依据。对于普通用户,它提供了一套可立即上手的检查清单,显著减少了因提示词冗余导致的生成失败率。通过简化指令,模型能更专注于物理模拟的准确性,从而产出更具商业价值的短视频素材。
正如 DomoAI 所言:*"不要试图在一个短片段中编排整个故事,而是专注于让一个物理事件清晰可见。"",