Google Veo 3 发布:PromptHero 详解电影级视频生成提示词设计指南
DeepMind 于 2025 年 5 月正式发布了 Google Veo 3,这不仅是 AI 视频生成技术的重大飞跃,更代表了一种全新的创作范式。与早期仅能“可视化文本”的模型不同,Veo 3 被设计为一台完整的电影制作引擎,具备原生音频生成、逼真的物理运动模拟以及高达 4K 的分辨率输出能力。
根据 PromptHero 的最新技术指南,要有效驾驭 Veo 3,提示词(Prompt)的设计逻辑必须发生根本性转变:它们不再是简单的场景描述,而必须是方向性脚本(Directional Scripts),如同导演向摄影组发出的具体指令。
1. 理解 Veo 3 的核心能力
Veo 3 在文本理解上展现了四个关键优势,这决定了提示词设计的方向:
- 精确指令遵循:模型能准确执行复杂指令。例如,描述“巴黎咖啡馆内年轻艺术家素描,窗外晨光映照在湿漉漉的石板路上。镜头:从窗户缓慢推近”,模型不仅能还原场景,还能捕捉氛围、视角与基调。
- 原生音频生成:Veo 3 能够生成同步的声音。用户只需输入“东京拥挤的拉面店。音频:滋滋作响的锅具、日语交谈声、老式收音机里的柔和爵士乐”,模型即可构建视听一体的连贯序列。
- 物理模拟:对物理描述极为敏感。如“丝绸旗帜在山地风中飘扬,慢动作背光拍摄”,能产生流畅可信的运动效果。
- 电影语言理解:模型天然理解电影术语,如“跟拍(Tracking shot)”、“过肩镜头(Over-the-shoulder)”、“摇臂(Crane-up)”等。
2. 构建强效提示词的解剖学
一个强大的 Veo 3 提示词应覆盖所有电影维度:主体、背景、动作、风格、镜头、构图、氛围与音效。
优秀示例:
“一位中年男子独自坐在雨后的咖啡馆。雨滴划过窗户,霓虹灯倒影在他脸上闪烁。镜头:穿过玻璃缓慢推近。氛围:冷蓝色灯光混合温暖的咖啡馆色调。音频:静谧的爵士乐,远处雷声滚动,杯子轻碰声。”
这种结构赋予了模型视觉、情感与听觉的清晰度,确保最终视频与创作者的愿景高度对齐。
3. 结构化思维的重要性
Veo 3 并非通过关键词匹配工作,而是通过理解元素间的关系。模糊的提示如“一只猫在房间里”往往导致随机元素生成;而详细的描述如“一只虎斑猫穿过充满阳光和漂浮尘埃的杂乱艺术家工作室”则提供了明确的意图与方向。
- 主体、背景与动作:定义发生了什么。
- 风格、镜头与构图:定义如何拍摄。
- 氛围与音效:定义感觉如何。
三者结合,将文本转化为具有叙事张力的短片脚本。
4. 镜头语言的直接控制
Veo 3 能够直接通过文本指挥镜头运动,这是其最先进的能力之一。用户可以使用“摇摄(Pan)”、“仰拍(Tilt)”、“推镜头(Dolly in)”、“环绕镜头(Orbit shot)”或“手持摄影(Handheld camera)”等术语。
实战案例:
“两名战士在雨夜街头决斗,火花四溅。镜头:手持环绕快速拍摄,随后慢动作特写一击。风格:粗粝的动作片。氛围:霓虹反射,大雨。音频:金属撞击声、雨打沥青声、激烈的鼓点。”
在这里,文字即镜头运动,直接决定了画面的能量与情绪。
5. 高级电影级控制
除了镜头运动,用户还可以通过景别(特写、全景)、镜头类型(微距、浅景深、广角)、光照(黄金时刻、低键照明)和音效提示来微调输出。
关键技巧:
- 正向表述:避免使用“no”或“don't”,而是用正向描述替代。例如,不说“没有汽车”,而说“月光下的空石板路”。
- 明确音效:Veo 3 会生成对白、音效和音乐。例如,“艾玛:‘我们不该在这里……' 音频:远处雷声,高草丛中的微风声”。
6. 实用工作流建议
高质量提示词的创作是一个迭代过程。首次尝试往往不完美,创作者应通过调整措辞、增加感官细节或改变镜头方向来不断精炼每一版输出,直至达到理想的电影质感。
“在 Veo 3 时代,提示词就是你的故事板。越具体的指令,最终视频就越能还原你的内心影像。”