AI 会生成视频,为什么还剪不好?CutCraft 与 VEBench 双评测体系深度解析
随着多模态大模型(LLM)在视频生成领域的爆发,"AI 剪辑"似乎已触手可及。然而,VibePaper 近期发布的深度分析指出,当前技术仍面临严峻挑战:模型能生成素材,却难以精准执行复杂的剪辑指令。
为了解决这一痛点,VibePaper 联合学术界提出了两项关键评测体系——CutCraft与VEBench,并详细拆解了专业剪辑中的核心难点,为开发者与创作者提供了全新的评估视角。
01 两类评测,不能混成一个“会剪辑”分数
在评估 AI 剪辑能力时,必须区分两种截然不同的维度,不能简单用一个分数概括:
- CutCraft (v2):侧重于执行结果。它测试模型在接收到多镜头音视频及指定剪辑手法后,能否准确执行,并报告连贯性与剪辑要求完成度之间的差距。这回答的是“做出来的东西对不对”。
- VEBench:侧重于理解与推理。它通过模拟真实剪辑操作中的问题,考察模型选择素材、定位时间片段的能力。这回答的是“模型是否真的懂剪辑逻辑”。
这两者都不能直接证明某个模型能接管整个剪辑工程。对一次真实任务,仍需人工核对:选中的素材是否正确、入出点是否精准、声画切点是否匹配、导出结果是否与时间线一致。
02 把声画切点说清楚:J-cut 与 L-cut
专业的剪辑不仅仅是拼接,更在于声音与画面的微妙配合。Adobe 官方文档中定义的两种关键技法是 AI 必须跨越的门槛:
- J-cut:下一镜的声音先于画面进入。例如,在姐姐脸上先听见船笛声,再切到船的画面。这种手法能提前引导观众注意力。
- L-cut:上一镜的声音延续到下一镜画面中。例如,林舟离开画面后,观众仍继续听见他的话。
关键在于声音与画面不同步切换,而非简单的淡入淡出。在《末班渡轮》短片中,提前 0.5 秒进入的声音能创造悬念,而延后声音则能营造余韵。具体时长需由素材情绪决定,而非固定标准。
03 把剪辑要求拆成可执行的记录
“帮我剪得更有情绪”这类模糊指令无法直接生成高质量时间线。VibePaper 建议采用结构化编辑单模式:
- 素材编号:给源文件明确编号(如素材 A:姐姐反应镜头)。
- 时间分离:严格区分“源文件时间”与“成片时间”。源文件第 12 秒不等于成片第 12 秒。
- 区间定义:明确指定取哪个区间(如 00:12.0–00:15.0)及放置位置(如成片 00:00.0–00:03.0)。
- 声音独立:将声音作为独立轨道处理,标注进入时间(如 00:02.5 进入船笛声)。
这种“先计划,后执行”的逻辑,能有效避免 AI 幻觉导致的素材缺失或逻辑错误。
04 生成与时间线的分工边界
在实际工作中,需明确哪些交给生成,哪些留给时间线调整:
- 交给生成:需要新角色动作、地点或摄影机运动时。
- 留给时间线:已有素材正确,仅声音进入时间晚了;或反应镜头长度需微调。
此外,必须检查工具返回的交付形式:是混合好的视频、独立音频,还是可编辑工程?不同的交付形式决定了返工的成本与方式。
05 看时间线,也看最终导出的声画
验收环节建议进行三轮检查:
- 静音看画面:确认事件是否清晰,叙事逻辑是否完整。
- 只听声音:检查声音是否断裂、提前或泄露不该透露的信息。
- 完整观看:综合判断声画配合是否自然,视线引导是否顺畅。
同时,必须记录版本差异,确保每一版修改都有据可查。正如官方所言,工程里看似正确的重叠,不等于编码后的最终呈现符合预期。
常见问题 Q&A
- Q: J-cut 就是声音淡入吗?
- A: 不是。判断依据是下一镜声音是否早于画面进入,淡入只是辅助手段。
- Q: 识别出剪辑手法,是否等于能完成剪辑?
- A: 不等于。还需正确选择素材、定位时间、执行操作并核对结果。
结语
AI 视频剪辑正处于从“生成素材”向“精准执行”跨越的关键期。CutCraft 与 VEBench 的发布,标志着行业开始正视这一差距。对于开发者而言,构建具备推理能力的剪辑引擎是必经之路;对于创作者,掌握结构化工作流是驾驭 AI 工具的核心能力。
“一个偏重生成结果是否兑现剪辑要求,另一个考察理解与操作推理。它们都不能直接证明某个模型可以接管你的剪辑工程。” —— VibePaper 技术团队