可灵 AI 发布 Kling Video 3.0:多镜头编排与原生音频驱动的视频生成新范式

ADK 可灵AI官方 / ADK编译 2026-09-07 3 分钟 53 次浏览
速览导读 / Summary

可灵 AI 正式推出 Kling Video 3.0,针对创作者痛点,引入原生音频生成与多镜头(Multi-Shot)编排功能。新工具支持从文本或图像出发,通过结构化提示词(Prompt Formula)精准控制画面运动、镜头语言及角色对白。开发者可利用 Custom Multi-Shot 功能精细规划分镜序列,结合 Native Audio 实现方言与音效的无缝融合,大幅降低高质量 AI 视频的制作门槛。

版本 Kling Video 3.0 架构升级,新增多镜头编排与音频生成能力
音频支持 Native Audio 支持多语言、方言及精确音效指令
分镜控制 Custom Multi-Shot 允许用户自定义 3-6 个独立镜头的时长与内容

Key Insights / 核心看点

  • 1 引入 Multi-Shot 与 Custom Multi-Shot 功能,支持用户自定义分镜序列,实现从单镜头到复杂叙事结构的跨越。
  • 2 首发 Native Audio 原生音频生成,支持对白、音效及配乐的精准指令,并兼容多种语言与地道方言。
  • 3 优化结构化提示词公式,将‘场景 + 主体 + 运动 + 音频’模块化,显著提升视频生成的可控性与一致性。
  • 4 支持图像转视频(Image-to-Video)与文本转视频(Text-to-Video)双模式,保留视觉参考的同时增强动态表现力。

可灵 AI 发布 Kling Video 3.0:多镜头编排与原生音频驱动的视频生成新范式

随着 AIGC 视频工具的普及,许多创作者在将创意转化为屏幕内容时仍面临挑战:动作描述模糊、主体一致性难以维持、以及节奏把控不足。为了解决这些问题,可灵 AI(Kling AI)于 2026 年 9 月 7 日发布了 Kling Video 3.0 版本。此次更新不仅优化了文本转视频(Text-to-Video)和图像转视频(Image-to-Video)的核心能力,更重磅引入了原生音频生成(Native Audio)多镜头编排(Multi-Shot)功能,标志着 AI 视频创作从“单点生成”向“完整叙事”的跨越。

核心突破:从单镜头到分镜叙事

Kling Video 3.0 最大的革新在于解决了长视频创作中的“镜头衔接”难题。以往,用户往往只能生成单一视角的片段,难以构建连贯的视觉故事。新版本通过 Multi-Shot 功能,允许模型根据提示词自动规划镜头过渡、构图变化及角度切换。

  • Multi-Shot 自动编排:模型能理解提示词中的多镜头指令,自动安排镜头间的转场与节奏。
  • Custom Multi-Shot 精细控制:对于专业创作者,系统提供了自定义多镜头模式。用户可预先定义 3-6 个独立分镜(如低角度跟拍、特写、第一人称视角等),并精确控制每个镜头的时长与内容,完美适配品牌广告、短视频营销及旅行 Vlog 等场景。

技术亮点:结构化提示词与原生音频

1. 结构化提示词公式 (Structured Prompt Formula)

Kling Video 3.0 提供了一套高效的提示词构建公式:场景 + 主体 + 运动 + 音频 + 风格/情绪/运镜。这种结构化输入显著提升了生成的可控性。

  • 视觉层面:明确指定主体动作(如“骑手骑行”)与运镜方式(如“镜头后拉”)。
  • 听觉层面(Native Audio):这是本次更新的杀手锏。系统支持在提示词中直接指令生成对白、环境音及配乐。
    • 对白指令:支持 [角色标签,情绪,语速,语调] 格式,例如:[Rider, relaxed, slow tone] says, "Nothing beats this stretch of coast."
    • 音效指令:支持具体声源描述,如 [Motorcycle] accelerates + [Sound Effect: engine rumble]
    • 方言与口音:原生支持多种语言及地道方言,确保音频的自然度。

2. 实际应用价值

对于开发者与内容创作者而言,Kling Video 3.0 将视频制作流程从“试错生成”转变为“精准编排”:

  1. 降低创作门槛:无需复杂的后期剪辑,直接在生成阶段完成分镜设计与音频合成。
  2. 提升商业价值:通过 Custom Multi-Shot 功能,可快速产出符合广告节奏的复杂镜头序列,大幅缩短素材制作周期。
  3. 增强沉浸感:原生音频与画面的完美同步,消除了传统 AI 视频“有图无声”或“音画不同步”的割裂感。

总结

Kling Video 3.0 不仅是模型算力的升级,更是创作工作流的重构。通过多镜头编排原生音频的双重加持,可灵 AI 正在重新定义 AI 视频生成的边界,让创作者能够像导演一样,通过文字指令直接构建完整的视听世界。


注:本文基于可灵 AI 官方技术博客编译。

A little planning before generation gives the creative process more direction. With Kling Video 3.0, you can take an idea through generation, review, and refinement.

Kling AI Official Blog

同主题深度资讯

查看更多 →
模型发布 2026-09-08

Framer AI 发布 CMS List Field:重构重复内容管理,赋能动态网站构建

Framer 于 2026 年 9 月正式发布 CMS List Field,彻底革新了重复内容(如 FAQ、产品特性)的管理方式。该更新引入原生列表字段,支持通过 Framer Agent 一键迁移旧数据,并优化了编辑器的内容复用与排序能力。此次更新不仅解决了垂直视频嵌入等长期存在的 Bug,还显著提升了大型 CMS 集合的滚动性能,为开发者提供了更强大的动态内容构建工具。

Framer AI官方 / ADK编译 4 分钟
模型发布 2026-09-08

Ajelix 自研 GPU 基础设施并推出企业级 Agentic 平台,解决数据主权与生产落地难题

Agentic AI 平台 Ajelix 宣布投资自建 GPU 计算基础设施,并正式发布面向企业的 Ajelix Enterprise Platform。此举旨在解决企业级 AI 落地中数据不可控、审计困难及中断风险等痛点。新平台提供从智能体编排、RAG 知识库到严格治理的全栈能力,支持私有化部署,助力企业将 AI 从实验阶段平稳过渡到生产运营。

Ajelix官方 / ADK编译 4 分钟
AI 工具 2026-09-08

DreamFace 发布 AI 直播生成器:零设备打造虚拟主播,重塑内容创作流程

DreamFace 正式推出 AI 直播生成功能,彻底消除传统直播对相机、灯光及推流软件的依赖。用户仅需上传照片或选择虚拟形象,配合脚本即可在数分钟内生成具备真实直播节奏与能量的视频。该工具支持游戏、带货、播客等多种模板,让创作者无需露脸即可测试新内容形式,大幅降低内容生产的门槛与试错成本。

DreamFace官方 / ADK编译 3 分钟
技术解读 2026-09-08

Accio Work 发布 F1 电视转播技术深度解析:8K 流媒体与超低延迟架构揭秘

Accio Work 深度编译 F1 TV 如何永久改变体育转播的历程,聚焦于日本市场策略、8K 流媒体技术革新及超低延迟架构。文章揭示了现代体育直播对带宽、编码及 CDN 的极致要求,包括 45% 的带宽消耗增长和亚 200ms 延迟标准。同时探讨了数字观众如何驱动 23 亿美元的周边销售,为开发者与架构师提供了从传统广播向数字化、智能化转型的宝贵案例与技术指标参考。

Accio Work官方 / ADK编译 3 分钟
image · 免费+付费
★ 5.0 · 120评测

可灵AI

快手推出的AI图像和视频创作平台

可灵AI是快手推出的AI图像和AI视频创作平台,提供网页版和手机APP。支持AI图片和AI视频生成功能,AI图片生成支持文生图和图生图,用户可以输入描述或上传图片,AI据此生成新的图片。AI视频生成能将文本或图片转化为生动视频,具备视频延长和高清画质升级特性。用户能自定义首尾帧生成视频,享受丰富的视频编辑功能,如多种镜头控制选项。提供了多人协同创作的平台,支持最多5人同时在一个画布内进行创作,实现素材共享、实时联动和一键导出,通过“灵动画布”,创作者可以将零散的创意想法转化为文本、图像或视频节点,高效串联成完整的视觉作品。 可灵AI最新上线的AI数字人功能,支持用户上传一张角色图片和一段文字或音频,能生成高清数字人视频,基于Transformer的DiT架构,能实现口型精准同步与情绪动作精细控制,支持多种角色和语言,画质1080p,帧率48FPS,成本低至0.12元/秒。 可灵数字人 2.0 已正式上线,只需三步,上传角色图、添加配音、描述表现,即可生成表现力十足的数字人视频。此次升级支持手部和口型精准控制,单次生成最长可达 5 分钟,知识讲解和表演都能生动呈现。

查看 可灵AI 使用教程与功能