可灵 AI 发布 IMAGE 3.0 与 VIDEO 3.0:多参考图控图与多镜头视频生成能力升级

ADK 可灵AI官方 / ADK编译 2026-09-14 4 分钟 82 次浏览
速览导读 / Summary

可灵 AI(Kling AI)于 2026 年 9 月推出 IMAGE 3.0 与 VIDEO 3.0 双模型,显著强化内容创作工作流。IMAGE 3.0 支持基于最多 10 张参考图的视觉一致性控制,实现局部微调与风格延续;VIDEO 3.0 引入原生音频、多角色对话及多镜头(Multi-Shot)生成能力,支持中英日韩西多语种。此次更新旨在解决创作者在角色一致性、镜头调度与声音合成方面的痛点,推动 AI 视频从单点生成向完整叙事资产转变。

参考图支持数 10 张 多参考图视觉锚定
原生音频语言 6 种 中英日韩西多语种支持
视频生成时长 3-15 秒 灵活单次生成时长

Key Insights / 核心看点

  • 1 IMAGE 3.0 支持最多 10 张参考图,实现角色与风格的精准锚定及局部微调
  • 2 VIDEO 3.0 引入原生音频生成,支持中英日韩西六国语言及多口音
  • 3 多镜头(Multi-Shot)生成能力,支持单次生成包含运镜与转场的完整视频
  • 4 3-15 秒灵活时长,支持多角色对话与复杂场景的叙事生成

可灵 AI 发布 IMAGE 3.0 与 VIDEO 3.0:多参考图控图与多镜头视频生成能力升级

在 2026 年的内容创作生态中,单一工具难以覆盖从研究、写作到视觉生成、剪辑及发布的全链路需求。可灵 AI(Kling AI)近日在其官方博客中重点展示了其核心视觉模型的最新迭代——Kling IMAGE 3.0 与 Kling VIDEO 3.0。此次更新不仅巩固了可灵在 AI 视频生成领域的领先地位,更通过精细化的控制能力,解决了长期困扰创作者的角色一致性、多镜头调度及原生音频生成的难题。

核心突破:从“生成”到“可控创作”

1. Kling IMAGE 3.0:基于多参考图的视觉锚定

IMAGE 3.0 在图像生成方面实现了质的飞跃,核心在于引入了多参考图(Multi-Reference)机制。创作者不再需要重新绘制整个画面来调整细节,而是可以通过最多 10 张参考图,精准锚定角色的外貌特征、品牌色调、笔触风格甚至构图逻辑。

  • 局部微调能力:用户可使用自然语言指令(如“将镜头切换为特写”、“改变光照为暖色调”),在不重绘全图的前提下完成细节优化。
  • 风格一致性:参考图不仅能定义主体,还能传递色彩偏好与艺术风格,确保生成的图像在系列内容中保持视觉统一,适用于角色设计、产品渲染或故事板制作。

2. Kling VIDEO 3.0:原生音频与多镜头叙事

VIDEO 3.0 将可灵的视频生成能力从单纯的“画面运动”扩展为完整的“视听叙事”。

  • 原生音频生成(Native Audio):模型能够根据画面内容自动生成包含对白、环境音及音效的完整音频轨道,支持中英日韩西六国语言,并具备口音与方言适配能力。
  • 多镜头生成(Multi-Shot):这是本次更新的杀手锏功能。创作者无需后期剪辑,即可通过提示词规划镜头的切换、推拉摇移及时长。例如,系统可自动完成从全景到特写的转场,并让不同角色在同一场景中对话。
  • 长时与复杂场景:支持 3 至 15 秒的灵活时长,能够生成包含复杂交互与多角色互动的短剧片段。

实际应用场景

此次更新特别针对内容创作者、营销团队及品牌方,解决了以下具体痛点:

  1. 角色一致性难题:在制作系列短视频或广告时,IMAGE 3.0 允许通过参考图固定主角形象,避免每次生成都出现“换脸”或特征漂移。
  2. 视频叙事效率:VIDEO 3.0 的多镜头功能让创作者能够直接生成包含对话和运镜的完整片段,大幅减少了“AI 生成素材 + 人工剪辑”的工作量。
  3. 多语言本地化:原生音频支持多语种,使得跨国品牌在制作本地化视频内容时,无需依赖外部配音工具。

总结

可灵 AI 此次发布的 IMAGE 3.0 和 VIDEO 3.0,标志着其从“工具型”AI 向“创作型”AI 的跨越。通过引入多参考图控制和原生音频多镜头生成,可灵正在构建一个更接近传统影视制作流程的 AI 工作流,为 2026 年的视觉内容生产提供了强有力的基础设施。

“我们的目标是让 AI 成为创作者的完整伙伴,而不仅仅是生成素材的工具。” —— 可灵 AI 官方团队


关键指标 (Metrics)

  • 参考图数量:支持最多 10 张参考图进行视觉锚定
  • 多镜头支持:支持 Multi-Shot 单帧生成多镜头序列
  • 原生音频语言:支持中文、英文、日文、韩文、西班牙文及多口音
  • 视频时长:单次生成 3~15 秒

核心亮点 (Key Highlights)

  • 多参考图控图:基于 10 张参考图实现角色与风格的高度一致性
  • 原生音频生成:内置多语种对白与环境音效合成能力
  • 多镜头叙事:支持单次生成包含运镜与转场的完整视频片段
  • 局部微调优化:无需重绘即可调整构图、光影与镜头视角

“Visual content may begin with a prompt, a reference image, a product shot, a character, or a rough idea that has not yet become a finished asset. Kling AI covers both still-image creation and video generation through two separate models, Kling IMAGE 3.0 and Kling VIDEO 3.0.”

— Kling AI Official Blog

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
image · 免费+付费
★ 5.0 · 120评测
�

可灵AI

快手推出的AI图像和视频创作平台

可灵AI是快手推出的AI图像和AI视频创作平台,提供网页版和手机APP。支持AI图片和AI视频生成功能,AI图片生成支持文生图和图生图,用户可以输入描述或上传图片,AI据此生成新的图片。AI视频生成能将文本或图片转化为生动视频,具备视频延长和高清画质升级特性。用户能自定义首尾帧生成视频,享受丰富的视频编辑功能,如多种镜头控制选项。提供了多人协同创作的平台,支持最多5人同时在一个画布内进行创作,实现素材共享、实时联动和一键导出,通过“灵动画布”,创作者可以将零散的创意想法转化为文本、图像或视频节点,高效串联成完整的视觉作品。 可灵AI最新上线的AI数字人功能,支持用户上传一张角色图片和一段文字或音频,能生成高清数字人视频,基于Transformer的DiT架构,能实现口型精准同步与情绪动作精细控制,支持多种角色和语言,画质1080p,帧率48FPS,成本低至0.12元/秒。 可灵数字人 2.0 已正式上线,只需三步,上传角色图、添加配音、描述表现,即可生成表现力十足的数字人视频。此次升级支持手部和口型精准控制,单次生成最长可达 5 分钟,知识讲解和表演都能生动呈现。

查看 可灵AI 使用教程与功能