可灵 AI 发布 IMAGE 3.0:多参考图精准编辑与 2K/4K 原生输出

ADK 可灵AI官方 / ADK编译 2026-09-24 4 分钟 76 次浏览
速览导读 / Summary

可灵 AI 正式推出 IMAGE 3.0 模型,针对复杂图像编辑场景进行深度升级。新模型支持最多 10 张参考图引导,实现对象替换、背景重绘、姿态表情调整及重绘等精细操作。相比旧版,IMAGE 3.0 在保持原图风格一致性的同时,显著提升了编辑精度,并新增 IMAGE 3.0 Omni 提供原生 2K/4K 高分辨率输出,满足专业创作需求。

参考图数量上限 10 张 支持多参考图协同编辑
最高输出分辨率 4K (原生) IMAGE 3.0 Omni 版本支持
核心功能 多参考图引导 + 精准局部编辑 平衡创意变更与视觉连贯性

Key Insights / 核心看点

  • 1 IMAGE 3.0 支持最多 10 张参考图,实现多源视觉元素的精准融合与引导。
  • 2 新增 IMAGE 3.0 Omni 版本,提供原生 2K/4K 高分辨率输出,满足专业创作需求。
  • 3 显著提升编辑精度,在修改对象、背景或表情时,能完美保留原图的光影、材质与风格一致性。
  • 4 支持复杂的自然语言指令,实现对象替换、重绘、姿态调整等高级编辑功能。

可灵 AI 发布 IMAGE 3.0:多参考图精准编辑与 2K/4K 原生输出

在 AI 图像编辑领域,如何在不破坏原图整体氛围的前提下进行局部或全局修改,一直是开发者与创作者关注的核心痛点。近日,可灵 AI(Kling AI)在其官方博客中重磅发布了其最新图像生成模型 IMAGE 3.0,该版本针对复杂编辑场景进行了深度重构,显著提升了提示词理解能力与多参考图协同编辑的精度。

核心突破:从“重绘”到“精准微调”

IMAGE 3.0 的核心设计理念在于平衡“创意变更”与“视觉连贯性”。传统的 AI 编辑往往在修改对象后导致光影、纹理或风格的不自然割裂。而 IMAGE 3.0 通过引入更强大的上下文理解机制,能够在执行对象替换、背景更换、姿态调整(Pose)及表情修改(Expression)时,智能保留原图的主体特征、光照环境及材质质感。

多参考图引导机制

本次升级最显著的功能是 多参考图(Multi-Reference)支持。在 IMAGE 3.0 中,用户不再受限于单一的文本提示词,系统允许同时输入 最多 10 张参考图像。这些参考图可用于引导特定细节,例如:

  • 人物/产品:指定具体的服装款式或产品材质。
  • 背景/构图:提供目标场景的构图或风格参考。
  • 视觉风格:统一整体色调或艺术风格。

这种机制使得“图像到图像(Image-to-Image)”的工作流更加灵活,用户可以将多个分散的创意元素融合到一张图中,同时确保关键主体(Key Subjects)的可识别性。

技术亮点与性能指标

可灵 AI 在技术架构上对 IMAGE 3.0 进行了多项关键优化,使其在复杂编辑任务中表现卓越:

  • 高精度局部编辑:支持将物体缩小、颜色重绘(如将蓝色杯子变为红色)、表情微调(如从严肃变为大笑)等操作,同时最大程度减少对周围区域(如人脸、产品细节)的干扰。
  • 原生高分辨率输出:推出了 IMAGE 3.0 Omni 版本,支持 原生 2K 和 4K 分辨率输出。这对于电商产品图、广告创意及印刷级素材的需求至关重要,避免了传统模型生成后需二次 Upscale 带来的细节损失。
  • 自然语言指令理解:能够准确解析复杂的自然语言指令,例如“将背景换成雨天,但保持人物表情不变”,实现了更智能的场景重构。

应用场景与价值

IMAGE 3.0 的发布为不同领域的创作者提供了新的工具选择:

  1. 电商与零售:无需重新拍摄,即可通过参考图快速更换商品背景、调整灯光或修改模特姿态,大幅降低拍摄成本。
  2. 影视与游戏:利用多参考图功能,快速生成符合特定风格的角色概念图或场景预演,提升前期制作效率。
  3. 专业修图:在保留原图光影逻辑的基础上进行局部重绘或风格迁移,实现“所见即所得”的高质量编辑。

正如可灵 AI 团队在官方博客中所强调的:

"IMAGE 3.0 的设计初衷并非完全重建图像,而是为了在保留原图重要细节(包括主体、整体风格、光照和纹理)的同时,让针对性的编辑与场景其余部分融合得更加自然。"

随着 IMAGE 3.0 及 Omni 版本的上线,可灵 AI 进一步巩固了其在复杂图像生成与编辑领域的领先地位,为开发者提供了更强大的 API 能力,同时也为用户打开了通往专业级图像创作的大门。

“IMAGE 3.0 的设计初衷并非完全重建图像,而是为了在保留原图重要细节(包括主体、整体风格、光照和纹理)的同时,让针对性的编辑与场景其余部分融合得更加自然。”

— 可灵 AI 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo AI 发布无拍摄电商视频广告 SOP:单图生成 12 变体测试矩阵

AdsTurbo AI 推出针对独居电商卖家的‘无拍摄视频广告工作流’,旨在通过单一产品图和核心卖点,快速生成 12 种不同变体的短视频广告。该 SOP 强调结构化输入与模块化脚本,利用 3x2x2 组合矩阵实现高效 A/B 测试,帮助卖家在不依赖传统拍摄团队的情况下,快速验证不同钩子(Hook)、证明点(Proof)和行动号召(CTA)的转化率,大幅降低试错成本。

AdsTurbo AI官方 / ADK编译 3 分钟
image · 免费+付费
★ 5.0 · 120评测
�

可灵AI

快手推出的AI图像和视频创作平台

可灵AI是快手推出的AI图像和AI视频创作平台,提供网页版和手机APP。支持AI图片和AI视频生成功能,AI图片生成支持文生图和图生图,用户可以输入描述或上传图片,AI据此生成新的图片。AI视频生成能将文本或图片转化为生动视频,具备视频延长和高清画质升级特性。用户能自定义首尾帧生成视频,享受丰富的视频编辑功能,如多种镜头控制选项。提供了多人协同创作的平台,支持最多5人同时在一个画布内进行创作,实现素材共享、实时联动和一键导出,通过“灵动画布”,创作者可以将零散的创意想法转化为文本、图像或视频节点,高效串联成完整的视觉作品。 可灵AI最新上线的AI数字人功能,支持用户上传一张角色图片和一段文字或音频,能生成高清数字人视频,基于Transformer的DiT架构,能实现口型精准同步与情绪动作精细控制,支持多种角色和语言,画质1080p,帧率48FPS,成本低至0.12元/秒。 可灵数字人 2.0 已正式上线,只需三步,上传角色图、添加配音、描述表现,即可生成表现力十足的数字人视频。此次升级支持手部和口型精准控制,单次生成最长可达 5 分钟,知识讲解和表演都能生动呈现。

查看 可灵AI 使用教程与功能