阿里 Qwen 发布 Qwen-Image-2.1:7B 参数模型原生支持 RGBA 透明背景

ADK Pexo官方 / ADK编译 2026-09-24 4 分钟 163 次浏览
速览导读 / Summary

阿里巴巴 Qwen 团队于 2026 年 9 月 20 日发布 Qwen-Image-2.1,这是一款仅 70 亿参数的紧凑图像生成与编辑模型。其核心突破在于原生支持 RGBA 透明通道,无需额外抠图步骤即可生成带透明背景的图像或从现有图像提取主体。该模型统一了生成与编辑能力,支持多参考图编辑及本地 2K 输出,可在单张消费级显卡上运行,为设计师和开发者提供了高性价比的开源替代方案。

模型参数规模 7B 紧凑的单检查点架构
输出分辨率 2048x2048 原生 2K 支持,无需超分
推理硬件 单张 RTX 4090 消费级显卡即可运行
显存峰值 ~22.7 GB 高效内存管理

Key Insights / 核心看点

  • 1 原生支持 RGBA 透明通道,生成与编辑图像时无需额外抠图步骤,直接输出带透明背景的素材。
  • 2 采用统一的 7B 参数架构,将图像生成与编辑能力合二为一,显著降低部署复杂度。
  • 3 支持多参考图编辑(最多 10 张)及区域标注,能在保持主体一致性的前提下进行精细修改。
  • 4 轻量级设计,仅需单张消费级显卡(如 RTX 4090)即可在本地流畅运行 2K 分辨率图像。

Qwen-Image-2.1:打破透明背景壁垒的 7B 图像模型

在开源图像模型领域,生成带有透明背景(Alpha 通道)的图像往往需要额外的抠图工具或复杂的后处理流程。阿里巴巴 Qwen 团队于 2026 年 9 月 20 日发布的 Qwen-Image-2.1,旨在通过架构创新解决这一痛点,将图像生成与编辑能力高度统一,并原生支持 RGBA 输出。

核心突破:原生 RGBA 与统一架构

Qwen-Image-2.1 最显著的特性是其原生透明背景支持。不同于大多数开源模型仅输出 RGB 图像,Qwen-Image-2.1 能够根据提示词直接生成包含 Alpha 通道的 RGBA 图像。这意味着设计师可以直接生成用于 UI 设计、图标或产品 mockup 的素材,无需再经过单独的背景移除(Matting)步骤。

该模型采用“紧凑且统一”的设计理念,将原本需要两个独立模型完成的任务(生成 + 编辑)压缩进单一的 70 亿参数检查点(Checkpoint)中。

关键技术特性

  • 原生透明生成与编辑:支持从文本生成透明图像,也能从 RGB 图像中提取主体为透明图层。这对于制作 Sprite、Logo 或产品切图至关重要。
  • 多参考图编辑:单次编辑可接受多达 10 张参考图像,支持通过圆圈、画笔标注或掩码(Mask)指定编辑区域,并在修改中保持人物或产品身份的一致性。
  • 本地化运行能力:基于 Diffusion-Transformer 架构,仅需 7B 参数,可在单张 RTX 3090/4090 级消费级显卡上流畅运行。

性能指标与架构细节

Qwen-Image-2.1 在保持高性能的同时,对硬件资源进行了极致优化。

指标 详情
模型规模 70 亿参数 (7B)
输出分辨率 原生 2K (最高 2048x2048)
推理速度 RTX 4090 (24GB) 下,1024x1024 生成约 18.7 秒,编辑约 21.7 秒
显存占用 峰值约 22.7 GB
架构组件 32 层单流 DiT + Qwen3-VL 8B 视觉语言编码器 + 64 通道 RGBA VAE

在架构层面,模型采用了混合粒度注意力机制和前缀 KV-Cache 复用技术,进一步提升了推理效率。其视觉生成部分由 32 层单流 DiT 构成,配合 Qwen3-VL 8B 作为视觉语言编码器处理提示词,最终通过 64 通道 RGBA VAE 进行空间压缩与解码。

生态落地与使用方式

Qwen-Image-2.1 的权重已发布在 Hugging Face 和 ModelScope,代码托管于 GitHub。目前,ComfyUI、Diffusers 和 vLLM 均提供了 Day-0 支持,开发者可迅速将其集成到现有工作流中。

对于商业开发者而言,虽然该模型目前遵循“Qwen Research License”(仅限非商业用途),但其强大的功能使其成为构建本地化 AI 创意工具的理想基座。与依赖 API 的封闭模型不同,Qwen-Image-2.1 赋予了开发者完全的数据主权和部署灵活性。

"Qwen-Image-2.1 是 Qwen 系列中最平衡且最具成本效益的成员。它不仅仅是一个模型,更是将图像生成与编辑能力统一在单一检查点中的实用工具。"

随着独立第三方基准测试结果的出炉,Qwen-Image-2.1 有望在开源图像模型领域引发新的讨论,特别是在透明背景资产生成这一细分赛道上确立其领先地位。

“Qwen-Image-2.1 is the strongest choice if you want open weights you can download and run locally, especially for transparent-background assets.”

— 官方技术团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
video · 免费+付费
★ 5.0 · 120评测
P

Pexo

AI 视频创作Agent,个人 AI 视频伙伴

Pexo 是AI 视频创作Agent,个人专属的 AI 视频伙伴。用户无需写复杂提示词,AI能自动完成脚本、分镜、配音、剪辑全流程,交付可直接发布的完整视频。Pexo 支持图生视频、文生视频、虚拟人等功能,单次最长生成2分钟。Pexo已接入OpenClaw,支持在飞书/钉钉里调用,适合制作产品广告、UGC种草、品牌宣传片、动漫短剧、音乐MV等内容。

查看 Pexo 使用教程与功能