Krea 2 技术报告发布:重塑生成式 AI 的探索性创作范式
在图像生成领域,扩散模型(Diffusion Models)与流匹配模型(Flow-matching Models)虽已能生成高分辨率、高保真且包含复杂文本的图像,但行业长期过度优化“可靠性”与“默认审美”,导致大多数系统收敛于狭窄的视觉风格,缺乏作为创意探索引擎的多样性。
为打破这一僵局,Krea 团队于 2026 年 6 月发布了 Krea 2 Technical Report,正式推出 Krea 2 系列基础模型。该系列模型的核心愿景是:将图像生成重新定义为一种探索性媒介,既具备跨越多种美学的表现力,又赋予创作者足够的控制权以导航不同的视觉方向。
核心架构与训练创新
Krea 2 并非简单的模型迭代,而是从数据底层到推理顶层的系统性重构:
1. 颠覆性的数据策展原则
Krea 2 摒弃了传统依赖美学评分(Aesthetic Score)和图像质量评估(IQA)模型的过滤方式,认为这会引入隐性偏见(如将艺术性的模糊误判为低质)。
- 多样性优先:构建涵盖广泛领域与风格的预训练数据集。
- 负样本利用:即使图像本身“不理想”,只要其描述准确,也能用于训练模型理解并规避特定分布,从而在推理时提供反向控制。
2. 多阶段训练管线
团队从零构建了大规模分布式训练框架,采用渐进式优化策略:
- Pretraining & Midtraining:构建基础视觉能力。
- Supervised Fine-tuning (SFT):基于富含视觉细节的密集描述进行微调。
- Preference Optimization & RL (Reinforcement Learning):通过强化学习优化输出分布,鼓励创意变异。
3. 架构效率与稳定性提升
Krea 2 基于 Diffusion Transformer (DiT) 架构,并集成了多项关键组件以加速收敛并提升稳定性:
- iREPA:改进的推理效率组件。
- Improved VAEs:优化后的变分自编码器。
- Qwen3-VL:集成先进的视觉语言模型作为文本编码器。
- GQA & Sigmoid-gated Attention:分组查询注意力与门控注意力机制,平衡训练效率与精度。
解决“意图 - 表达”鸿沟
尽管基础模型训练数据丰富,但用户输入往往简短、模糊且充满个人表达习惯,导致模型难以精准捕捉创意意图。Krea 2 为此引入了两大核心系统:
1. Prompt Expander(提示扩展器)
这是一个基于开源 LLM 训练的双阶段系统,旨在将用户简短或模糊的提示词映射为更丰富的视觉方向,同时不过度覆盖用户原意,鼓励创意探索。
2. Style-Reference System(风格参考系统)
允许用户通过图像而非仅靠文字来表达意图。用户可注入参考图像的风格或情绪,并提供对风格强度和混合权重的细粒度控制,有效解决“词不达意”的问题。
实际价值与行业影响
Krea 2 不仅仅是一个生成工具,更是一个创意生成基线。它成功地在保持高性能的同时,极大地拓宽了视觉探索的空间。根据最新数据,Krea 2 在 Artificail Analysis 文本生成图像榜单中位列前十,在独立实验室模型中排名第二。
对于开发者而言,Krea 2 提供了可解释的架构细节与开源权重,便于集成到 Agent 工作流中;对于创作者,它意味着不再受限于千篇一律的“完美”结果,而是可以主动探索风格边界,实现真正的个性化艺术表达。
"Krea 2 的设计初衷并非仅提供一个单一的 polished 默认结果,而是暴露广阔的视觉空间,并赋予用户实用的工具来在其中自由穿梭。" —— Krea 官方团队
注:模型权重与推理服务已按宽松许可协议(Permissive License)发布。