Flux.1-Dev-SRPO 发布:120 亿参数架构与 SRPO 技术重塑 AI 图像生成
在 AI 图像生成领域,Tencent Hunyuan 研究团队携手清华大学及香港中文大学(深圳)近日重磅发布了 Flux.1-Dev-SRPO。作为该系列模型的突破性成果,Flux.1-Dev-SRPO 摒弃了传统的扩散模型架构,转而采用基于流(Flow-Based)的 Transformer 架构,结合创新的 Semantic Relative Preference Optimization (SRPO) 技术,旨在解决传统模型在平衡写实度、创意性与审美精度时的痛点。
核心突破:SRPO 技术范式转移
Flux.1-Dev-SRPO 最引人注目的特性在于其 SRPO 技术。与依赖海量数据反复训练的旧范式不同,SRPO 允许模型根据人类反馈进行实时风格调整,无需重复训练即可显著提升输出质量。
- 小样本高效微调:该技术仅需 1,500 张 图像数据集即可实现高效的风格学习与微调,大幅降低了开发门槛。
- 实时风格迭代:支持基于用户偏好的动态调整,实现了从训练到推理的无缝衔接,显著减少了计算开销。
架构与性能指标
Flux.1-Dev-SRPO 依托于 120 亿参数 的庞大神经网络,其架构设计在复杂场景理解与光影处理上展现出卓越能力。
| 指标 | 详情 |
|---|---|
| 模型架构 | Flow-Based Transformer (基于流的 Transformer) |
| 参数量 | 120 亿 (12 Billion Parameters) |
| 最高分辨率 | 1024×1024 像素 |
| 微调数据集 | 仅需 <1,500 张图像 |
| 输出格式 | JPEG, PNG |
| 推理优化 | 支持流式请求与 Base64 数据输入 |
开发者应用指南
Flux.1-Dev-SRPO 提供了完善的 API 集成方案,开发者可通过 Fal.ai、WaveSpeedAI 或 Eachlabs 等平台快速接入。
- API 接入:获取 API 凭据,支持流式请求与文件输入。
- 参数配置:
- Guidance Scale:平衡提示词遵循度与创意发散。
- Inference Steps:控制去噪步数以调节速度与细节。
- Strength Parameter:在图像转图像(Img2Img)工作流中控制变形程度。
- 工作流集成:将 API 嵌入自动化脚本或生产应用,利用 Direct-Align Sampling 技术加速训练与推理过程。
总结
Flux.1-Dev-SRPO 不仅代表了当前图像生成技术的最高水平,更通过 SRPO 技术为行业树立了新的效率标杆。对于追求高质量产出且受限于算力成本的创作者与开发者而言,这是一个极具价值的工具。