PyTorch 原生支持 AMD FP8 训练:TorchTitan 与 TorchAO 协同实现 MoE 架构性能飞跃

ADK PyTorch官方 / ADK编译 2026-09-11 5 分钟 70 次浏览
速览导读 / Summary

PyTorch 官方宣布将 PyTorch Conference 2025 上展示的 AMD Instinct GPU 优化技术全面开源至 TorchAO 和 TorchTitan。此次更新原生支持 AMD 特有的 FNUZ (e4m3fnuz) FP8 格式,解决了此前因数值格式不匹配导致的静默错误问题。针对 MoE 架构,通过融合 Triton 量化内核与分组 GEMM 优化,DeepSeek-V3 671B 模型在 FP8 下实现了高达 89% 的量化开销回收,整体训练吞吐量提升显著,标志着 PyTorch 在异构 GPU 生态中的训练效率达到新高度。

Llama3-8B 吞吐增益 +13.4% 相比 BF16 训练
DeepSeek-V3 单层加速 6.2x MoE 层推理/训练速度
量化开销回收率 89% DeepSeek-V3 671B MoE 架构
端到端训练加速 +17% DeepSeek-V3 671B 整体

Key Insights / 核心看点

  • 1 原生支持 AMD Instinct GPU 特有的 FNUZ (e4m3fnuz) FP8 格式,通过自动检测机制彻底解决了静默数值错误问题。
  • 2 针对 MoE 架构实现分组 GEMM 与 Triton 内核融合,在 DeepSeek-V3 671B 上成功回收 89% 的 FP8 量化开销。
  • 3 Llama3-8B 密集模型在 FP8 训练下相比 BF16 实现 13.4% 的吞吐量提升,且峰值内存占用几乎一致。
  • 4 TorchAO 与 TorchTitan 协同优化,为 MI300/MI350 系列 GPU 贡献了 Blockwise 等高级量化内核支持。

PyTorch 原生支持 AMD FP8 训练:TorchTitan 与 TorchAO 协同实现 MoE 架构性能飞跃

在 PyTorch Conference 2025 上,PyTorch 团队展示了利用 AMD Primus-Turbo 库在 Instinct 集群上实现千卡线性扩展的能力。如今,这些关键的 AMD 优化已全面开源并合并至上游 PyTorch 生态,使得 TorchTitan 能够原生支持 AMD Instinct GPU,并开箱即用地提供具有竞争力的 FP8 训练性能。

核心突破:从格式兼容到 MoE 架构加速

此次更新的核心在于解决了 AMD GPU 特有的 FNUZ (Finite, No NaN, Unsigned Zero) 数值格式兼容性问题,并针对 Mixture-of-Experts (MoE) 架构进行了深度的内核优化。

1. 原生 AMD FP8 格式支持

此前,TorchAO 默认使用 NVIDIA 的 FP8 格式,导致在 AMD Instinct GPU 上因最大数值(Max Value)差异(AMD 为 240,NVIDIA 为 4369)而产生静默错误。激活值被截断,梯度损坏,且由于无 NaN/Inf 编码,错误未被捕获。

  • 自动检测机制:TorchAO 新增硬件自动检测功能,自动选择正确的 FP8 数据类型和最大值,无需手动硬编码。
  • 精度修复:修复了平台特定的损失基准线,确保 FNUZ 数值逻辑的正确性。
  • 内核扩展:为 MI300 和 MI350 GPU 贡献了 Blockwise 量化内核支持,支持 Tensorwise、Rowwise、Blockwise 及 MXFP8 四种量化策略。

2. MoE 架构的分组 GEMM 优化

对于 DeepSeek-V3 等 MoE 模型,FP8 量化带来了显著的开销。团队通过以下手段大幅回收了这部分开销:

  • 分组 GEMM 启用:在 ROCm 上启用分组 GEMM,适配 AMD 后端,实现单次 Launch 完成量化与分发。
  • Triton 内核融合:将 FP8 量化流水线中的 absmax 计算、Scale 推导、Clamp 和 Cast 步骤融合为单个 Triton 内核,消除了中间张量对高带宽内存 (HBM) 的占用。
  • 性能提升:
    • DeepSeek-V3 671B:单个 MoE 层速度提升 6.2 倍 (7,290µs → 1,170µs)。
    • 整体吞吐:端到端训练速度提升 17%,成功回收 89% 的 FP8 量化开销。

3. 密集模型性能增益

在 Llama3-8B 等密集模型上,通过行向 FP8 (Rowwise FP8) 训练,相比 BF16 实现了 13.4% 的吞吐量提升。虽然峰值内存占用相似,但得益于 AMD GPU 更快的 FP8 矩阵核心,计算效率显著提升。

实际应用价值

  • 开发者:无需额外配置即可在 AMD Instinct 集群上运行最新的大模型训练任务,享受与 NVIDIA 相当甚至更优的 FP8 训练效率。
  • 企业用户:降低了使用 AMD GPU 进行大规模模型训练的成本,特别是在处理超大规模 MoE 模型时,显著缩短了训练周期。
  • 生态影响:进一步打破了单一硬件生态的垄断,推动了 PyTorch 在异构计算领域的标准化与统一性。

“我们将 PyTorch Conference 上展示的 AMD 优化全面开源,旨在让所有开发者都能平等地利用 AMD Instinct GPU 的强大算力,特别是在 FP8 训练这一关键领域。” —— PyTorch 官方团队

关键技术指标

指标 数值/描述
Llama3-8B 吞吐提升 +13.4% (FP8 vs BF16)
DeepSeek-V3 单层加速 6.2 倍 (7,290µs → 1,170µs)
MoE 量化开销回收 89%
端到端训练加速 +17%
支持硬件 AMD Instinct (MI300X, MI325X, MI350X)
支持格式 e4m3fnuz (FNUZ)

“We have since upstreamed those AMD optimizations so TorchTitan supports AMD Instinct(™) GPUs directly, with competitive FP8 performance out of the box.”

— PyTorch 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能