PyTorch 2.13 发布:FlexAttention 登陆 Apple Silicon,分布式训练与内存效率双重突破

ADK PyTorch官方 / ADK编译 2026-09-11 5 分钟 137 次浏览
速览导读 / Summary

PyTorch 2.13 正式推出,核心突破包括 FlexAttention 首次支持 Apple Silicon(MPS),在稀疏注意力模式下相比 SDPA 提升高达 12 倍;新增 nn.LinearCrossEntropyLoss 将大词表模型训练峰值显存降低 4 倍;分布式训练引入 torchcomms 后端并优化 FSDP2 通信重叠。此外,CuTeDSL 为 Inductor 提供第二条高性能代码路径,并全面支持 Python 3.15 及多平台硬件加速。

FlexAttention MPS 加速比 ~12.3x 稀疏注意力模式 vs SDPA
显存峰值降低 4x 大词表模型训练场景
确定性开销 <1% 长序列长度下的性能损耗
版本迭代 v2.13 基于 v2.12 的重大架构升级

Key Insights / 核心看点

  • 1 FlexAttention 首次支持 Apple Silicon (MPS),稀疏注意力模式速度提升高达 12 倍
  • 2 新增 nn.LinearCrossEntropyLoss,大词表模型训练峰值显存降低 4 倍
  • 3 分布式训练引入 torchcomms 后端并优化 FSDP2 通信重叠,提升集群稳定性与吞吐量
  • 4 全面支持 Python 3.15 及多平台硬件加速(ROCm, Arm, Intel XPU)
  • 5 FlexAttention CUDA 后端实现确定性反向传播,确保梯度可复现

PyTorch 2.13 发布:多端性能飞跃与分布式架构升级

PyTorch 团队于 2026 年 9 月 11 日发布了备受瞩目的 PyTorch 2.13 版本。此次更新不仅标志着 PyTorch 从“研究优先”框架向“生产级统一平台”的进一步演进,更在跨硬件性能优化、大模型训练效率及分布式系统稳定性上取得了实质性突破。

本次版本共包含 3,328 个提交,由 526 位贡献者共同完成,重点解决了长序列训练中的确定性难题、大模型显存瓶颈以及多设备通信效率问题。

核心亮点与技术突破

1. FlexAttention 登陆 Apple Silicon,跨平台性能统一

PyTorch 的 FlexAttention 统一 API 首次支持 Metal/MPS 后端。这一更新允许开发者仅需编写两行 Python 代码,即可自动编译出针对稀疏注意力模式(Sparse Attention)的高性能 Metal 内核。

  • 性能飞跃:在长序列稀疏注意力场景下(如 1×8×32768×64 形状,256 元素滑动窗口),FlexAttention 相比标准 SDPA 实现了 ~12.3 倍 的速度提升;在中等密度场景下也达到 4.15 倍 加速。
  • 架构优化:通过手写 Metal 计算内核,消除了 MPSGraph 框架的编译与调度开销,显著降低了内核启动延迟。

2. 大模型训练显存效率革命性提升

针对大词表语言模型(Large-Vocabulary LLMs)训练痛点,PyTorch 2.13 引入了全新的 nn.LinearCrossEntropyLoss 算子。

  • 机制创新:该算子将最终的预测操作与损失计算操作融合,减少了中间张量的生成与传输。
  • 实测数据:在大规模训练场景下,峰值 GPU 显存占用降低了高达 4 倍,极大地缓解了显存带宽压力,使得在有限硬件上训练更大模型成为可能。

3. 分布式训练:确定性梯度与通信优化

  • 确定性反向传播:为 CUDA 端的 FlexAttention Flash 后端引入了确定性反向路径,解决了原子操作导致的梯度不可复现问题。在长序列长度下,性能损耗低于 1%,实现了“免费”的确定性。
  • torchcomms 新后端:新增 torchcomms 通信后端,显著提升了大规模集群训练的容错性、可扩展性和可调试性。
  • FSDP2 通信重叠:通过专用进程组,实现了 reduce-scatter 和 all-gather 通信的重叠,进一步提升了分布式训练吞吐量。

4. 生态与平台支持扩展

  • Python 3.15 原生支持:正式支持 Python 3.15 的 wheel 包,包括对 free-threaded 3.15t 的兼容。
  • 多硬件加速:ROCm 集成 AOTriton 0.12b,Arm 平台新增 Armv9-A 的 torch.compile 目标,Intel XPU 暴露新的设备遥测 API。
  • CuTeDSL 后端:为 Inductor 提供了第二条高性能代码路径,使其能生成类似 CUTLASS 级别的 GEMM 内核。

开发者价值与应用场景

PyTorch 2.13 的发布为开发者提供了更强大的工具集:

  1. 降低迁移成本:FlexAttention 在 Apple Silicon 上的落地,使得跨平台(CUDA/MPS)的稀疏注意力模型迁移变得极其简单,无需为不同硬件编写自定义内核。
  2. 提升训练效率:对于正在探索大词表模型或长上下文模型的团队,nn.LinearCrossEntropyLoss 和 FSDP2 的优化将直接转化为更快的训练速度和更低的硬件成本。
  3. 增强科研严谨性:确定性梯度的引入,让回归测试和可复现研究在深度学习领域变得更加可靠。

正如 PyTorch 团队所言:"Throughout the 2.x series, PyTorch has been evolving from a research-first framework into a unified, hardware-agnostic platform for production training and inference at scale."(在 2.x 系列中,PyTorch 正从一个研究优先的框架,演变为一个统一的、硬件无关的、用于大规模生产训练和推理的平台。)

开发者们可以通过 PyTorch 官方仓库轻松升级,并期待在即将到来的 Q&A 活动中与团队深入探讨这些更新细节。

“Throughout the 2.x series, PyTorch has been evolving from a research-first framework into a unified, hardware-agnostic platform for production training and inference at scale.”

— PyTorch Team

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能