PyTorch 基金会六项目季度更新:从 PyTorch 2.13 到 Ulysses 并行与硬件加速

ADK PyTorch官方 / ADK编译 2025-09-11 5 分钟 173 次浏览
速览导读 / Summary

PyTorch 基金会于 2025 年 4 月升级为多项目架构,涵盖 PyTorch、vLLM、DeepSpeed、Ray、Helion 及 Safetensors。本期更新聚焦 PyTorch 2.13 发布(含 Apple Silicon FlexAttention 与 Python 3.15 支持)、vLLM 模型运行器 V2 重构、DeepSpeed Ulysses 序列并行集成及 Ray 对 GB200/GB300 硬件的优化。各项目在性能提升、生态扩展与生产级稳定性方面取得显著进展。

PyTorch 版本 2.13 发布新版本,支持 Apple Silicon 与 Python 3.15
FlexAttention 加速比 ~12x Apple Silicon 上相比 SDPA 的加速比
内存优化 4x nn.LinearCrossEntropyLoss 峰值 GPU 内存减少比例
学术认可 ASPLOS 2026 DeepSpeed SuperOffload 工作获最佳论文荣誉提名
硬件支持 GB200/GB300 Ray 新增的硬件支持范围

Key Insights / 核心看点

  • 1 PyTorch 2.13 发布,带来 Apple Silicon 上的 12 倍 FlexAttention 加速及 Python 3.15 支持
  • 2 DeepSpeed 集成 Ulysses 序列并行算法,并获 ASPLOS 2026 最佳论文荣誉提名
  • 3 Ray 全面支持 GB200/GB300 硬件,并用于构建 MAI-Thinking-1 等前沿模型
  • 4 vLLM 完成 Model Runner V2 重构,显著提升 GPTQ 模型推理性能
  • 5 Helion 推出 LLM-Guided Autotuning,实现异构硬件上的自动算子优化

PyTorch 基金会六项目季度更新:驱动开源 AI 未来

在 2025 年 4 月,PyTorch 基金会正式演变为一个多项目架构,旨在促进跨领域深度协作并加速整个 AI 生命周期的创新。当前,基金会托管着六个核心项目:PyTorch、vLLM、DeepSpeed、Ray、Helion 和 Safetensors。本季度,这些项目在核心优化、硬件赋能及社区健康度方面取得了突破性进展。

PyTorch 2.13 发布与 Apple Silicon 优化

核心 PyTorch 项目的开发势头强劲,仅在 Q2 就提交了 4,415 次提交,且开源问题数量稳步下降。官方已正式发布 PyTorch 2.13,并启动 2.14 的开发周期。

  • 性能与平台扩展:FlexAttention 现已支持 Apple Silicon,相比 SDPA 快约 12 倍;新增 CuTeDSL Inductor 后端;内存优化的 nn.LinearCrossEntropyLoss 可将峰值 GPU 内存减少 4 倍;支持 Python 3.15 轮式构建及免费线程构建。
  • 分布式训练:新增 torchcomms 后端及 FSDP2 通信重叠,支持大规模集群训练;扩展了对 ROCm、Arm 和 Intel XPU 的支持。
  • 端侧 AI:通过 ExecuTorch 积极扩展端侧 LLM 能力,与 Hugging Face 合作简化模型摄入并优化端侧性能。

vLLM:模型运行器 V2 与生产级代理工作负载

vLLM 项目已实现稳定的双周发布节奏。其关键突破是 Model Runner V2 的完全重构,显著提升了 GPTQ 模型的性能。

  • 路线图:Q3 2026 路线图聚焦生产级代理工作负载和高交互性高级 Token。核心引擎正在完成 Flat Model 和 Model Runner V2 的重大迁移,并重新设计调度器与 KV Cache 机制。
  • 目标:在 AgentX 上实现顶级性能,通过更智能的 KV Cache 卸载和前缀缓存优化多轮代理。
  • 会议:团队举办了首届 vLLM Conference,涵盖路线图、硬件后端、代理服务、训练及生产级推理等议题。

DeepSpeed:Ulysses 并行与学术认可

DeepSpeed 保持了稳定的双周发布节奏,并在架构上进行了重大更新。

  • 硬件集成:用直接集成 Torch.xpu 取代了 Intel GPU 支持(IPEX)。
  • 序列并行:将 Ulysses 序列并行算法直接集成到 Hugging Face 库(Trainer, Accelerate, TRL)中。
  • 学术贡献:凭借开创性的 SuperOffload 工作获得 ASPLOS 2026 最佳论文荣誉提名,三篇论文被录用,其中一篇利用 PyTorch 2.0 编译技术自动化了序列并行(AutoSP)。

Ray:GB200 支持与前沿模型构建

Ray 专注于大规模工作负载的生产级加固,包括加速 Actor 调度、升级原生 RDMA 支持及优化机架感知 Actor 放置。

  • 硬件支持:全面支持 GB200/GB300 及未来硬件。
  • 前沿模型:已用于构建 MAI-Thinking-1、Composer 2.5 和 Nemotron 3 Ultra 等前沿模型。
  • 数据与推理:Ray Data 2.57 将推出高性能引擎;通过 Ray + vLLM 实现预填充 - 解码分离,并在 AMD MI325X 上优化集群稳定性。

Helion:跨硬件注意力核与自动调优

Helion 在上半年取得了实质性进展,专注于在异构硬件上交付最先进的性能。

  • 核心突破:开发了跨硬件注意力核,并实现了 LLM-Guided Autotuning,能够根据模型特性自动选择最优算子组合。

官方引言:

"PyTorch Foundation-hosted projects have achieved a lot this past quarter... from core optimization updates to hardware enablement and community health."

来源:PyTorch Foundation Projects Blog

“PyTorch Foundation-hosted projects have achieved a lot this past quarter... from core optimization updates to hardware enablement and community health.”

— PyTorch Foundation Projects Blog

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能