PyTorch 基金会六项目季度更新:驱动开源 AI 未来
在 2025 年 4 月,PyTorch 基金会正式演变为一个多项目架构,旨在促进跨领域深度协作并加速整个 AI 生命周期的创新。当前,基金会托管着六个核心项目:PyTorch、vLLM、DeepSpeed、Ray、Helion 和 Safetensors。本季度,这些项目在核心优化、硬件赋能及社区健康度方面取得了突破性进展。
PyTorch 2.13 发布与 Apple Silicon 优化
核心 PyTorch 项目的开发势头强劲,仅在 Q2 就提交了 4,415 次提交,且开源问题数量稳步下降。官方已正式发布 PyTorch 2.13,并启动 2.14 的开发周期。
- 性能与平台扩展:FlexAttention 现已支持 Apple Silicon,相比 SDPA 快约 12 倍;新增 CuTeDSL Inductor 后端;内存优化的
nn.LinearCrossEntropyLoss可将峰值 GPU 内存减少 4 倍;支持 Python 3.15 轮式构建及免费线程构建。 - 分布式训练:新增
torchcomms后端及 FSDP2 通信重叠,支持大规模集群训练;扩展了对 ROCm、Arm 和 Intel XPU 的支持。 - 端侧 AI:通过 ExecuTorch 积极扩展端侧 LLM 能力,与 Hugging Face 合作简化模型摄入并优化端侧性能。
vLLM:模型运行器 V2 与生产级代理工作负载
vLLM 项目已实现稳定的双周发布节奏。其关键突破是 Model Runner V2 的完全重构,显著提升了 GPTQ 模型的性能。
- 路线图:Q3 2026 路线图聚焦生产级代理工作负载和高交互性高级 Token。核心引擎正在完成 Flat Model 和 Model Runner V2 的重大迁移,并重新设计调度器与 KV Cache 机制。
- 目标:在 AgentX 上实现顶级性能,通过更智能的 KV Cache 卸载和前缀缓存优化多轮代理。
- 会议:团队举办了首届 vLLM Conference,涵盖路线图、硬件后端、代理服务、训练及生产级推理等议题。
DeepSpeed:Ulysses 并行与学术认可
DeepSpeed 保持了稳定的双周发布节奏,并在架构上进行了重大更新。
- 硬件集成:用直接集成 Torch.xpu 取代了 Intel GPU 支持(IPEX)。
- 序列并行:将 Ulysses 序列并行算法直接集成到 Hugging Face 库(Trainer, Accelerate, TRL)中。
- 学术贡献:凭借开创性的 SuperOffload 工作获得 ASPLOS 2026 最佳论文荣誉提名,三篇论文被录用,其中一篇利用 PyTorch 2.0 编译技术自动化了序列并行(AutoSP)。
Ray:GB200 支持与前沿模型构建
Ray 专注于大规模工作负载的生产级加固,包括加速 Actor 调度、升级原生 RDMA 支持及优化机架感知 Actor 放置。
- 硬件支持:全面支持 GB200/GB300 及未来硬件。
- 前沿模型:已用于构建 MAI-Thinking-1、Composer 2.5 和 Nemotron 3 Ultra 等前沿模型。
- 数据与推理:Ray Data 2.57 将推出高性能引擎;通过 Ray + vLLM 实现预填充 - 解码分离,并在 AMD MI325X 上优化集群稳定性。
Helion:跨硬件注意力核与自动调优
Helion 在上半年取得了实质性进展,专注于在异构硬件上交付最先进的性能。
- 核心突破:开发了跨硬件注意力核,并实现了 LLM-Guided Autotuning,能够根据模型特性自动选择最优算子组合。
官方引言:
"PyTorch Foundation-hosted projects have achieved a lot this past quarter... from core optimization updates to hardware enablement and community health."
来源:PyTorch Foundation Projects Blog