PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

ADK PyTorch官方 / ADK编译 2026-10-08 5 分钟 142 次浏览
速览导读 / Summary

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

集成库 torch-spyre PyTorch 与 Spyre 的原生连接层
目标硬件 IBM Spyre IBM 数据流 AI 加速器
内存层级 2MB Scratchpad + 128GB LPDDR5 双层级存储架构
核心优势 Zero-shot Migration 无需修改代码即可利用硬件加速

Key Insights / 核心看点

  • 1 PyTorch 原生支持 Spyre 设备,通过 `torch-spyre` 实现从设备身份到编译图的全栈映射。
  • 2 利用数据流架构特性,将计算与数据移动流水线分离,实现硬件级的执行重叠与低延迟启动。
  • 3 开发者无需修改现有代码,即可通过标准 PyTorch API(如 `tensor.to()`)在 IBM Z/Power 系统上运行高性能推理。
  • 4 编译器与运行时深度协同,固定内存布局与数据对齐策略,最大化利用 Spyre 的本地存储与高速环网。

PyTorch 原生集成 Spyre:数据流加速器的统一接口

在 AI 推理日益向边缘和专用硬件下沉的趋势下,如何在不牺牲开发效率的前提下榨干硬件性能,一直是业界关注的焦点。近日,PyTorch 团队与 IBM 联合发布了一项重大进展:通过 torch-spyre 库,成功将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备(Native Device)。这一突破不仅消除了传统 GPU 与数据流架构之间的范式差异,更为 IBM Z、LinuxONE 和 Power 系统上的企业级 AI 应用提供了统一的编程模型。

核心突破:从图执行到数据驱动

传统的 GPU 编程往往依赖显式的内核调度与线程组,而 Spyre 采用独特的数据流(Dataflow)架构。PyTorch 此次的集成并非简单的后端移植,而是深度重构了设备抽象层,解决了以下关键挑战:

  1. 数据驱动的计算触发:不同于 GPU 的指令流,Spyre 的计算由数据可用性驱动。PyTorch 的 stream 和 event 机制被重新映射,确保操作按序执行,同时利用独立的计算与数据移动流水线实现硬件级的重叠执行(Overlap)。
  2. 内存层级与布局约束:Spyre 包含 2MB 核心本地存储和 128GB LPDDR5 主存。PyTorch 的分配器(Allocator)与 Spyre 运行时紧密协作,编译器预先生成固定布局的内存访问模式,确保数据以 128 字节对齐的“stick”形式高效传输。
  3. 编译图与运行时分离:尽管底层是编译后的程序队列,但 PyTorch 用户依然可以编写 Eager 模式代码。一旦编译完成,启动过程变为预定义的“配方”(Recipe),大幅降低了启动开销。

实际价值:企业级推理的无缝体验

对于开发者而言,最大的价值在于零代码迁移成本。企业团队无需学习新的 API 或底层硬件指令,只需在现有的 PyTorch 代码中调用 tensor.to("spyre"),即可将张量卸载至 Spyre 设备。

  • 统一执行路径:无论是 Eager 模式还是 Inductor 编译路径,PyTorch 表面与 Spyre 硬件的映射关系保持一致。
  • 高效推理优化:Spyre 专为语言生成和嵌入模型设计的低精度计算单元,配合 PyTorch 的优化器,能够显著降低矩阵运算的延迟。
  • 企业级稳定性:基于 IBM Z 等高端系统的底层架构,确保了在混合负载下的高吞吐量和数据安全性。

正如 PyTorch 团队所言,这次集成旨在“让 Spyre 拥有真实的设备身份”,让复杂的硬件约束在 PyTorch 的抽象层下变得透明且易于管理。这标志着数据流加速器正式进入了主流 AI 开发者的视野,为构建下一代企业级 AI 基础设施奠定了坚实基础。

“This post focuses on the PyTorch-to-Spyre device/runtime integration: how device identity, allocator-backed storage, streams, events, and compiled-program launch map onto Spyre’s runtime constraints.”

— PyTorch Blog Team

同主题深度资讯

查看更多 →
官方动态 2026-10-1

PyTorch 官方最新动态:Modernizing Table Batched Embeddings with FBTriton

This post explores the FBTriton kernel design for Table Batched Embedding (TBE) forward and backward passes. These core operators handle embedding lookups across thousands of sharded GPUs within recom

PyTorch官方 / ADK编译 3分钟
官方动态 2026-10-08T18:13:46+00:00

PyTorch 官方最新动态:Session-Aware Agentic Inference with NVIDIA Dynamo

Agentic workloads change the traffic an inference server sees. Unlike single-turn chat, an agent session can involve a large initial prefill, repeated model calls, and subagents running in parallel, w

PyTorch官方 / ADK编译 3分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
AI 工具 2026-10-08

AdsTurbo 发布 Temu GIF 转视频广告工具:15 秒内重构电商素材

AdsTurbo 推出针对 Temu 平台优化的 GIF 转视频广告工具,旨在将静态循环动图重构为具备叙事性的 15 秒短视频。该工具不仅进行格式转换,更通过 AI 提取关键帧、生成解说词与字幕、匹配多平台导出规范,帮助商家将零散的产品证据转化为高转化率的垂直视频素材,显著提升广告素材的复用性与合规性。

AdsTurbo AI官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能