PyTorch 携手 Google 发布 Helion TPU 后端:硬件异构核编译新范式

ADK PyTorch官方 / ADK编译 2026-07-23 5 分钟 59 次浏览
速览导读 / Summary

PyTorch 与 Google 联合发布 Helion TPU 后端,填补了高级 DSL 与底层 Pallas 之间的鸿沟。该更新允许开发者使用熟悉的 PyTorch 语法编写性能可移植的机器学习内核,并自动编译为针对 TPU v7 优化的 Pallas 代码。通过智能自动调优(Autotuning)和流水线优化,Helion 在 Flash Attention 工作负载上实现了高达 838 TFLOPS 的性能,显著降低了 TPU 内核开发的门槛并提升了跨硬件兼容性。

版本 Helion TPU v1.0 新增 TPU 后端支持
峰值性能 838 TFLOPS Flash Attention 工作负载下 TPU v7 表现
MFU 利用率 ~79% 单张量核心最大浮点利用率

Key Insights / 核心看点

  • 1 Helion TPU 后端发布,支持将 PyTorch 风格代码编译为高性能 Pallas 内核
  • 2 内置智能自动调优器,针对不同输入形状优化流水线与内存传输策略
  • 3 在 Flash Attention 工作负载上实现 838 TFLOPS 性能,MFU 利用率达 79%
  • 4 降低 TPU 开发门槛,支持跨 TPU 与 GPU 的单一代码库维护

PyTorch 携手 Google 发布 Helion TPU 后端:硬件异构核编译新范式

更新背景

随着 Google TPU v7 (Ironwood) 的推出,其性能已媲美 NVIDIA B200,成为大规模训练和推理的重要选择。然而,TPU 的编程模型与 GPU 存在显著差异:TPU 采用顺序执行架构,依赖显式的内存层次结构(HBM 与片上 VMEM),而 GPU 则依赖大规模并行 SIMT 和隐式缓存。

传统上,编写高性能 TPU 内核需要深厚的 Pallas 底层 DSL 知识,学习曲线陡峭且代码复杂。为了降低这一门槛,PyTorch 推出了 Helion——一种用于编写性能可移植机器学习内核的高级领域特定语言 (DSL)。此次更新标志着 Helion 正式集成 TPU 后端,实现了从 PyTorch 风格代码到优化 TPU 代码的无缝编译。

核心突破与功能特性

1. PyTorch 风格的 TPU 内核开发

Helion 允许开发者使用直观的 PyTorch 语法定义内核,无需深入理解 Pallas 的细节。例如,一个简单的加法操作在 Helion 中仅需几行代码:

@helion.kernel
def add(x: torch.Tensor, y: torch.Tensor) -> torch.Tensor:
    out = torch.empty_like(x)
    for tile in hl.tile(out.size()):
        out[tile] = x[tile] + y[tile]
    return out

编译器会自动将其转换为包含宿主端启动器(Launcher)和设备端函数的高效 Pallas 代码,自动处理数据在 HBM 与 VMEM 之间的传输与计算重叠。

2. 智能自动调优 (Autotuning)

Helion 内置强大的自动调优器,能够针对不同的输入形状探索多种代码生成策略。它自动选择最佳的流水线缓冲区大小 (_BLOCK_SIZE_0) 和调度方案,以最大化 TPU 的向量内存 (VMEM) 利用率,确保内存传输与浮点计算完美重叠。

3. 卓越的硬件性能

在 Flash Attention 工作负载上,Helion 生成的内核在 TPU v7 上实现了 838 TFLOPS 的峰值性能,达到单个张量核心 (Tensor Core) 最大浮点利用率 (MFU) 的 79%。这一性能水平证明了 Helion 在硬件异构环境下的编译效率。

实际应用价值

  • 降低开发门槛:非 Pallas 专家也能快速上手 TPU 内核开发,加速 TPU 生态的普及。
  • 提升跨硬件兼容性:开发者可以维护一套统一的 Helion 内核代码,同时适配 TPU 和 GPU,简化工程维护。
  • 最大化硬件利用率:通过自动流水线优化,确保在 TPU v7 等新一代加速器上获得接近理论极限的性能。

"Helion 正在演变为编写 TPU 内核的诱人选项,它 bridged the gap between high-level portability and low-level hardware optimization."


关键亮点 (Key Highlights):

  1. Helion TPU Backend: 首个将 PyTorch 风格 DSL 编译为 Pallas 代码的官方后端,支持 TPU v7。
  2. 智能 Autotuning: 自动探索代码生成策略与流水线参数,针对特定输入形状优化性能。
  3. 高性能验证: 在 Flash Attention 任务中达到 838 TFLOPS,MFU 利用率高达 79%。
  4. 简化开发流程: 消除对 Pallas 底层知识的依赖,让开发者专注于算法逻辑。

关键指标 (Metrics):

  • 版本: Helion TPU v1.0
  • 性能: 838 TFLOPS (Flash Attention 工作负载)
  • MFU: ~79% (单张量核心)
  • 目标硬件: TPU v7 (Ironwood)

“Helion is evolving towards an attractive option for authoring TPU kernels.”

— PyTorch 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能