PyTorch 集成 Helion 与 HuggingFace Kernels:实现高性能核的自动调优与无缝分发

ADK PyTorch官方 / ADK编译 2026-09-09 5 分钟 51 次浏览
速览导读 / Summary

PyTorch 官方宣布其 Helion 项目正式集成至 HuggingFace Kernels 生态。此次更新允许开发者通过 Helion DSL 编写高性能计算核,并利用 Kernels 平台进行标准化的自动调优(Autotuning)与分发。用户无需手动管理依赖即可通过 `get_kernel` 命令无缝加载预优化好的 Flash Attention 3 等高性能核,显著降低冷启动时间并提升推理效率。

支持框架 PyTorch + Helion 核心开发框架与 DSL
分发平台 HuggingFace Hub 统一内核仓库与社区
优化策略 算法级自动调优 自动搜索 Tile 大小与底层实现策略

Key Insights / 核心看点

  • 1 Helion 正式集成 HuggingFace Kernels,实现高性能计算核的标准化分发与自动调优。
  • 2 用户可通过 `get_kernel` 命令无缝加载预优化内核(如 Flash Attention 3),无需手动构建或管理依赖。
  • 3 Helion 的自动调优器支持算法级优化,自动搜索最佳内存访问模式与循环策略,超越手写代码性能。
  • 4 提供 `kernel-builder` 工具,确保内核构建的可重复性、原生 PyTorch 兼容性及跨架构支持。

PyTorch 集成 Helion 与 HuggingFace Kernels:实现高性能核的自动调优与无缝分发

PyTorch 官方近日发布重要公告,宣布其高性能计算核开发框架 Helion 正式集成至 HuggingFace Kernels 项目。这一里程碑式的合作旨在解决当前计算核(Kernels)分发碎片化、构建复杂的问题,为 AI 开发者提供从编写、调优到部署的全链路自动化支持。

背景:Helion 与 Kernels 的互补优势

Helion 是一种高级领域特定语言(DSL),专为编写高性能、可移植的机器学习计算核而设计。其核心设计理念是“PyTorch with tiles”,允许开发者使用普通的 PyTorch 张量算子来描述分块(tiled)操作,而将具体的硬件底层细节(如内存访问模式、循环扁平化策略)留给自动调优器(Autotuner)去探索。

然而,优秀的内核代码若缺乏高效的分发机制,仍难以惠及广大用户。传统的内核分发往往面临依赖地狱、构建环境不一致等痛点。HuggingFace Kernels 项目应运而生,它提供了一个标准化的包装与构建流程,将 Helion 内核转化为即插即用的 Python 库,彻底改变了内核的交付方式。

核心突破:自动化调优与无缝加载

此次更新的核心价值在于打通了“编写 - 调优 - 分发”的闭环:

  1. 算法级自动调优:Helion 的自动调优器不仅搜索数值参数(如 Tile 大小),还智能搜索底层实现策略(如使用 TMA 还是指针算术)。这意味着开发者无需像 Triton 或 CUDA 那样手动重写代码,即可在多种硬件架构上获得最优性能。
  2. 预构建二进制包:Kernels 项目提供针对广泛硬件兼容性矩阵的预构建二进制包。对于像 Flash Attention 3 这样的高性能内核,用户无需从源码编译,即可直接调用。
  3. 零依赖加载体验:用户只需一条简单的命令即可加载高性能核,体验如同从 HuggingFace Hub 拉取模型一样流畅。

实际应用价值

对于开发者而言,这意味着更少的维护成本和更快的迭代周期。对于终端用户(尤其是推理服务部署方),这意味着无需配置复杂的构建环境,即可直接享受经过专业团队调优的极致性能。

示例:加载 Flash Attention 3

from kernels import get_kernel

# 无缝加载预构建的 Flash Attention 3 内核
kernel_module = get_kernel("kernels-community/flash-attn3", version=1)
flash_attn_func = kernel_module.flash_attn_func

# 直接调用,无需任何额外配置
flash_attn_func(...)

技术亮点总结

  • 标准化构建工具:kernel-builder 工具强制执行源结构标准,确保构建的可重复性和原生 PyTorch 兼容性。
  • 无架构依赖分发:Helion 内核作为 noarch 分发,用户机器上的 Helion 运行时自动完成编译,无需预编译二进制文件。
  • 社区驱动生态:通过 HuggingFace Hub 建立统一的 Kernels Hub,汇聚了包括 Flash Attention 3 在内的各类高性能计算核。

“我们的目标是让用户能够无缝地消费这些内核,无需管理依赖地狱,从而专注于算法创新而非基础设施的复杂性。” —— PyTorch 官方团队

此次合作标志着 PyTorch 生态在高性能计算基础设施层面迈出了坚实的一步,为构建下一代 AI 应用提供了更强大的底层引擎。

“Our goal is to provide a seamless experience of loading kernels and getting them ready to use right away, much like pulling a model or dataset from the Hugging Face Hub.”

— HuggingFace Kernels Project Team

同主题深度资讯

查看更多 →
官方动态 2026-10-1

PyTorch 官方最新动态:Modernizing Table Batched Embeddings with FBTriton

This post explores the FBTriton kernel design for Table Batched Embedding (TBE) forward and backward passes. These core operators handle embedding lookups across thousands of sharded GPUs within recom

PyTorch官方 / ADK编译 3分钟
官方动态 2026-10-08T18:13:46+00:00

PyTorch 官方最新动态:Session-Aware Agentic Inference with NVIDIA Dynamo

Agentic workloads change the traffic an inference server sees. Unlike single-turn chat, an agent session can involve a large initial prefill, repeated model calls, and subagents running in parallel, w

PyTorch官方 / ADK编译 3分钟
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能