PyTorch 集成 Helion 为 vLLM 打造高性能线性后端,Hopper GPU 推理提速超 10%

ADK PyTorch官方 / ADK编译 2026-10-01 5 分钟 126 次浏览
速览导读 / Summary

PyTorch 团队宣布将 Helion 内核 DSL 集成至 vLLM 线性后端,旨在通过自动调优减少内核实现复杂度。在 NVIDIA Hopper GPU 上,该新架构结合形状级调优与混合分发机制,在 FP8 和 INT8 量化场景下全面超越 CUTLASS 与 DeepGEMM 默认后端,部分工作负载吞吐量提升超 10%。此举标志着从手动优化向系统化自动调优的重大范式转变。

吞吐量提升 > 10% 部分工作负载在 Hopper GPU 上的性能增益
支持量化格式 FP8, INT8, NVFP4 主要优化的量化线性层格式
目标硬件 NVIDIA Hopper 本次集成的核心硬件架构

Key Insights / 核心看点

  • 1 将 Helion 内核 DSL 集成至 vLLM,实现从手动内核特化向系统化自动调优的范式转变。
  • 2 在 NVIDIA Hopper GPU 上,针对 FP8 和 INT8 量化格式,部分工作负载吞吐量提升超 10%。
  • 3 支持形状级自动调优,单一代码实现即可覆盖 Standard GEMM、Split-K 等多种算法变体。
  • 4 引入 LLM 引导搜索机制,进一步提升内核调优效率与智能化水平。

PyTorch 集成 Helion 为 vLLM 打造高性能线性后端,Hopper GPU 推理提速超 10%

PyTorch 团队近日发布了一项重大基础设施升级,宣布将 Helion(一种 PyTorch 原生硬件无关内核 DSL)深度集成至高性能推理框架 vLLM 的线性后端(Linear Backend)。此次合作的核心目标是探索如何通过高层抽象与自动调优(Autotuning),在降低内核实现复杂度的同时,显著提升大语言模型(LLM)的推理性能。

核心突破:从手动特化到系统化自动调优

在传统的 LLM 推理引擎中,针对不同的量化格式(如 FP8, INT8, NVFP4)和硬件平台,工程师通常需要手动编写和优化特定的内核代码(如 Split-K 或 Swap-AB 算法)。这种方式不仅工程负担重,且难以覆盖所有场景。

Helion 的引入彻底改变了这一流程:

  • 单一实现,多场景覆盖:开发者只需编写一次简洁的 Pythonic 代码,Helion 即可生成针对不同工作负载和硬件平台的专用代码。
  • 形状级自动调优:Helion 利用其内置的自动调优器,在运行时自动选择最佳的算法变体(Standard GEMM, Split-K, Swap-AB)及配置参数,无需人工干预。
  • LLM 引导搜索:Helion 还支持利用 LLM 的推理能力来辅助搜索空间,进一步提高了调优效率。

性能实测:Hopper GPU 上的显著增益

本次集成主要针对 NVIDIA Hopper GPU 架构,重点优化了 FP8_Dynamic 和 W8A8_INT8 两种量化格式下的 GEMM 操作。

在评估中,Helion 线性后端在多个主流模型上表现优异,不仅超越了 vLLM 默认的 CUTLASS 和 DeepGEMM 后端,还在部分工作负载上实现了 超过 10% 的吞吐量提升。这种性能增益源于 Helion 能够针对特定形状进行精细化的形状级调优(Per-shape tuning)。

架构挑战与权衡

尽管性能表现亮眼,PyTorch 团队也坦诚地指出了当前架构面临的挑战,主要集中在性能、可用性与可维护性之间的权衡(Tradeoff Triangle):

  1. 启动延迟:由于涉及 Helion 的 JIT 编译,vLLM 的冷启动(Cold-start)延迟会有所增加,但通过缓存编译后的产物,热启动(Warm-start)性能不受影响。
  2. 推理运行时开销:若不在 CUDA Graph 范围内,Helion 的调度与启动可能引入额外的 CPU 开销,抵消部分性能收益。因此,最佳实践是在 CUDA Graph 环境下运行。
  3. 维护成本:为热门模型提供预调优配置(Pre-tuned configs)给上游团队带来了持续的维护负担,且大型配置文件难以通过单元测试进行充分验证。

对开发者的价值

对于开发者而言,这一更新意味着:无需深厚的底层内核优化知识,即可在特定部署场景下获得极致性能。Helion 将内核优化的门槛大幅降低,使得 vLLM 能够更灵活地适配多样化的硬件生态和工作负载模式,推动 LLM 推理服务向更高效、更自动化的方向发展。

“通过将 Helion 集成到 vLLM,我们证明了高层内核 DSL 结合系统化自动调优,能够在保持代码简洁的同时,实现跨硬件平台和量化格式的 SOTA 推理性能。” —— PyTorch 团队

“A single Helion general matrix multiplication (GEMM) implementation can cover multiple algorithmic variants, including Standard GEMM, Split-K, and Swap-AB, with the best variant and config automatically selected through per-shape autotuning.”

— PyTorch 官方博客

同主题深度资讯

查看更多 →
官方动态 2026-10-1

PyTorch 官方最新动态:Modernizing Table Batched Embeddings with FBTriton

This post explores the FBTriton kernel design for Table Batched Embedding (TBE) forward and backward passes. These core operators handle embedding lookups across thousands of sharded GPUs within recom

PyTorch官方 / ADK编译 3分钟
官方动态 2026-10-08T18:13:46+00:00

PyTorch 官方最新动态:Session-Aware Agentic Inference with NVIDIA Dynamo

Agentic workloads change the traffic an inference server sees. Unlike single-turn chat, an agent session can involve a large initial prefill, repeated model calls, and subagents running in parallel, w

PyTorch官方 / ADK编译 3分钟
模型发布 2026-10-08

PyTorch 原生集成 Spyre 加速器:打造企业级推理新范式

PyTorch 官方宣布通过 `torch-spyre` 库将 IBM 的 Spyre 数据流 AI 加速器打造为 PyTorch 的原生设备。此次更新实现了从设备身份、内存分配器到编译图的全链路映射,支持 `tensor.to("spyre")` 等标准操作。核心突破在于利用 Spyre 的独立计算与数据移动流水线,在保持 PyTorch 易编程性的同时,实现了极低延迟的推理加速,为 IBM Z 及 Power 系统上的企业级 AI 应用提供了统一且高效的执行路径。

PyTorch官方 / ADK编译 5 分钟
模型发布 2026-10-08

Pixmax 发布全链路游戏素材生成平台,覆盖研发至买量全阶段

Pixmax 正式发布专为游戏行业打造的 AI 素材生成平台,深度理解游戏开发工作流,支持从研发立绘、场景贴图到宣发买量素材的全链路生产。平台通过“上传 - 生成 - 批量 - 适配”四步流程,解决风格统一与批量产出难题,显著降低美术成本与试错周期,助力中小团队提升生产效率。

Pixmax官方 / ADK编译 3 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能