PyTorch x Hugging Face 联合发布:构建印度下一代 ML 系统贡献者
在 Bengaluru 举办的一场技术晚宴上,Red Hat 与 Hugging Face 联合呈现了一场聚焦于 PyTorch 及大规模机器学习系统基础设施的深度交流。超过 170 名来自学生、工程师、研究人员及开源贡献者的参与者,共同探讨了从 AI 模型消费者向底层系统构建者转变的关键路径。
从 AI 用户到基础设施构建者
活动发起人 Sudhir Dharanendraiah 指出,印度不应仅作为 AI 技术的庞大消费市场,更应利用其人才储备与工程成熟度,成为核心软件栈的重要贡献者。这一理念将讨论重心从简单的 API 调用或模型微调,转移到了编译器路径、内核库、服务引擎及分布式通信层等系统级问题。
核心技术与实践分享
1. PyTorch 性能剖析:让性能可见
Hugging Face 的 Aritra Roy Gosthipaty 分享了关于 PyTorch 性能剖析的实战经验,核心原则是“无法剖析就无法优化”。
- 可重复的工作流:通过
torch.profiler.record_function和torch.profiler.profile对感兴趣区域进行标注,利用调度器分离等待、预热和采集阶段。 - 识别瓶颈:演示了如何区分 CPU 开销与 GPU 实际计算工作,揭示了小负载下 CPU 启动和编排成本可能主导运行时间的现象,帮助开发者避免盲目优化模型代码。
2. SGLang、Transformers 与内核:推理的新形态
Adarsh 深入剖析了现代大语言模型(LLM)的推理挑战,特别是 Prefill 阶段的计算密集性与 Decode 阶段的内存敏感性。
- RadixAttention 架构:SGLang 采用基于 Radix-Tree 的缓存机制,保留请求完成前的前缀状态,利用 LRU 行为处理共享提示词和重复前缀,将流量中的重复结构转化为系统优势。
- 分工明确:Hugging Face Transformers 负责模型定义与配置解析,而 SGLang 专注于调度、连续批处理及注意力后端,降低了长尾 Hub 模型的服务门槛。
- Hugging Face Kernels:针对自定义算子和加速器特定内核的碎片化问题,提出了更可复现的构建路径和更优的社区分发方案。
价值总结
此次活动不仅展示了前沿的技术架构,更传递了一种生态愿景:未来的 AI 创新将属于那些优化编译器、内核库及服务引擎的人。通过分享具体的工程实践,旨在赋能印度及全球的早期工程师,使其具备构建和维护下一代 ML 系统底层的能力。
"印度拥有使用 AI 和 ML 系统的人才,但更深远的机会在于帮助更多学生和实践者成为这些系统的构建者和维护者。" —— 官方团队