PyTorch 发布 Miles:原生大模型强化学习后训练框架

ADK PyTorch官方 / ADK编译 2026-09-11 5 分钟 98 次浏览
速览导读 / Summary

PyTorch 联合 RadixArk 推出开源框架 Miles,专为大规模 LLM 强化学习(RL)后训练设计。Miles 基于 SGLang 实现高吞吐采样,集成 Megatron-LM 进行分布式训练,并通过 Ray 进行集群编排。其核心优势在于统一 PyTorch 底层,解决 MoE 模型路由对齐、低精度一致性及长任务容错等难题,显著降低前沿模型 RL 训练的构建与运维门槛。

框架类型 开源框架 Miles 是 RadixArk 与 PyTorch 联合推出的开源项目
核心组件 SGLang + Megatron-LM + Ray 四大系统深度集成,覆盖采样、训练、编排与底层
支持架构 Dense & MoE 原生支持混合专家模型的路由对齐
硬件支持 NVIDIA Blackwell/Hopper 针对最新专用 AI 硬件进行优化

Key Insights / 核心看点

  • 1 推出开源框架 Miles,专为大规模 LLM 强化学习后训练设计,解决分布式系统复杂性。
  • 2 深度集成 SGLang、Megatron-LM 和 Ray,实现高吞吐采样、可扩展训练及集群编排的统一架构。
  • 3 原生支持 MoE 模型路由对齐与低精度一致性,确保采样与训练阶段的策略同步。
  • 4 提供完全异步的 RL 工作流及 Rack-aware 故障容错机制,支持长周期任务的稳定运行。
  • 5 保持 PyTorch 作为底层统一层,降低开发者定制算法和适配新硬件的门槛。

PyTorch 发布 Miles:原生大模型强化学习后训练框架

随着大语言模型(LLM)规模向万亿参数演进,并广泛采用混合专家(MoE)架构,强化学习(RL)已成为模型后训练的核心环节。然而,当模型跨越 NVIDIA Blackwell 和 Hopper 等专用硬件,并在大规模分布式集群上运行时,RL 训练已不再仅仅是简单的训练循环,而演变为一个复杂的分布式系统问题。

为了解决这一挑战,PyTorch 联合 RadixArk 推出了开源框架 Miles。Miles 旨在让前沿规模的 LLM RL 训练更具可组合性、可复现性,并降低运维难度。

核心架构:小核心,多组件

Miles 遵循“小核心,多组件”(small-core, many-edges)的哲学设计,将用户最常修改的部分(如采样逻辑、奖励计算、损失函数等)封装为可插拔的 Python 模块,使研究人员和基础设施团队无需分叉框架即可快速适配新算法。

其底层由四大核心系统深度集成组成:

  • SGLang:负责高吞吐度的采样生成(Rollout),利用其高效的 KV Cache 管理。
  • Megatron-LM:作为生产级的分布式训练后端,直接对接 Megatron 的参数解析、模型构建及并行原语,支持前沿规模的 Dense 和 MoE 训练。
  • Ray:负责集群编排、Actor 生命周期管理、调度及监督,提供原生的故障恢复与日志聚合能力。
  • PyTorch:作为贯穿整个栈的共同编程与数值层,提供模型定义、自动求导、分布式原语及数据类型支持。

关键技术突破

1. 无缝的 MoE 路由对齐

Miles 解决了 MoE 模型在采样(Rollout)与训练(Training)阶段路由行为不一致的难题。通过统一的低精度配方(Low-precision recipes)和 MoE 感知机制,确保路由逻辑在生成和更新权重时保持高度同步。

2. 高性能的异步流水线

利用 Ray 的持久化 Actor 模型,Miles 支持完全异步的 RL 模式。采样 Actor 持续将样本流式送入队列,训练器按自身节奏消费,消除了传统同步模式中的阻塞等待,极大提升了系统吞吐量。

3. 智能的权重同步与容错

Miles 内置了针对 NVIDIA NCCL/RDMA 的快速权重同步通道,并支持 Rack-aware 的节点放置策略。这使得系统能够区分单卡故障与整机架问题,实现长周期(如数周)任务的自动恢复与持续运行。

实际价值

对于开发者而言,Miles 将复杂的分布式系统编排抽象化,使得构建大规模 LLM RL 系统变得像调用 API 一样简单。对于用户而言,它提供了开箱即用的可观测性(Observability)和故障容错能力,无需额外搭建复杂的监控基础设施即可应对生产环境的不确定性。

“Miles 的目标很简单:让大规模 LLM RL 训练更加易于构建、复现和扩展,同时保持核心训练器足够小巧,供研究人员和基础设施团队进行深度定制。” —— PyTorch/RadixArk 团队

“Miles was built for this setting. The goal is simple: make large-scale LLM RL training more composable, reproducible, and easier to scale, while keeping the core trainer small enough for researchers and infrastructure teams to customize.”

— PyTorch/RadixArk 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能