PyTorch 发布 Muse Glimmer:端到端端侧智能体 AI 新标杆
Meta 与 PyTorch 团队今日联合宣布推出 Muse Glimmer,这是一款源自 Meta Muse Spark 的开源轻量级模型(300 亿参数),专为端侧智能体(On-Device Agentic Workflows)设计。与此同时,ExecuTorch 正式提供了对 Muse Glimmer 在 NVIDIA GPU 和 Apple Silicon 上的端到端运行支持,标志着本地 AI 开发从“重写模型”迈向“一次定义,全栈部署”的新阶段。
为什么是 ExecuTorch?
传统的本地 AI 框架往往需要将模型重新编写为 C++ 或其他非 Python 语言,这在 LLM 仍是标准文本 Transformer 时行之有效。然而,随着模型架构日益复杂、多模态输入输出普及以及 DFlash 等先进解码算法的出现,跨后端重写模型已无法规模化。
ExecuTorch 采取了不同的路径:开发者在 PyTorch 中实现模型及其解码策略,导出后由框架自动完成后端特定的降维(lowering)与优化。通过提前编译(Ahead-of-Time Compilation),ExecuTorch 对整个执行路径进行端到端优化,而非仅针对单个操作。
核心突破与功能特性
Muse Glimmer 依托 ExecuTorch 的强大能力,实现了多项关键特性:
- 原生多模态支持:无缝处理文本与图像输入,支持直接 GGUF 导出。
- 极致推理速度:集成 DFlash 推测解码技术,在 M5 Pro (64GB) 上实现 52.8% 的性能提升(从 21.6 tok/s 提升至 33.0 tok/s),且无质量回退。
- 超长上下文:原生支持 128K+ tokens 的上下文窗口。
- 跨平台兼容:预构建的 PTE(PyTorch Export)包可直接在 NVIDIA CUDA 和 Apple Silicon (Metal) 上运行。
开发者如何快速上手?
PyTorch 团队已发布经过验证的 PTE 包,开发者可立即在支持的硬件上运行。
- 下载预构建包:访问 Hugging Face 下载包含文本及图文模态的 PTE 包(含 DFlash 选项)。
- 构建运行时:使用 CMake 构建
solo_runner、dflash_runner及服务 worker。# 构建 CUDA 版本 cmake --workflow --preset muse-glimmer-cuda # 构建 Apple Silicon 版本 cmake --workflow --preset muse-glimmer-mlx - 运行智能体:启动本地服务后,即可通过
pi等智能体框架调用,自动处理代码生成、文件编辑等复杂任务。
实际应用场景
- 多模态图像理解:在端侧设备实时分析图像内容,无需云端依赖。
- 自主编码智能体:Muse Glimmer 驱动的智能体可自主创建游戏、迭代优化细节、调用工具安装依赖并运行测试,展现出强大的自主规划能力。
性能数据
- M5 Pro (64GB): Solo 推理 21.6 tok/s,启用 DFlash 后达 33.0 tok/s。
- NVIDIA A100: 在变长上下文下保持高吞吐与高接受率。
"ExecuTorch 让机器学习工程师能够专注于模型创新,而无需为后端优化耗费精力。" —— PyTorch 团队
此次发布不仅丰富了 PyTorch 的生态,更为端侧 AI 应用提供了高性能、低延迟的坚实底座。