PyTorch 发布 Muse Glimmer: ExecuTorch 实现端侧高效智能体 AI 与 DFlash 加速

ADK PyTorch官方 / ADK编译 2026-09-11 5 分钟 77 次浏览
速览导读 / Summary

Meta 联合 PyTorch 推出 Muse Glimmer,一款基于 300 亿参数蒸馏的轻量级多模态智能体模型。通过 ExecuTorch 的端到端编译技术,Muse Glimmer 可在 NVIDIA GPU 及 Apple Silicon 上实现极致性能,支持 DFlash 推测解码、128K+ 上下文及原生 GGUF 导出。此次更新解决了传统框架重写模型的瓶颈,为开发者提供了开箱即用的端侧智能体运行环境。

模型参数 30 Billion Muse Glimmer 蒸馏模型规模
推理速度提升 52.8% 启用 DFlash 推测解码后的性能增益
上下文窗口 128K+ 原生支持的 Token 上下文长度
支持硬件 NVIDIA GPU | Apple Silicon 端到端运行目标平台

Key Insights / 核心看点

  • 1 推出 Muse Glimmer:300 亿参数轻量级多模态模型,专为端侧智能体设计。
  • 2 集成 DFlash 推测解码技术,在端侧实现 52.8% 的推理速度提升。
  • 3 支持 128K+ 超长上下文与原生 GGUF 导出,兼容 NVIDIA GPU 及 Apple Silicon。
  • 4 提供开箱即用的 PTE 包,简化了跨平台模型部署与智能体开发流程。

PyTorch 发布 Muse Glimmer:端到端端侧智能体 AI 新标杆

Meta 与 PyTorch 团队今日联合宣布推出 Muse Glimmer,这是一款源自 Meta Muse Spark 的开源轻量级模型(300 亿参数),专为端侧智能体(On-Device Agentic Workflows)设计。与此同时,ExecuTorch 正式提供了对 Muse Glimmer 在 NVIDIA GPU 和 Apple Silicon 上的端到端运行支持,标志着本地 AI 开发从“重写模型”迈向“一次定义,全栈部署”的新阶段。

为什么是 ExecuTorch?

传统的本地 AI 框架往往需要将模型重新编写为 C++ 或其他非 Python 语言,这在 LLM 仍是标准文本 Transformer 时行之有效。然而,随着模型架构日益复杂、多模态输入输出普及以及 DFlash 等先进解码算法的出现,跨后端重写模型已无法规模化。

ExecuTorch 采取了不同的路径:开发者在 PyTorch 中实现模型及其解码策略,导出后由框架自动完成后端特定的降维(lowering)与优化。通过提前编译(Ahead-of-Time Compilation),ExecuTorch 对整个执行路径进行端到端优化,而非仅针对单个操作。

核心突破与功能特性

Muse Glimmer 依托 ExecuTorch 的强大能力,实现了多项关键特性:

  • 原生多模态支持:无缝处理文本与图像输入,支持直接 GGUF 导出。
  • 极致推理速度:集成 DFlash 推测解码技术,在 M5 Pro (64GB) 上实现 52.8% 的性能提升(从 21.6 tok/s 提升至 33.0 tok/s),且无质量回退。
  • 超长上下文:原生支持 128K+ tokens 的上下文窗口。
  • 跨平台兼容:预构建的 PTE(PyTorch Export)包可直接在 NVIDIA CUDA 和 Apple Silicon (Metal) 上运行。

开发者如何快速上手?

PyTorch 团队已发布经过验证的 PTE 包,开发者可立即在支持的硬件上运行。

  1. 下载预构建包:访问 Hugging Face 下载包含文本及图文模态的 PTE 包(含 DFlash 选项)。
  2. 构建运行时:使用 CMake 构建 solo_runner、dflash_runner 及服务 worker。
    # 构建 CUDA 版本
    cmake --workflow --preset muse-glimmer-cuda
    # 构建 Apple Silicon 版本
    cmake --workflow --preset muse-glimmer-mlx
    
  3. 运行智能体:启动本地服务后,即可通过 pi 等智能体框架调用,自动处理代码生成、文件编辑等复杂任务。

实际应用场景

  • 多模态图像理解:在端侧设备实时分析图像内容,无需云端依赖。
  • 自主编码智能体:Muse Glimmer 驱动的智能体可自主创建游戏、迭代优化细节、调用工具安装依赖并运行测试,展现出强大的自主规划能力。

性能数据

  • M5 Pro (64GB): Solo 推理 21.6 tok/s,启用 DFlash 后达 33.0 tok/s。
  • NVIDIA A100: 在变长上下文下保持高吞吐与高接受率。

"ExecuTorch 让机器学习工程师能够专注于模型创新,而无需为后端优化耗费精力。" —— PyTorch 团队

此次发布不仅丰富了 PyTorch 的生态,更为端侧 AI 应用提供了高性能、低延迟的坚实底座。

“ExecuTorch takes a different approach. As machine learning engineers and researchers, you implement the model (and its decoding strategy) in PyTorch. Once you're ready for deployment, you export to ExecuTorch, and the framework handles backend-specific lowering...”

— PyTorch 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
P

PyTorch

开源的机器学习库

PyTorch 是开源的机器学习库,主要用在深度学习研究和应用开发,以灵活性、易用性和强大的 GPU 加速功能而闻名。PyTorch 提供动态计算图,支持开发者在运行时动态修改模型结构,非常适合快速开发和实验。PyTorch 支持张量计算、自动微分(torch.autograd)和模块化的神经网络构建(torch.nn)。PyTorch 拥有丰富的社区支持和大量的预训练模型及教程,是学术界和工业界的首选深度学习框架之一。

查看 PyTorch 使用教程与功能