NVIDIA Nemotron 3.5 Lightning 发布:专为高频 Agent 执行设计的 30B MoE 模型

ADK OpenRouter官方 / ADK编译 2026-09-22 4 分钟 104 次浏览
速览导读 / Summary

NVIDIA 正式发布 Nemotron 3.5 Lightning,一款专为 Agent 高频执行层设计的 300 亿参数混合专家(MoE)模型。该模型仅激活约 30 亿参数,结合 Mamba-2 架构与多投机解码技术,在保持大模型推理能力的同时显著降低延迟与成本。相比 Nemotron 3 Ultra,Lightning 更适合处理工具调用、代码编辑等重复性高、上下文清晰的执行任务,为构建低成本、高吞吐的 AI 代理系统提供了新选择。

总参数量 30B 混合专家模型总参数规模
激活参数 3B 每个 token 激活的专家参数数量
上下文窗口 1M tokens OpenRouter 免费版本支持的最大上下文
吞吐量提升 4x 相比同类开源模型的性能提升

Key Insights / 核心看点

  • 1 专为 Agent 高频执行设计,300 亿参数模型仅激活 30 亿参数,平衡能力与成本。
  • 2 结合 Mamba-2 与多投机解码技术,实现四倍于同类模型的吞吐量与 30% 的任务加速。
  • 3 支持 100 万 token 上下文窗口,适用于工具调用、代码编辑等明确指令场景。
  • 4 开源权重支持多格式部署,可针对特定领域进行微调与定制。

NVIDIA 发布 Nemotron 3.5 Lightning:专为高频 Agent 执行打造的 MoE 新标杆

在 AI 代理(Agent)应用日益复杂的今天,如何平衡推理能力、响应速度与成本成为开发者面临的核心挑战。NVIDIA 近日发布了 Nemotron 3.5 Lightning,一款专门针对 Agent 高频执行环节优化的 300 亿参数混合专家(MoE)模型。与用于复杂规划与推理的 Nemotron 3 Ultra 不同,Lightning 定位为“执行层”专家,旨在解决 Agent 在长运行过程中因大量调用导致的延迟累积和成本激增问题。

核心架构:30B MoE 与混合 Mamba 架构

Nemotron 3.5 Lightning 采用了稀疏混合专家(Sparse MoE)架构,总参数量达到 300 亿,但每个 token 仅激活约 30 亿参数(标记为 30B-A3B)。这种设计使得模型拥有比同等参数量的稠密模型更大的容量,同时避免了全量计算带来的高延迟。

更值得一提的是其混合架构设计:

  • Hybrid Mamba-2 & Attention:结合了高效的 Mamba-2 状态空间模型与注意力机制,显著提升了长上下文处理能力。
  • 多投机解码(Multi-Token Prediction):内置 DSpark 和 DFlash 两个草稿模型,大幅加速生成过程。
  • NVFP4 量化:针对推理优化的检查点格式,进一步降低显存占用。

性能突破:四倍吞吐量与 30% 加速

根据 NVIDIA 的 PinchBench 测试数据,Nemotron 3.5 Lightning 在保持相当准确度的情况下,将 10,000 个 Agent 任务的完成速度提升了 30%。此外,NVIDIA 报告称其吞吐量可达同类开源模型的 四倍。在 OpenRouter 平台上,该模型支持高达 100 万 token 的上下文窗口(免费版本),并支持工具调用与结构化输出。

应用场景:Agent 执行层的最佳选择

NVIDIA 明确指出,Nemotron 3.5 Lightning 最适合以下场景:

  • 高频工具调用:如 Agent 需要反复读取文件、选择工具、验证结果。
  • 明确指令遵循:每个调用目标清晰,上下文充足。
  • 结构化数据输出:需要返回 JSON 等格式数据。
  • 领域定制:利用开源权重进行微调,适配特定行业需求。

例如,在一个代码 Agent 工作流中,Nemotron 3.5 Ultra 可用于分析仓库并制定实施计划,而 Nemotron 3.5 Lightning 则负责具体的符号定位、文件编辑、工具运行及结果解释等执行步骤。

开发者指南

开发者可通过 OpenRouter 调用该模型,模型 ID 为 nvidia/nemotron-3.5-lightning 或免费版的 nvidia/nemotron-3.5-lightning:free。该模型采用 OpenMDW-1.1 许可证,支持 BF16、NVFP4 及 GGUF 等多种权重格式,便于本地部署与定制。

“NVIDIA 构建 Nemotron 3.5 Lightning,正是为了应对 Agent 工作中那些高频率的调用环节。” —— NVIDIA 官方说明

随着 Agent 应用从简单的对话转向复杂的自主任务执行,Nemotron 3.5 Lightning 的出现标志着 AI 模型开始根据工作流的不同阶段进行精细化分工,为构建更高效、更经济的智能系统提供了新的技术路径。

“NVIDIA built Nemotron 3.5 Lightning for that high-volume part of the workflow.”

— NVIDIA 官方团队

同主题深度资讯

查看更多 →
模型发布 2026-09-24

Recraft AI 发布 V4 Styles:一文详解多参考图风格控制的底层逻辑与最佳实践

Recraft AI 正式发布 V4 Styles 功能指南,深度解析其多参考图(1-10 张)风格控制机制。文章强调单一参考图是保证风格一致性的最优解,多参考图仅在视觉逻辑高度统一(如同品牌手册)时有效,严禁混用无关风格。核心亮点包括参考图与提示词(Prompt)的明确分工、对高分辨率原图的硬性要求、以及参考图权重调节功能。该更新无需微调即可实现即插即用的风格迁移,显著提升了商业绘图的可控性与效率。

Recraft AI官方 / ADK编译 5 分钟
模型发布 2026-09-24

Reve AI 服务终止:Recraft Studio 如何成为设计师的新一代可控生成引擎

随着 OpenAI 投资及团队转移,Reve AI 正式宣布停止图像生成服务,API 已于 8 月 14 日下线,生成功能将于 9 月 27 日终止。针对寻求高可控性、矢量输出及多模型工作流的设计师,Recraft Studio 提供了从像素到矢量、从单一模型到多模态生态的完整替代方案。本文详细梳理了迁移时间表,并深度解析了 Recraft Studio 在矢量编辑、跨项目风格一致性及多模型集成方面的核心优势。

Recraft AI官方 / ADK编译 5 分钟
技术解读 2026-09-24

Recraft AI 深度解析:矢量图像的核心原理、格式规范与应用边界

Recraft AI 技术团队发布深度指南,系统阐述了矢量图像(Vector Image)的数学原理及其与位图(Raster)的本质区别。文章详细对比了 SVG、EPS、PDF 及 AI 等主流格式的特性与适用场景,并探讨了矢量图在品牌标识、工业制造及网页设计中的实际应用价值,为开发者与设计师提供清晰的选型策略。

Recraft AI官方 / ADK编译 3 分钟
AI 工具 2026-09-24

美图 AI PPT 发布全新 Print-On-Demand 设计工作流,从创意到成品一键生成

美图 AI PPT 正式推出针对按需打印(POD)场景的专业设计解决方案,填补了通用 AI 绘图在商业落地环节的空白。该工具不仅提供从创意到样品的全链路生成能力,更内置了针对 T 恤、马克杯等实体产品的尺寸适配、安全区域预留及色彩对比度优化算法。开发者与创作者可利用其‘AI 辅助概念生成’功能,快速将模糊想法转化为符合印刷标准的可编辑矢量文件,大幅降低 POD 产品的试错成本。

美图AI PPT官方 / ADK编译 4 分钟
code · 免费+付费
★ 5.0 · 120评测
O

OpenRouter

AI 模型 API 聚合平台,一个接口调用400多个模型

OpenRouter 是领先的 AI 模型API 聚合平台,一个接口调用 400 多个 AI 模型。OpenRouter通过智能路由技术优化模型选择和成本,支持自动故障转移和负载均衡,具备高可用性和性能。OpenRouter 提供隐私保护功能,支持零日志模式,支持用户根据数据政策选择合适的提供商。OpenRouter具备工具调用、实时网络搜索、图像和 PDF 处理等高级功能。OpenRouter统计功能能追踪模型使用情况,反映市场表现和用户偏好。OpenRouter 能简化 AI 的使用和管理,助力高效开发与部署。

查看 OpenRouter 使用教程与功能