NVIDIA 发布 Nemotron 3.5 Lightning:专为高频 Agent 执行打造的 MoE 新标杆
在 AI 代理(Agent)应用日益复杂的今天,如何平衡推理能力、响应速度与成本成为开发者面临的核心挑战。NVIDIA 近日发布了 Nemotron 3.5 Lightning,一款专门针对 Agent 高频执行环节优化的 300 亿参数混合专家(MoE)模型。与用于复杂规划与推理的 Nemotron 3 Ultra 不同,Lightning 定位为“执行层”专家,旨在解决 Agent 在长运行过程中因大量调用导致的延迟累积和成本激增问题。
核心架构:30B MoE 与混合 Mamba 架构
Nemotron 3.5 Lightning 采用了稀疏混合专家(Sparse MoE)架构,总参数量达到 300 亿,但每个 token 仅激活约 30 亿参数(标记为 30B-A3B)。这种设计使得模型拥有比同等参数量的稠密模型更大的容量,同时避免了全量计算带来的高延迟。
更值得一提的是其混合架构设计:
- Hybrid Mamba-2 & Attention:结合了高效的 Mamba-2 状态空间模型与注意力机制,显著提升了长上下文处理能力。
- 多投机解码(Multi-Token Prediction):内置 DSpark 和 DFlash 两个草稿模型,大幅加速生成过程。
- NVFP4 量化:针对推理优化的检查点格式,进一步降低显存占用。
性能突破:四倍吞吐量与 30% 加速
根据 NVIDIA 的 PinchBench 测试数据,Nemotron 3.5 Lightning 在保持相当准确度的情况下,将 10,000 个 Agent 任务的完成速度提升了 30%。此外,NVIDIA 报告称其吞吐量可达同类开源模型的 四倍。在 OpenRouter 平台上,该模型支持高达 100 万 token 的上下文窗口(免费版本),并支持工具调用与结构化输出。
应用场景:Agent 执行层的最佳选择
NVIDIA 明确指出,Nemotron 3.5 Lightning 最适合以下场景:
- 高频工具调用:如 Agent 需要反复读取文件、选择工具、验证结果。
- 明确指令遵循:每个调用目标清晰,上下文充足。
- 结构化数据输出:需要返回 JSON 等格式数据。
- 领域定制:利用开源权重进行微调,适配特定行业需求。
例如,在一个代码 Agent 工作流中,Nemotron 3.5 Ultra 可用于分析仓库并制定实施计划,而 Nemotron 3.5 Lightning 则负责具体的符号定位、文件编辑、工具运行及结果解释等执行步骤。
开发者指南
开发者可通过 OpenRouter 调用该模型,模型 ID 为 nvidia/nemotron-3.5-lightning 或免费版的 nvidia/nemotron-3.5-lightning:free。该模型采用 OpenMDW-1.1 许可证,支持 BF16、NVFP4 及 GGUF 等多种权重格式,便于本地部署与定制。
“NVIDIA 构建 Nemotron 3.5 Lightning,正是为了应对 Agent 工作中那些高频率的调用环节。” —— NVIDIA 官方说明
随着 Agent 应用从简单的对话转向复杂的自主任务执行,Nemotron 3.5 Lightning 的出现标志着 AI 模型开始根据工作流的不同阶段进行精细化分工,为构建更高效、更经济的智能系统提供了新的技术路径。