OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用
What Is Nemotron 3.5 Lightning
精选理由
OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。
AI 摘要
OpenRouter 发文解读 NVIDIA 的 Nemotron 3.5 Lightning,这是一款 30B 总参数、约 3B 激活参数的混合专家开源权重模型,定位于工具调用、编码等高频、边界清晰的 Agent 执行步骤,与负责复杂推理的 Nemotron 3 Ultra(550B 总参数、55B 激活)形成分工。
正文 · AI 翻译
一个智能体可能会为规划一项任务做一次困难的调用,而为执行该任务再做几十次调用。后面这些调用会读取文件、选择工具、验证结果,并决定下一步该做什么。NVIDIA 构建 Nemotron 3.5 Lightning 正是为了应对工作流中这一高频部分。
Nemotron 3.5 Lightning 是一个 30-billion-parameter 的混合专家模型,每个 token 激活约 3 billion parameters。它支持工具调用、编码任务、指令遵循以及其他范围明确的智能体步骤。
这个名字很容易与 Nemotron 3 Ultra 混淆,但这两个模型是为智能体工作流的不同部分而构建的。在它们之间做选择会影响整个运行过程的成本、延迟和可靠性。
Nemotron 3.5 Lightning 一览
规格Nemotron 3.5 Lightning
模型类型混合 Mamba-2、注意力与混合专家语言模型
模型规模30B total parameters,3B active
输入与输出文本到文本
模型上下文限制根据 NVIDIA 的模型卡,最高可达 100 万 tokens
OpenRouter 标准模型在所有当前提供商上均为 262,144-token 上下文。补全限制因提供商而异,从 32,768 到 235,929 tokens 不等
OpenRouter 免费模型1,000,000-token 上下文,最高 65,536 补全 tokens
工具调用两个模型均已列出。当前四家标准提供商中有两家列出该功能
结构化输出标准模型在当前全部四家提供商上均已列出。免费模型未列出
OpenRouter 模型 IDnvidia/nemotron-3.5-lightning 和 nvidia/nemotron-3.5-lightning:free
权重BF16 参考权重,以及优化后的 NVFP4 和 GGUF 版本
许可证OpenMDW-1.1
发布2026 年 8 月 11 日
本表中的端点限制和功能来自我们 2026 年 9 月 11 日的模型页面。在围绕特定限制进行设计之前,请查看 标准模型页面或免费模型页面。
30B MoE 且激活参数为 3B 是什么意思?
Nemotron 3.5 Lightning 是一个稀疏混合专家模型。它总共包含 300 亿参数,但并非每个 token 都会用到所有专家。模型处理每个 token 时,路由器会选择一小部分专家,使激活参数数量约为 30 亿。你也会看到它被写作 30B-A3B,意思是总参数 300 亿、激活参数约 30 亿。
这种设计让模型拥有比 3B 稠密模型更大的总容量,同时无需为每个 token 运行全部 300 亿参数。Lightning 正是以此将相对较大的检查点与频繁智能体调用所需的吞吐量结合起来。
激活参数数量并不是完整的计算或内存规格。完整模型仍然需要存储,共享层在推理期间也会运行。硬件需求取决于精度、上下文长度、推理引擎、批处理策略和缓存配置。
Lightning 同样采用了混合架构,而非纯 Transformer 堆栈。NVIDIA 模型卡描述了交错排列的 Mamba-2 与 MoE 层,并配有选定的注意力层。它还支持可配置推理,并附带多 token 预测以及两个投机解码草稿模型 DSpark 和 DFlash,以实现更快的生成,同时还提供了一个针对推理调优的 NVFP4 检查点。
Nemotron 3.5 Lightning 是为哪些用途设计的?
长时间运行的智能体会发起大量模型调用。有些调用需要复杂的规划。而大部分工作则更为狭窄,例如选择工具、生成参数、检查结果、编辑文件,或决定下一步该做什么。
NVIDIA 将 Lightning 定位在这一执行层。当你的工作负载具备以下特征时,该模型就是一个候选选择:
智能体会发起大量调用,且延迟或成本会在整个运行过程中不断累积。
每次调用都有明确的目标以及足以完成它的上下文。
模型需要使用工具、遵循指令,或返回结构化数据。
你希望获得开放权重,以便针对某个领域或部署目标进行定制。
例如,一个编码智能体可以使用更大的推理模型来检查代码仓库并确定实现方案。随后,Lightning 可以处理各个具体步骤,例如定位符号、编辑单个文件、运行工具以及解读结果。
Nemotron 3.5 Lightning 与 Nemotron 3 Ultra 对比
NVIDIA 从 Nemotron 3 Ultra 蒸馏出了 Lightning,但这两个模型并不能互换使用。Lightning 是较小的模型,用于高并发的智能体执行。Ultra 是较大的模型,用于复杂推理和编排。
Nemotron 3.5 LightningNemotron 3 Ultra
OpenRouter 模型 IDnvidia/nemotron-3.5-lightningnvidia/nemotron-3-ultra-550b-a55b
总参数量30B550B
激活参数量3B55B
主要角色高吞吐量执行与专项任务复杂推理与编排
OpenRouter 上的上下文在所有当前提供商上均为 262,144 tokens202,800 至 262,144 tokens,视提供商而定
工具调用在四家当前提供商中的两家上提供在所有当前提供商上提供
结构化输出在所有当前提供商上提供在四家当前提供商中的一家上提供
2026 年 9 月 11 日的提供商价格输入 $0.065 至 $0.10/M,输出 $0.18 至 $0.25/M输入 $0.50 至 $0.625/M,输出 $2.20 至 $3.125/M
NVIDIA 报告称,Lightning 的吞吐量最高可达同等规模开源模型的四倍。在 NVIDIA 的 PinchBench 测试中,它以相当的准确率将 10,000 个智能体任务完成速度提升了最高 30%。这些是厂商报告的结果,因此请在你自己的工作负载上测试吞吐量和任务完成情况。
区别在于调用的难度和后果。当一个步骤需要对模糊问题进行深度推理、为长工作流制定计划,或做出难以逆转的决策时,Ultra 更为合适。当任务范围明确且重复频率足够高、延迟和成本变得重要时,Lightning 更为合适。
你不需要为整个智能体分配一个模型。将复杂调用路由到 Ultra,将频繁的执行调用路由到 Lightning。然后衡量这种组合是否在不降低可靠性的前提下改善了每个已完成任务的成本。
在 OpenRouter 上在两个模型之间进行路由
如果你更愿意将模型选择交给我们,请使用 Auto Router。将 openrouter/auto 作为模型 ID 发送,Auto Router 会根据任务类型、模型能力、工具支持和成本对提示词进行分类,然后选择模型。cost_tier 设置用于选择成本区间,从 low 到 max。它不会将对话从较便宜的模型升级到较贵的模型。如果你希望 Auto Router 仅在 Lightning 和 Ultra 之间选择,请用 allowed_models 限制其选择范围。
在 OpenRouter 之外在两个模型之间进行路由
NVIDIA 的 NeMo Switchyard 将这种路由模式实现为一个开源编排层。其升级路由器在每次对话开始时使用成本较低的模型,当 LLM 裁判检测到持续困难时,会将会话转移到能力更强的模型。在 LangChain 的评估中,针对 145 个多步骤智能体任务,在 Lightning 和 Claude Opus 4.8 之间进行路由,与仅使用前沿模型的基线相比,成本降低了 74%,同时约 7% 的调用被发送到前沿模型。准确率大约低了六个百分点。这一结果展示了该基准测试上的路由权衡。它并不是 Lightning 与 Ultra 组合的基准测试。在你依赖节省效果之前,请先在自己的任务上测试任何路由设置。
上下文窗口有多大?
Nemotron 3.5 Lightning 在模型层面支持最多 100 万 token。你的应用程序可用的上下文取决于为其提供服务的端点。
2026 年 9 月 11 日,标准模型 ID 背后的每个提供商都提供 262,144 token 的上下文窗口。补全限制因提供商而异,从 32,768 到 235,929 token 不等。:free 模型提供完整的 100 万 token 上下文窗口,并将补全上限设为 65,536 token。
如果某个请求需要超过 262,144 token,目前在 OpenRouter 上只有免费端点提供该模型完整的 100 万 token 上下文。NVIDIA 在该端点上的通知指出,使用情况会被记录,用于安全目的以及改进 NVIDIA 产品和服务,并要求你不要上传机密信息或个人数据。对于敏感或生产环境的长上下文工作负载,请选择其他端点或模型。
当你在这两个模型 ID 之间切换时,这一差异很重要。一个在免费端点上成功的请求,可能会超出标准端点的上下文限制。免费端点还列出了工具调用,但没有列出 response_format 或结构化输出。
请查看模型页面,而不要把架构的最大上下文当作每个提供商都会兑现的承诺。我们在模型页面上展示每个端点的当前限制和支持的参数。
开放权重与本地部署
NVIDIA 在 OpenMDW-1.1 许可下发布了 BF16 参考检查点。模型卡将 BF16 版本描述为后训练、领域适配、研究以及产出优化变体的起点。NVIDIA 还发布了用于定制和评估的训练数据与配方,模型卡称该版本已可用于商业用途。
对于直接推理,NVIDIA 推荐其 NVFP4 版本。它还为受支持的本地系统提供了 GGUF 检查点。BF16 指南列出单 GPU 部署需要 H100 80GB 或 A100 80GB。优化版本面向 RTX 5090、RTX PRO 6000 和 DGX Spark 等硬件。
在本地运行该模型并不意味着每台机器都能提供完整的 100 万 token 上下文窗口。在 NVIDIA 当前的 Ollama 指南中,默认上下文随可用 VRAM 而变化。低于 24GB 时为 4K,24GB 至低于 48GB 时为 32K,48GB 及以上时为 256K。llama.cpp 示例使用约 40K。你可以提高这些限制,但这样做可能需要更多内存或 CPU 卸载。
权重已公开可用,而“开放权重”是最清晰的描述。在你重新分发修改后的模型或根据其条款做出部署决策之前,请先阅读 OpenMDW-1.1 许可证。
如何在 OpenRouter 上调用 Nemotron 3.5 Lightning
如果你不想自行配置 GPU 或管理推理引擎,可以通过 OpenRouter 调用 Lightning。标准模型 ID 保持相同的 API,同时我们会针对该模型在可用提供商之间路由请求。
安装 OpenRouter TypeScript SDK。
npm install @openrouter/sdk
在你的环境中设置 OPENROUTER_API_KEY,然后使用 Lightning 模型 ID 发送请求。该标准模型列出了结构化输出,因此你可以要求一个 JSON schema,并让响应符合该 schema。
import { OpenRouter } from "@openrouter/sdk";
const openRouter = new OpenRouter({ apiKey: process.env.OPENROUTER_API_KEY, });
const result = await openRouter.chat.send({ chatRequest: { model: "nvidia/nemotron-3.5-lightning", messages: [ { role: "user", content: 'Ticket: "Checkout returns a 500 after I click Pay. Started this morning, three customers affected." Return its category and priority.', }, ], responseFormat: { type: "json_schema", jsonSchema: { name: "triage", strict: true, schema: { type: "object", properties: { category: { type: "string" }, priority: { type: "string", enum: ["low", "medium", "high"] }, }, required: ["category", "priority"], additionalProperties: false, }, }, }, provider: { requireParameters: true, }, }, });
if (!("choices" in result)) { throw new Error("Expected a non-streaming response"); }
console.log(result.choices[0]?.message.content);
当我们在 2026 年 9 月 11 日运行此请求时,模型返回了 {"category": "Bug (Payment Checkout)", "priority": "medium"}。采样输出在不同运行之间会有所变化,请求所保证的是 schema,而非具体的值。
在同一模型内,各提供商对 response_format 和结构化输出的支持各不相同。默认情况下,我们优先选择支持你所发送的 tools 和 response_format 参数的提供商,而不支持某个参数的提供商会忽略该参数。如示例所示,将 require_parameters 设置为 true,会把请求限制在支持其中每一个参数的提供商范围内。完整行为请参阅 提供商路由文档。
要试用免费端点,请将模型 ID 改为 nvidia/nemotron-3.5-lightning:free。免费端点不列出 response_format,因此在那里去掉该字段,并自行验证 JSON。它适用于评估和小规模实验,并且其限制和可用性与标准端点不同。
不要通过免费端点提交机密信息或个人数据。其模型页面载有 NVIDIA 的声明,称使用情况会被记录,用于安全目的以及改进 NVIDIA 产品和服务。在决定发送哪些提示词之前,请先阅读该声明。
默认情况下,我们会按价格排序,在标准模型的各个提供商之间进行负载均衡。有两个变体会改变这一排序。nvidia/nemotron-3.5-lightning:nitro 按吞吐量对提供商排序,nvidia/nemotron-3.5-lightning:exacto 则优先选择工具调用质量信号更强的提供商。对于为延迟和工具使用而选择的模型,Nitro 和 Exacto 是两个值得了解的变体。
Lightning 接受 tools 和 tool_choice,因此你也可以在智能体循环中使用它。请参阅我们的 工具调用智能体循环指南,了解完整的请求、工具执行和迭代流程。
你应该使用 Nemotron 3.5 Lightning 吗?
当你需要一个快速、开放权重的模型来处理频繁、定义明确的智能体步骤时,Nemotron 3.5 Lightning 值得评估。其 30B-A3B 架构、工具支持以及较低的标价 token 价格,使其成为智能体的候选执行模型——否则这些智能体会把每次调用都发送给大得多的推理模型。
把模型名称当作起点,而不是决策依据。基于你的智能体所执行的工具调用和任务构建一套评估集。衡量整个运行过程中的任务成功率、重试次数、延迟和总成本。如果智能体反复重试或频繁升级处理结果,以至于抵消了节省的成本,那么更便宜的调用也无济于事。
从 nvidia/nemotron-3.5-lightning 开始,或者使用 nvidia/nemotron-3.5-lightning:free 在引入付费流量之前测试模型。
常见问题
什么是 Nemotron 3.5 Lightning?
Nemotron 3.5 Lightning 是 NVIDIA 的开源权重 30B 混合专家语言模型,每个 token 约激活 3B 参数。NVIDIA 将其定位用于高并发智能体执行、工具调用、编程、指令遵循和专业化任务。
Nemotron 3.5 Lightning 和 Nemotron 3 Ultra 是同一个模型吗?
不是。Nemotron 3.5 Lightning 的总参数量为 30B,激活参数为 3B。Nemotron 3 Ultra 的总参数量为 550B,激活参数为 55B。Lightning 面向高频执行步骤。Ultra 面向复杂推理和编排。
30B-A3B 是什么意思?
30B-A3B 意味着该模型总共有 30 billion 参数,每个 token 约激活 3 billion 参数。混合专家路由器为每个 token 选择模型专家中的一个子集,而不是运行所有专家。
Nemotron 3.5 Lightning 支持工具调用和结构化输出吗?
标准 OpenRouter 模型 nvidia/nemotron-3.5-lightning 在其支持的参数中列出了 tools、tool_choice、response_format 和结构化输出。支持情况因提供商而异,因此如果你的请求依赖其中某一项,请将 require_parameters 设置为 true。免费模型列出了 tools 和 tool_choice,但没有列出 response_format 或结构化输出。
有免费的 Nemotron 3.5 Lightning API 吗?
有。我们列出了 nvidia/nemotron-3.5-lightning:free,由 NVIDIA 提供,不收取 token 费用。免费模型的速率限制和可用性与付费模型不同,并且该端点附有 NVIDIA 数据声明。请勿通过它发送机密信息或个人数据。
我可以在本地运行 Nemotron 3.5 Lightning 吗?
可以。NVIDIA 在 OpenMDW-1.1 许可下发布了 BF16、NVFP4 和 GGUF 权重。BF16 参考检查点面向单块 80GB H100 或 A100。NVFP4 和 GGUF 版本面向受支持的本地硬件,例如 RTX 5090、RTX PRO 6000 和 DGX Spark。在选择部署方案之前,请查看 NVIDIA 当前的模型卡和许可。
原文
Original Title
What Is Nemotron 3.5 Lightning
Source
OpenRouter:Announcements(RSS)
Site
openrouter.ai
Author
OpenRouter
Published
2026-09-22 08:00