AWS · ML 博客

NVIDIA Nemotron 3.5 Lightning 现已上线 Amazon SageMaker JumpStart

NVIDIA Nemotron 3.5 Lightning now available in Amazon SageMaker JumpStart

二〇二六年八月十七日 · 英文原文

NVIDIA 发布 Nemotron 3.5 Lightning,一个由 Nemotron 3 Ultra 蒸馏的 30B 总参数、3B 激活参数的 MoE 开放模型,专为高吞吐量 agentic 工作负载设计。该模型支持 1M token 上下文和 DFlash 投机解码,吞吐量最高提升 4 倍,任务完成速度提升 30%。现可通过 Amazon SageMaker JumpStart 部署,支持 NVFP4 和 BF16 变体,适用于个人 agent、金融、网络安全、电信和零售等场景。

NVIDIA Nemotron 3.5 Lightning 专为高吞吐量的 agentic 工作负载所需的快速、专业化模型执行而设计。借助 Amazon SageMaker JumpStart 上的 NVIDIA Nemotron 3.5 Lightning,您可以访问一个专为高吞吐量 agentic 工作负载设计的开放模型。通过本次发布,您可以从 Amazon SageMaker JumpStart 部署 Nemotron 3.5 Lightning,无需自行配置 serving 基础设施。NVIDIA 将 Lightning 描述为其同类中速度最快的开放模型,适用于始终在线的 agent。在高吞吐量 agentic 工作负载中,它可提供高达 4 倍的吞吐量提升和高达 30% 的任务完成速度提升。该模型总参数量为 30B,但仅有 3B 激活参数,可在单个受支持的 GPU 上运行。因此,agent 工作流中重复、专业化的步骤无需前沿级基础设施即可执行。在本文中,我们将向您展示如何从 SageMaker JumpStart 部署 Nemotron 3.5 Lightning。

NVIDIA Nemotron 3.5 Lightning 概述

Nemotron 3.5 Lightning 是一个公开可用的基础模型,由 NVIDIA 的前沿模型 Nemotron 3 Ultra 蒸馏而来,并与 Nemotron Coalition 合作开发。它采用混合专家(MoE)架构,并专门针对主流 agent harness 中的 agentic 工具使用进行了训练。该模型基于开放数据集训练并以开放模型形式发布,因此您可以对其进行定制、拥有生成的权重,并将其部署到 agent 运行的任何环境中。下表总结了 NVIDIA Nemotron 3.5 Lightning 的关键规格和性能特征。

规格 详情
架构 混合专家(MoE)
参数 30B 总参数 / 3B 激活参数
上下文长度 最高 1M tokens
输入/输出 文本输入,文本输出
投机解码 DFlash
吞吐量 高吞吐量 agentic 工作负载最高提升 4 倍
任务完成速度 最高提升 30%
蒸馏自 NVIDIA Nemotron 3 Ultra

并非每个 agent 步骤都需要前沿模型

始终在线的 agent 持续工作:它们收集上下文、观察环境、基于已知信息进行推理并采取行动。这些步骤中的许多可能涉及模型调用,但并非所有步骤都需要相同级别的能力。规划多阶段工作流或编排子 agent 可能需要前沿级别的推理能力。而分类警报、从表单中提取字段或根据策略检查记录,通常可以由更小、更专业的模型处理。这些任务可能占据调用量的很大比例。在许多情况下,通过单个大型模型运行所有基于模型的步骤,可能会为那些较小、专业模型即可处理的工作增加前沿模型的成本和延迟。而系统化模型方法可以将每个步骤路由到适合该任务的模型。Nemotron 3.5 Lightning 正是为该系统的吞吐量密集型端而构建。其 MoE 架构在每次前向传播中激活 30B 参数中的 3B,有助于在长时间、多轮会话中保持高吞吐量。DFlash 投机解码可进一步降低每 token 延迟。1M token 的上下文窗口允许 agent 在长时间运行的会话中携带累积状态,而无需反复重新建立上下文。如果您的技术栈中包含 NVIDIA NeMo Switchyard,它可以将各个工作流步骤路由到您选择的模型池中。Lightning 可被选用于高吞吐量的专业化步骤,其速度和领域特定准确性非常适合这些场景。

推理和 agentic benchmark 的准确性

在已发布的评估中,NVFP4 在许多任务上仍与 BF16 保持接近,如下表所示。NVIDIA 报告称,用于生成这些结果的评估方法和命令已在 NeMo Gym 中发布。准确性结果由 NVIDIA 在一致的 harness 下测量,可能与其他厂商自行报告的数字有所不同。下表比较了 Nemotron 3.5 Lightning 的 BF16 和 NVFP4 变体在关键推理和 agentic benchmark 上的表现。

Benchmark BF16 NVFP4
MMLU Pro 81.94 81.62
GPQA Diamond 75.44 75.57
SWE-bench Verified 51.56 52.80
PinchBench 85.37 83.43
IFBench 71.88 72.88
AA-LCR 52.00 49.19

针对领域准确性进行定制

组织可以使用 NVIDIA NeMo 对模型进行后训练,以适应特定领域的工具、工作流和策略,然后将生成的模型部署到所选环境中。本次发布的 SageMaker JumpStart 模型卡未开放 JumpStart 定制功能。

企业用例

Lightning 专为 agent 工作流中的专业化、高频工作而构建:

SageMaker JumpStart 入门

您可以通过 Amazon SageMaker JumpStart 部署 Nemotron 3.5 Lightning,无需手动配置 serving 框架。

前提条件

在开始之前,请确保您具备:

重要提示:部署此模型会创建 SageMaker AI endpoint,在运行期间会产生费用。有关详细信息,请参阅 Amazon SageMaker AI 定价。完成后请删除 endpoint 以避免持续产生费用。

使用 SageMaker Studio 部署

  1. 打开 Amazon SageMaker Studio。
  2. 在导航窗格中,选择 SageMaker JumpStart
  3. 搜索 Nemotron 3.5 Lightning

图 1:在 SageMaker JumpStart 中搜索 Nemotron 3.5 Lightning

  1. 选择模型卡。NVFP4 模型 ID 为 huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4。对于 BF16,请使用 huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16

图 2:SageMaker JumpStart 中的 Nemotron 3.5 Lightning 模型卡

图 3:Nemotron 3.5 Lightning 的模型卡详情

  1. 选择 Deploy
  2. 选择您的实例类型(例如 ml.g6e.24xlarge)。

图 4:选择部署实例类型

  1. 查看部署设置。默认设置适用于大多数用例。
  2. 选择 Deploy 以创建 endpoint。
  3. 在运行推理之前,请等待 endpoint 状态显示为 InService

图 5:显示 InService 的 Endpoint 状态

从 Hugging Face 部署

您也可以从其 Hugging Face 模型页面将 NVIDIA Nemotron 3.5 Lightning 部署到 Amazon SageMaker AI。在 Hugging Face 模型页面上,选择 Deploy,选择 Amazon SageMaker AI,然后选择 Deploy on SageMaker AI。这将打开 SageMaker AI 部署工作流,您可以在其中配置和部署模型。

图 6:从 Hugging Face 模型页面部署

使用 SageMaker Python SDK 部署

通过 SageMaker JumpStart,您可以访问 NVFP4 和 BF16 变体。以下示例使用 NVFP4 模型 ID huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4。对于 BF16,请使用 huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-bf16

from sagemaker.jumpstart.model import JumpStartModel

model_id = "huggingface-reasoning-nemotron-3-5-lightning-30b-a3b-nvfp4"
model_version = "*"

model = JumpStartModel(model_id=model_id, model_version=model_version)
predictor = model.deploy()

清理

为避免不必要的费用,请在完成后删除 SageMaker AI endpoint:

predictor.delete_endpoint()

结论

NVIDIA Nemotron 3.5 Lightning 将快速、专业化的 agent 执行能力带到了 Amazon SageMaker JumpStart。NVIDIA 报告称,对于高吞吐量的专业化工作,其吞吐量最高可提升 4 倍,任务完成速度最高可提升 30%。其混合 MoE 架构、3B 激活参数、DFlash 投机解码和 1M token 上下文专为高吞吐量 agent 工作流而设计。由于该模型是开放的且专为定制而设计,您可以针对自己的工具和策略对其进行后训练,并保留对生成模型的控制权。Nemotron 3.5 Lightning 可支持个人助手、金融服务、安全运营、电信和零售等领域的专业化 agent 工作负载。您现在即可从 SageMaker JumpStart 部署它。在 Amazon SageMaker JumpStart 中搜索 Nemotron 3.5 Lightning 即可开始使用。有关部署指导,请参阅 Amazon SageMaker AI 开发人员指南中的 JumpStart 基础模型用法。

关于作者

Venu Kanamatareddy Venu 是 Amazon Web Services 的 AI 专家解决方案架构师,他与高增长、AI 原生的初创公司合作,设计、扩展并运营生产级 AI 系统。

Evan Kravitz Evan 是 Amazon Web Services 的软件工程师,负责 SageMaker JumpStart 相关工作。他对机器学习与云计算的融合感兴趣。Evan 本科毕业于康奈尔大学,硕士毕业于加州大学伯克利分校。2021 年,他在 ICLR 会议上发表了一篇关于对抗神经网络的论文。业余时间,Evan 喜欢烹饪、旅行和在纽约市跑步。

Vivek Gangasani Vivek 是 Amazon Web Services 的高级机器学习解决方案架构师。他与机器学习初创公司合作,在 AWS 上构建和部署 AI/ML 应用。他目前专注于提供 MLOps、ML Inference 和低代码 ML 的解决方案。他曾参与多个不同领域的项目,包括自然语言处理和计算机视觉。

Naidile Murali Naidile 是 AWS 的产品经理,常驻华盛顿州贝尔维尤。她专注于提升 Amazon SageMaker AI 上的 AI/ML 开发者体验,包括入门引导、IDE 连接和 GPU 容量管理。在加入 AWS 之前,她曾在汇丰银行担任软件工程师。Naidile 拥有乔治城大学的 MBA 学位。

译自 AWS · ML 博客 · 录于 二〇二六年八月十七日