NVIDIA Nemotron 3 Ultra 现已在 Amazon SageMaker JumpStart 上线
NVIDIA Nemotron 3 Ultra now available on Amazon SageMaker JumpStart
NVIDIA Nemotron 3 Ultra 在 Amazon SageMaker JumpStart 上实现首日可用,支持一键部署。该开放大语言模型拥有 5500 亿总参数和 550 亿活跃参数,基于混合 Transformer-Mamba MoE 架构,针对 NVFP4 格式优化,上下文长度最高 1M tokens。在长时间运行的 agent 工作负载上,推理速度提升 5 倍,成本降低高达 30%。AWS 的 Dan Ferguson、Malav Shastri 和 Vivek Gangasani 参与了相关工作。
今天,我们激动地宣布,NVIDIA Nemotron 3 Ultra 在 Amazon SageMaker JumpStart 上实现首日可用。借助此次发布,您现在可以通过一键部署体验来部署 Nemotron 3 Ultra 模型。Nemotron 3 Ultra 是一个开放模型,专为长时间运行的自主 agent 中的前沿推理与编排而构建,在 agent 工作负载上提供 5 倍更快的推理速度和高达 30% 的成本降低。Nemotron 3 Ultra 针对 NVFP4 格式进行了优化,这使得模型托管更快、更具成本效益。
NVIDIA Nemotron 3 Ultra 概览
NVIDIA Nemotron 3 Ultra 是一个开放的大语言模型,拥有 5500 亿总参数和 550 亿活跃参数。它基于混合 Transformer-Mamba 专家混合(MoE)架构构建,旨在以同等质量密集模型计算成本的一小部分提供前沿智能。
| 规格 | 详情 |
|---|---|
| 架构 | 混合 Transformer-Mamba MoE |
| 参数 | 550B 总参数 / 55B 活跃参数 |
| 上下文长度 | 最高 1M tokens |
| 输入/输出 | 文本输入,文本输出 |
| 精度 | NVFP4 |
| 推理速度 | 长时间运行的 agent 工作流快 5 倍 |
| 成本 | 复杂 agent 任务降低高达 30% |
为什么 agentic AI 需要专用模型
Agent 不只是回答一次。它们会规划、调用工具、将工作委派给子 agent、检查结果,并在数百轮交互中持续进行。每一步都会增加 tokens 和计算量,因此关键指标是:在有用精度下的任务完成度、完成时间以及每任务成本。Nemotron 3 Ultra 直接解决了这一问题。其 MoE 架构每次前向传播仅激活 550B 参数中的 55B,即使在百万 token 上下文长度下也能保持高吞吐量。这意味着 agent 可以维持跨越数百轮交互的规划、工具调用和自我纠正循环,同时有助于保持连贯性并管理成本。
企业用例
Nemotron 3 Ultra 在需要持续多步推理的工作负载中表现出色:
- Agent 编排器 – 协调多个子 agent,管理跨长工具调用链的状态
- 编码 agent – 在大型代码仓库中生成、测试、调试和迭代代码
- 深度研究 – 综合多个来源的信息,在扩展上下文中保持连贯推理
- 复杂企业工作流 – 通过决策分支和错误恢复自动化多步业务流程
通过 SageMaker JumpStart 入门
您可以通过 Amazon SageMaker JumpStart 一键部署 Nemotron 3 Ultra,无需管理基础设施或配置服务框架。
前提条件
开始之前,请确保您具备:
- 一个 AWS 账户
- SageMaker JumpStart 的适当范围权限
- GPU 实例的充足服务配额(例如 ml.p5en.48xlarge、ml.p5.48xlarge 或 ml.g7e.48xlarge)
重要提示:部署此模型会创建一个 SageMaker 端点,运行期间会产生费用。像 ml.p5en.48xlarge 这样的 GPU 实例每小时可能花费数美元。详情请参阅 Amazon SageMaker AI 定价。完成后请记得删除端点以避免持续产生费用。
使用 SageMaker Studio 部署
- 打开 Amazon SageMaker Studio
- 在左侧导航窗格中,选择 SageMaker JumpStart
- 搜索 Nemotron 3 Ultra
- 选择模型卡片
- 选择 Deploy
- 选择您的实例类型(支持的实例类型为 ml.p5en.48xlarge、ml.p5.48xlarge 或 ml.g7e.48xlarge)
- 查看部署设置(默认设置适用于大多数用例)
- 选择 Deploy 创建端点
- 等待端点状态显示为 InService,然后进行推理
使用 SageMaker Python SDK 部署
import sagemaker
from sagemaker.jumpstart.model import JumpStartModel
model = JumpStartModel(
model_id="huggingface-reasoning-nvidia-nemotron-3-ultra-550b-a55b-nvfp4", # 在 SageMaker JumpStart 模型卡片中验证
role=sagemaker.get_execution_role(), # 您的 SageMaker 执行角色 ARN
)
predictor = model.deploy(accept_eula=True)
运行推理
payload = {
"messages": [{
"role": "user",
"content": "将此任务分解为子任务,识别需要哪些工具,并按顺序运行它们。"
}],
"max_tokens": 20480,
"temperature": 0.6,
"top_p": 0.95,
}
response = predictor.predict(payload)
print(response["choices"][0]["message"]["content"])
清理资源
为避免产生不必要的费用,请在完成后删除 SageMaker 端点:
predictor.delete_endpoint()
总结
NVIDIA Nemotron 3 Ultra 将前沿级推理能力引入 Amazon SageMaker JumpStart,在 agent 工作负载上提供 5 倍更快的推理速度和高达 30% 的成本降低。其混合 Transformer-Mamba MoE 架构和百万 token 上下文窗口使其专为生产级 agent 所需的持续多步推理而构建。无论您是在构建 agent 编排器、编码 agent、深度研究系统还是复杂企业自动化,Nemotron 3 Ultra 现在即可从 SageMaker JumpStart 部署。立即在 Amazon SageMaker JumpStart 中搜索 Nemotron 3 Ultra 开始使用。
关于作者
Dan Ferguson 是 AWS 的解决方案架构师,常驻美国纽约。作为机器学习服务专家,Dan 致力于支持客户高效、有效且可持续地集成 ML 工作流。
Malav Shastri 是 AWS 的软件开发工程师,在 Amazon SageMaker JumpStart 和 Amazon Bedrock 团队工作。他的职责是帮助客户利用最先进的开源和专有基础模型。Malav 拥有计算机科学硕士学位。
Vivek Gangasani 是 SageMaker Inference 解决方案架构的全球负责人。他领导 SageMaker Inference 的解决方案架构、技术市场推广(GTM)和对外产品策略。他还帮助企业及初创公司部署和优化生成式 AI 模型,并使用 SageMaker 和 GPU 构建 AI 工作流。目前,他专注于制定优化推理性能的策略和内容,以及 agent 工作流、RAG 等用例。业余时间,Vivek 喜欢徒步、看电影和尝试不同美食。