使用 Amazon SageMaker AI 无服务器模型定制微调 NVIDIA Nemotron 3 模型
Fine-tune NVIDIA Nemotron 3 models with Amazon SageMaker AI serverless model customization
Amazon SageMaker AI 推出针对NVIDIA Nemotron 3模型的无服务器定制功能,首批支持Nemotron 3 Nano(总参数量30B,激活参数量3B)和Nemotron 3 Super(总参数量120B,激活参数量12B)。该系列基于混合Mamba-Transformer MoE架构,原生支持100万token上下文。SageMaker AI提供监督微调(SFT)、可验证奖励强化学习(RLVR)和AI反馈强化学习(RLAIF)三种技术,用户无需配置基础设施即可完成微调、评估与部署。
模型定制将通用AI模型转化为专业化的企业资产。通过在领域特定数据上微调基础模型(FM),企业教会AI其独特的工作流程、术语和深度领域专长,同时严格遵守品牌调性并减少幻觉。对企业而言,这不仅仅是优化,更是创造专有知识产权。微调后的模型将组织的独特智能和最佳实践编码到其架构中,从而构建出难以用现成的公开前沿模型复制的竞争优势。同时,在目标任务上微调较小的开放权重模型,其性能往往能与大得多的专有模型匹敌甚至超越。这种方法能显著节省成本,同时将敏感数据保留在安全、私有的基础设施内。
Amazon SageMaker AI 提供丰富的开源模型选择和微调技术,帮助组织根据自身需求定制基础模型。现在,SageMaker AI 推出了针对 NVIDIA Nemotron 3 模型的无服务器模型定制功能,首批支持 Nemotron 3 Nano(总参数量30B,激活参数量3B)和 Nemotron 3 Super(总参数量120B,激活参数量12B)。通过监督微调(SFT)、可验证奖励强化学习(RLVR)和AI反馈强化学习(RLAIF),您无需配置或管理任何基础设施,即可将这些高性能开放权重模型适配到特定领域和工作流程中。有关可用于无服务器模型定制的开放模型完整列表,请参阅 Amazon SageMaker AI 文档中的“定制开放权重模型”。在本文中,我们将探讨 Nemotron 3 架构的独特之处,介绍可用的微调技术,并逐步演示如何通过 SageMaker Studio 开始使用无服务器定制。
Amazon SageMaker AI 上的 NVIDIA Nemotron 3 模型概述
NVIDIA Nemotron 3 是一系列开放权重的大语言模型(LLM),基于混合 Mamba-Transformer 混合专家(MoE)架构构建,原生支持高达 100 万 token 的上下文长度。该架构交错使用三种互补的层类型:用于高效线性时间序列处理的 Mamba-2 层、用于精确关联回忆的 Transformer attention 层,以及将 token 压缩后再路由到特定专家的 Latent Mixture-of-Experts(LatentMoE)层。这种设计在每次前向传播中仅激活总参数的一小部分(例如,Super 变体在 120B 中仅激活 12B),从而以显著更低的计算成本实现高吞吐量和强准确性。这些模型通过 NeMo Gym 进行多环境强化学习,使其能够适应编码、推理和长上下文分析等领域的真实世界多步骤智能体任务。
Nemotron 3 Nano 30B
Nemotron 3 Nano 是一个小型语言模型,针对高计算效率进行了优化,同时在专业任务上保持了较强的准确性。在同类大小的开放语言模型中,Nemotron 3 Nano 在编码和推理任务上表现强劲。该模型通过 NeMo Gym 进行多环境强化学习训练,其吞吐量是前代 Nemotron 2 Nano 的 4 倍。其高效的 3B 激活参数量使其非常适合对成本和延迟敏感的高吞吐量、多智能体工作负载。有关架构和训练技术的更深入介绍,请参阅 NVIDIA 开发者博客。
Nemotron 3 Super 120B
Nemotron 3 Super 是一个更大的模型,专为需要比 Nano 更强能力、同时保持成本效益的高效多智能体 AI 和复杂推理任务而设计。Nemotron 3 Super 在软件开发、网络安全分类等复杂多智能体应用中提供了高计算效率、吞吐量和准确性。该模型在推理、编码和长上下文分析方面表现出色,同时保持足够高效以支持持续大规模运行。这使其非常适合需要持续多步推理的 IT 工单自动化、企业工作流编排和自主智能体系统。更多详情,请参阅 NVIDIA 关于 Nemotron 3 Super 的开发者博客。
SageMaker AI 无服务器模型定制
Amazon SageMaker AI 无服务器模型定制消除了微调中无差别的繁重工作。您无需配置 GPU 集群、设置分布式训练框架,或管理检查点和容错。SageMaker AI 负责处理基础设施配置和训练编排,让您可以专注于数据、业务用例和评估,并且只需按使用量付费。您可以在 AWS 文档中了解更多关于 SageMaker AI 无服务器模型定制的信息。
对于 Nemotron 3 模型,SageMaker AI 无服务器模型定制支持监督微调(SFT)、可验证奖励强化学习(RLVR)和AI反馈强化学习(RLAIF)微调技术。
| 技术 | 描述 | 最佳适用场景 |
|---|---|---|
| 监督微调(SFT) | 提供带标签的输入-输出对,教模型学习新行为。 | 所需行为的高质量示例:领域问答对、格式化工具调用、风格一致的回复或特定任务的指令补全。 |
| 强化微调(RFT / RLVR) | 使用可验证奖励强化学习(RLVR),根据奖励信号优化模型行为。模型为每个提示生成多个候选回复,奖励函数对其进行评分,模型更新其策略以偏向有效行为。 | 具有自然可验证目标的任务,如工具调用准确性、代码正确性或格式合规性。 |
| AI反馈强化学习(RLAIF) | 使用单独的 AI 模型指导模型优化。AI 模型评估模型输出并提供反馈信号,无需人工标注的奖励数据即可支持迭代策略改进。 | 调整模型语气、有用性和安全性;在人工评估成本高昂或主观性强时改进回复质量;优化开放式生成任务。 |
接下来,我们逐步介绍如何开始使用 Nemotron 3 模型的无服务器模型定制。虽然基础 Nemotron 3 模型在通用性能上表现强劲,但企业用例需要基础模型无法单独实现的领域特定行为。通过模型定制,您可以针对行业特定术语和决策模式调整这些模型,使用您组织的 API 训练可靠的工具调用,使输出与品牌调性对齐,为您的架构优化多步骤智能体推理,并通过专门化较小的 Nano 模型以在目标任务上匹配更大模型的性能来优化成本。
开始使用 SageMaker AI 无服务器模型定制
您可以通过 Amazon SageMaker Studio 控制台或使用 SageMaker Python SDK 以编程方式开始使用无服务器模型定制。在控制台上,导航到“模型”页面,选择您的 Nemotron 3 模型,然后按照引导式工作流配置训练数据并启动定制任务。或者,如果您已经在使用 SageMaker AI,您可以使用带有 agent skills 的智能体功能来加速模型定制工作流。以下部分将引导您完成前提条件、数据准备以及使用 SageMaker Studio 控制台的逐步说明。有关使用 SageMaker Python SDK 定制开源模型的详细编程示例,请参阅 AWS samples GitHub 仓库。
前提条件
开始之前,请确认您已具备:
- 一个具有 Amazon SageMaker AI 的 AWS Identity and Access Management(IAM)权限的 AWS 账户。
- 一个具有 Studio 访问权限的 SageMaker AI 域。
- 符合所需结构和格式的训练数据。
为 SageMaker AI 无服务器模型定制准备训练数据
高质量的训练数据是任何成功微调任务的基础。对于 SageMaker AI 上的无服务器模型定制,您的数据必须格式化为 JSONL(JSON Lines),其中每一行代表一个训练样本。具体的 schema 取决于您选择的技术:SFT 需要带有标签输入-输出对的对话格式示例,而 RFT(RLVR)则需要与奖励函数的地面真值配对的提示。结构正确的数据可确保模型学习您期望的行为,而不会引入噪声或格式错误。有关准备训练数据的实践演练,请参阅 SageMaker AI 无服务器模型定制工作坊的“数据准备”模块。或者,如果您正在使用 SageMaker AI,您可以使用内置的带有 agent skills 的编码智能体自动准备和验证数据格式,减少手动工作并帮助您更快进入训练阶段。
在 SageMaker AI Studio 中进行模型定制
按照以下步骤使用 SageMaker AI Studio 控制台定制 Nemotron 3 模型。
- 打开 Amazon SageMaker AI Studio,在左侧导航窗格中选择 Models。
- 在 UI 中导航到您要定制的模型。搜索“NVIDIA”以找到 Nemotron 3 模型系列,然后选择您需要的 NVIDIA 模型(
NVIDIA-Nemotron-3-Nano-30B-*或NVIDIA-Nemotron-3-Super-120B-*)进行下一步。 - 从支持的监督微调(SFT)、可验证奖励强化学习(RLVR)和AI反馈强化学习(RLAIF)微调技术中选择您的模型定制技术。为 RLVR 选择奖励函数类型时,请考虑您的任务需求。内置奖励函数(精确匹配、代码执行、数学答案)适用于具有单一客观正确答案的任务,无需额外代码。当您的任务需要更丰富的评分逻辑(如部分得分、格式检查、推理质量评估或领域特定规则)时,请选择自定义奖励函数。使用自定义奖励函数,您可以对多个信号进行评分,设计奖励以避免早期 rollout 出现全零梯度,发出可观测性指标,并编码任务所需的 Python 验证逻辑。有关编写和注册自定义奖励函数的详细指导,请参阅 RLVR 工作坊文档。
- 通过选择现有数据集(如果有)或创建新数据集(有关准备数据集的信息,请参阅上一节)来配置训练数据。
- 设置定制超参数或使用推荐的默认值。
- 选择 Submit 启动模型定制任务。SageMaker AI 会自动配置所需计算资源,执行训练任务,并捕获连续日志。训练指标默认自动记录到 SageMaker MLflow App 以进行训练跟踪。
监控训练进度
您可以在模型主页上监控状态,该页面会显示训练性能,如下方截图所示。有几个高级指标值得关注:
- Train Reward(针对 RLVR) 应稳步增加。
- Training Loss 和 Validation Loss 应分别下降并跟踪泛化情况。
- Policy Entropy(针对 RLVR) 随着模型获得信心而下降。
- Gradient Norm 应趋于稳定,表明收敛。
详细的训练和验证指标也会记录到关联的 SageMaker AI MLflow App 中,如下方截图所示。这捕获了一组全面的指标和参数,用于跟踪训练进度和模型行为。在 MLflow 跟踪 UI 中,这些指标按其衡量的组件(actor、critic、rollout、performance)进行组织,使您可以一目了然地诊断训练健康状况。
评估微调后的模型
训练完成后,您可以使用 SageMaker AI 无服务器模型定制的内置评估功能来评估微调后的模型。它提供了三种评估定制模型质量的方法,如下方截图所示:
- LLM-as-a-Judge 使用 Amazon Bedrock 前沿模型根据质量指标对回复进行评分,无需地面真值标签。
- Custom Scorer 应用您自己的奖励函数或内置评分器,生成标准的自然语言处理(NLP)指标,如 F1、ROUGE 和 BLEU。
- Benchmarks 在标准化学术基准(MMLU、BBH、GPQA、MATH、IFEval)上对模型进行评分,以全面评估推理、知识和指令遵循能力。
您还可以在评估中开启 Compare with base model,直接衡量训练后模型相对于基础模型的性能。结合之前的训练指标,MLflow 跟踪训练动态(奖励、KL 散度、损失)。评估则从最终用户角度衡量输出质量,为您提供模型微调效果的完整图景。
部署微调后的模型
直接从控制台上的模型详情页面部署您的定制模型。您也可以部署到 SageMaker Inference 端点,或者从 Amazon Simple Storage Service(Amazon S3)存储桶下载模型权重进行自管理部署。部署选项会自动填充默认值,让您可以根据流量和吞吐量需求灵活选择计算和扩展配置。下方截图展示了使用由 NVIDIA L40S Tensor Core GPU 驱动的 ml.g6e 实例部署微调后的 NVIDIA Nemotron Nano 30B。该部署使用 SageMaker inference components,默认情况下提供合并后的模型权重,其中基础模型和 LoRA adapter 被合并为一组权重以优化推理。由于这是 LoRA 微调,您也可以单独自托管和提供未合并的 LoRA adapter,因为您可以在 S3 存储桶中同时访问基础权重和 adapter 权重。部署后,您可以使用 AWS Command Line Interface(AWS CLI)或 SDK 的 invoke 方法调用端点。
清理
为避免产生不必要的费用,我们建议在使用完毕后删除您的 SageMaker AI Studio 域、SageMaker Endpoints 以及您创建的任何其他资源。使用 SageMaker AI 无服务器模型定制的具体费用取决于您选择的基础模型和定制阶段。请参阅 Amazon SageMaker AI 定价页面了解费用明细和详情。
结论
通过 Amazon SageMaker AI 上针对 NVIDIA Nemotron 3 模型的无服务器模型定制,您现在可以将这些高性能开放权重模型适配到特定领域和工作流程中。无论您是微调 Nemotron 3 Nano 以实现经济高效的智能体任务执行,还是定制 Nemotron 3 Super 以进行复杂的多智能体编排,SageMaker AI 都会处理计算配置、训练编排和指标跟踪,让您可以专注于数据、评估和部署。立即开始使用 Amazon SageMaker AI 上的无服务器模型定制。有关定制开源模型的详细示例,请参阅 AWS samples GitHub 仓库。要了解更多信息,请参阅 Amazon SageMaker AI 模型定制文档。
关于作者
Sandeep Raveesh-Babu
Sandeep 是 AWS 的 GenAI GTM 专家解决方案架构师。他与客户合作处理 LLM 训练、LLM 推理和 GenAI 可观测性。他专注于产品开发,帮助 AWS 构建和解决生成式 AI 领域的行业挑战。您可以在 LinkedIn 上联系 Sandeep,了解生成式 AI 解决方案。
Abdullahi Olaoye
Abdullahi 是 NVIDIA 的高级 AI 解决方案架构师,专注于将 NVIDIA AI 库、框架和产品与云 AI 服务和开源工具集成,以优化 AI 模型部署、推理和生成式 AI 工作流。他与云提供商合作,提升 AI 工作负载性能,并推动基于 NVIDIA 的 AI 和生成式 AI 解决方案的采用。