AWS · ML 博客

教会模型遗忘:使用Amazon Nova进行选择性遗忘

Teaching models to forget: Selective unlearning with Amazon Nova

二〇二六年七月七日 · 英文原文

Amazon 提出反向直接偏好优化(rDPO),一种用于 Amazon Nova 可定制内容审核设置(CCMS)的遗忘技术,旨在选择性减少模型对合法请求的过度拒绝。rDPO 通过反转 DPO 目标中的偏好对,在训练模型遗忘特定 RAI 策略的同时引导其生成高质量响应。在 Amazon Nova 2 Lite 上的评估显示,rDPO 训练的 LoRA 适配器将安全、公平性等策略类别的拒绝率降低最多 54 个百分点,而指令遵循、数学推理(Math Mini)和代码生成(MBXP Python)等效用基准性能下降不到 2 个百分点。该技术由 Qian Hu、Veda Raman、Dan Sinnreich 等 Amazon 研究人员开发,客户可通过 Amazon SageMaker AI 或 Amazon Bedrock 部署预训练适配器。

部署基础模型(FM)的组织常面临一个共同挑战:为内容审核设计的模型防护机制,也可能阻碍合法且关键的业务用例。一家使用成熟语言总结剧本的媒体公司、一家模拟真实威胁的网络安全公司,或是一个处理敏感证据的法律团队,都可能发现默认的内容审核控制会拒绝他们实际需要处理的内容。例如,安全团队要求模型生成一封用于员工安全意识培训的钓鱼邮件样本,即使其意图是防御性的,也可能遭到拒绝。由于模型在后训练对齐阶段习得了这些防护机制,仅靠 prompt 工程无法克服它们。模型拒绝的倾向已嵌入其参数中,需要在模型层面进行有针对性的修改,以选择性调整这一行为。在本文中,我们将介绍反向直接偏好优化(rDPO),这是 Amazon Nova 可定制内容审核设置(CCMS)背后的新型遗忘技术,并展示它如何在保持模型质量的同时减少过度拒绝。我们还将为希望将这些偏好优化技术应用于自身实验的客户提供指导。Amazon Nova 可定制内容审核设置(CCMS)通过允许获批客户在四个负责任 AI(RAI)支柱上选择性调整防护机制来解决这一问题。这些支柱包括:安全——涵盖危险活动、武器和受控物质。敏感内容——包括脏话、裸露和霸凌。公平性——涉及偏见和文化方面的考量。安全——涉及恶意软件和恶意内容的担忧。Amazon Nova 强制执行必要且不可配置的控制措施,以确保 AI 的负责任使用,例如防止对儿童造成伤害和保护隐私的控制。CCMS 背后的科学原理是遗忘(unlearning),这是一种无需从头重新训练即可从模型参数中选择性移除已学习行为的技术。我们训练低秩适配(LoRA)适配器来逆转模型对特定策略的对齐。结果得到一个自定义模型变体,它在客户批准的策略区域内生成内容,同时在其他所有区域保持对齐。解决方案 LoRA 适配器训练 CCMS 通过向客户提供一个经过训练的 LoRA 适配器来工作,该适配器已学会从核心模型中遗忘特定的 RAI 策略。当客户导入此适配器时,他们会获得一个由唯一 Amazon Resource Name(ARN)标识的自定义模型。在推理时,该适配器引导核心模型避免在客户批准的策略区域内拒绝内容。此外,当使用该自定义模型 ARN 时,Nova 的输出审核护栏会根据客户批准的策略进行配置。rDPO:一种新颖的遗忘方法 关键的科学挑战在于如何有效地执行这种遗忘:模型必须停止在目标策略区域内拒绝内容,同时保持其通用能力(指令遵循、编码、数学)并在非目标区域保持对齐。直接的微调方法有降低整体模型质量的风险。一种最先进的方法是负偏好优化(NPO),它建立在直接偏好优化(DPO)之上。DPO 是一种偏好优化方法,它训练模型将偏好响应排在非偏好响应之上,相对于一个参考模型。它使模型向偏好响应靠近,远离非偏好响应。NPO 通过从优化目标中移除正样本来实现遗忘,有效地训练模型远离其已学习的拒绝行为。然而,NPO 只教会模型遗忘,而没有引导它生成高质量的替代响应,这可能导致输出质量下降。为了解决这个问题,我们开发了 rDPO,它反转了 DPO 目标中的偏好对。rDPO 不仅仅是让模型遗忘,同时还会引导它在已遗忘的策略区域内生成高质量响应。这种双重目标不仅产生了更好的响应质量,还提高了训练效率,需要更少的优化步骤即可收敛。下图展示了 DPO、NPO 和 rDPO 损失函数的比较:在 DPO 损失中,y_w、y_l 分别是偏好响应和非偏好响应,其中 w 和 l 分别表示获胜和失败的响应。损失函数优化模型,使偏好响应的排名高于非偏好响应。在 NPO 损失中,y_f 是要遗忘的响应,NPO 损失训练模型远离 y_f。在 rDPO 中,y_t 是目标响应,y_f 是要遗忘的响应。rDPO 损失函数教会模型远离遗忘响应,同时靠近目标响应。我们将我们的方法称为 rDPO,因为其训练目标与原始模型后训练阶段应用的 DPO 是相反的。下图展示了 NPO 和 rDPO 的训练动态及其在评估数据集上的表现。从训练动态可以看出,rDPO 的训练准确率在大约第 30 步时收敛到接近 1,而 NPO 的训练准确率变化不大。rDPO 所选响应(即目标响应)的训练奖励持续增长,而 NPO 的则持续下降。这意味着 rDPO 将模型的行为移向目标响应,而 NPO 很难让模型远离遗忘响应并移向目标响应。这很可能是因为基础模型具有很强的 RAI 对齐,使得难以远离安全响应。我们在 NPO 和 rDPO 在评估数据集上的表现中可以看到类似的趋势。训练动态图显示,在遗忘性能方面,rDPO 比 NPO 高效得多。定制化流程 下图展示了模型定制化流程。它从数据准备开始,其中策划了一组 prompt 来表示我们希望遗忘对齐行为的目标策略区域。给定这些 prompt,我们生成遗忘响应和目标响应。我们使用 rDPO 和生成的数据训练一个模型。训练循环完成后,LoRA 适配器被导出并准备提供服务。我们选择 LoRA 微调是因为其训练效率高,且与全秩微调相比推理成本更低。结果 我们从两个维度评估 RAI 定制化模型:(1) 减少对敏感请求的过度拒绝,以及 (2) 保持通用模型能力。拒绝率衡量模型拒绝回答的 prompt 百分比。对于基线模型,在敏感内容上的高拒绝率表明合法请求被阻止。定制化后较低的拒绝率意味着模型现在能够成功处理这些请求。下表显示了五个评估类别中的拒绝率:模型 红队 Prompt 公平性 安全 安全 敏感内容 基线 98.10% 51.84% 86.51% 91.61% 79.02% RAI 定制化模型 47% 23.83% 32.77% 45.73% 33.58% 结果显示,所有策略类别的拒绝率均大幅下降。安全拒绝率从 86.51% 降至 32.77%(下降了 53.74 个百分点)。定制化模型现在能够处理基线模型原本会拒绝的大多数安全相关请求。在公平性(下降 28 个百分点)、安全(下降 46 个百分点)和敏感内容(下降 45 个百分点)方面也看到了类似的改进。重要的是,这些降低是通过 rDPO 训练的 LoRA 适配器实现的,无需对基础模型权重进行任何修改。任何遗忘方法的一个关键要求是它不能降低模型的通用能力。为了验证这一点,我们在三个效用基准上评估了定制化模型:指令遵循、数学推理(Math Mini)和代码生成(MBXP Python):模型 指令遵循 Math Mini MBXP Python 基线 94.12% 86.40% 74.80% RAI 定制化模型 92.57% 85.20% 73% 定制化模型在所有效用基准上保持了接近基线的性能,指令遵循仅下降 1.55 个百分点,数学下降 1.20 个百分点,代码生成下降 1.80 个百分点。这些微小的退化证实了 rDPO 方法成功地仅针对 RAI 对齐参数,同时保持了模型的核心能力,这是基于 LoRA 的方法相对于全模型微调的关键优势。入门指南 本文中描述的偏好优化技术,包括 DPO、NPO 和 rDPO,可供希望自行探索遗忘和对齐研究的客户使用。Amazon SageMaker AI 支持对 Amazon Nova 和超过 20 个开放权重模型使用全秩和 LoRA 方法进行 DPO 训练,Amazon SageMaker HyperPod 提供了现成的 DPO 配方,可作为自定义遗忘实验的起点。请参阅《在 Amazon SageMaker AI 中使用直接偏好优化自定义 Amazon Nova》获取分步指南。对于希望获得遗忘好处但不想自行构建的客户,CCMS 为 Amazon Nova 提供了预训练的 LoRA 适配器,可直接部署。适配器通过 AWS Resource Access Manager(AWS RAM)共享。在您接受并将适配器复制到您的账户后,它会在 Amazon Bedrock 中显示为一个具有唯一 ARN 的自定义模型。然后,您创建一个按需推理自定义模型部署,并在标准 Converse API 中使用该自定义模型部署 ARN。无需其他代码更改:aws bedrock-runtime converse \ --model-id "arn:aws:bedrock:us-east-1: :custom-model-deployment/ " \ --region us-east-1 \ --messages '[{"role": "user", "content": [{"text": "Your prompt here"}]}]' 注意:部署自定义模型会产生标准的 Amazon Bedrock 推理费用。详情请参阅 Amazon Bedrock 定价。定制化模型在未配置的策略区域中,行为与基础 Nova 模型完全相同。对于额外的应用层防护,您可以将 CCMS 与 Amazon Bedrock Guardrails 结合使用,在已配置的模型之上实现主题特定过滤、幻觉检测或自定义内容策略。要请求访问并讨论为您的用例配置哪些策略支柱,请联系您的 AWS 客户团队或从 AWS Support Center Console 创建支持案例。结论 在本文中,我们介绍了反向 DPO(rDPO),一种基于偏好的遗忘技术。它解决了现有方法(如 NPO)的一个关键局限性:无法在遗忘目标行为的同时引导模型生成高质量响应。通过反转 DPO 目标中的偏好对,rDPO 在单个训练信号中实现了这两个目标,比 NPO 收敛更快,输出质量更好。由于需要的训练迭代次数更少,rDPO 还减少了为客户生成定制化适配器所需的时间和成本。我们在 Amazon Nova 2 Lite 上的评估表明,rDPO 训练的 LoRA 适配器将 RAI 策略类别中的拒绝率降低了多达 54 个百分点,同时效用基准的下降幅度不到 2 个百分点。重要的是,这些定制化操作在 Amazon Nova 通用、不可配置的保护措施范围内进行,确保无论适配器配置如何,核心防护机制都保持完整。基于 LoRA 的方法特别适合这个问题:它将遗忘隔离到一小部分适配器参数中,保持基础模型的完整性,并支持模块化部署,使得可以从同一个基础模型提供不同的策略配置。这些技术为 Amazon Nova CCMS 提供了动力,该服务为客户提供预训练的适配器,可使用 Amazon Bedrock 直接部署。对于有兴趣进一步探索基于偏好的遗忘的研究人员和从业者,Amazon SageMaker AI 提供了 DPO 训练配方,可作为自定义实验的基础。有关在 Amazon SageMaker AI 中定制 Nova 的更多说明,请参阅我们关于 Nova 定制化以及在 Amazon SageMaker AI 上进行高级微调方法的文档和博客。致谢 本项目的贡献者包括 Ekraam Sabir、Weitong Ruan、Payal Motwani、Rahul Gupta、Claire O’Brien Rajkumar、Dhwanil Desai 和 Nikhil Sanil。关于作者 Qian Hu Qian 是 Amazon AGI Foundations RAI 团队的高级应用科学家,专注于负责任 AI,包括护栏模型、RAI 定制化和后训练对齐。Veda Raman Veda 是 AWS 的 Amazon Nova 和 Agentic AI 高级生成式 AI 解决方案架构师。她帮助客户使用 Amazon Nova 模型和 Amazon Bedrock AgentCore 设计和构建 Agentic AI 解决方案。她之前曾与客户合作,使用 Amazon SageMaker 构建机器学习解决方案,并在 AWS 担任无服务器解决方案架构师。Dan Sinnreich Dan 是 Amazon 的高级产品经理,负责为 Amazon Nova 模型构建 AI 安全控制。此前,他为 Amazon SageMaker 构建了无代码/低代码机器学习功能,使更广泛的从业者能够使用机器学习。在工作之外,他喜欢打冰球和阅读科幻小说。

译自 AWS · ML 博客 · 录于 二〇二六年七月七日