Anthropic · 研究

AI模型中双重用途知识的关闭开关

An off switch for dual use knowledge in AI models

二〇二六年七月九日 · 英文原文

AE Studio与Anthropic合作提出GRAM(梯度路由辅助模块)方法,通过在Transformer每层添加可移除神经元模块,将病毒学、网络安全、核物理学等双重用途知识隔离存储。实验在5000万至50亿参数七种模型规模上测试,GRAM删除模块后消除相应能力的效果与数据过滤相当,且不降低通用性能,成本仅相当于训练一个模型。该方法尚未应用于Anthropic生产模型。

本文介绍的是 AE Studio 与 Anthropic 合作开展的研究。

前沿 AI 模型的一大特点是其存储着海量知识。其中部分知识具有双重用途,既可用于善举,也可用于恶行。例如,网络安全知识既能帮助修补关键安全漏洞,也能被用来利用这些漏洞;病毒学知识既能帮助研究人员研发疫苗,也能被恶意行为者用来设计致命病原体。理想情况下,我们希望能够平衡三个独立的目标:第一,以尽可能精准的方式限制对双重用途能力的访问;第二,允许受信任的用户出于有益目的访问这些能力;第三,在实现上述目标的同时,不影响模型在其他任何任务上的性能。

当前的安全防护措施并不完美。我们训练模型拒绝有害请求,并使用分类器来筛选输入和输出中的危险内容。这些防护层能防范危险输出——但它们并未改变底层模型中存储的知识。尽管有这些防护,一个足够坚定的攻击者仍可能试图越狱模型,突破其防御以获取双重用途知识。

一种更稳健的防滥用方法是控制模型所知道的内容。我们之前已经探索过这一点:在早期工作中,我们从预训练数据中过滤掉了关于化学、生物、放射性和核武器的信息,后来还证明了双重用途知识可以被限制在模型权重的一个可移除切片中。但过滤是一种粗糙的手段。它只能产生一个具有固定能力集的模型。使用过滤方法,如果你想要一个能够讨论高级病毒学的模型版本(例如,部署在经过审查的生物安全实验室中),以及另一个不能讨论的版本,你就必须训练两个独立的模型。尤其是在前沿模型(规模庞大且训练成本极高)的情况下,对开发者来说成本将高得令人望而却步。

在与 AE Studio 合作者进行的新研究中,我们探索了一种新方法,该方法可能实现训练多个独立过滤模型的好处,但成本仅相当于训练一个模型。我们称之为 GRAM,即梯度路由辅助模块(Gradient-Routed Auxiliary Modules)。请注意,本文展示的实验结果是初步的——GRAM 尚未应用于 Anthropic 的任何生产模型,我们也不确定未来是否会应用。

GRAM 背后的理念是为模型提供专用的、可移除的隔间,用于存放每一类双重用途知识,并且在从双重用途数据中学习时,仅更新这些隔间。

具体来说,GRAM 在标准 Transformer(大型语言模型所基于的神经网络架构)的每一层都添加了额外的神经元。这些神经元被分为若干组(或“模块”),每个双重用途类别对应一个模块。在训练过程中,当模型遇到通用文本时,它会以常规方式学习。但当它遇到来自双重用途类别(例如病毒学)的文本时,规则会改变:模型可以使用其通用知识进行预测,但只有病毒学模块被允许从该文本中学习。通用权重会被暂时冻结¹。

其结果是,病毒学知识会积累在病毒学模块中,而不是扩散到整个网络。训练完成后,该模块可以直接被删除,相应的能力也随之消失。或者,在需要病毒学知识的可信部署场景中,它可以被保留在原位。知识可以根据所需的部署类型进行非常具体的定制:在我们的实验中,我们定义了四个双重用途类别,因此一次使用 GRAM 的训练运行就能产生一个可以配置成十六种不同方式的模型(四个类别各自“开启”或“关闭”)。

我们在三种日益逼真的场景中测试了 GRAM。

首先,在一个按主题标记的儿童故事合成数据集上,一个小型 GRAM 模型可以被重新配置以“遗忘”任何选定的主题,并且每种配置的性能几乎与一个从零开始训练、过滤掉该主题的独立模型相同。也就是说,以训练一个模型的成本,我们实现了通常需要在不同数据集上进行多次训练才能达到的结果。

其次,我们在一个包含网络文本、代码和科学论文的现实混合数据集上训练了一个更大的模型,涉及四个双重用途领域:病毒学、网络安全、核物理学以及一种小众编程语言(作为专门双重用途代码的代理)。每个双重用途领域对应的能力都被路由到其自身的模块。删除一个模块,其消除相应能力的效果几乎与从未在该数据上训练过一样。值得注意的是,我们发现这种删除并未降低通用性能。

我们还测试了攻击者是否能够通过训练少量恶意数据来恢复被删除的知识;GRAM 在这方面的抵抗能力与数据过滤相当。相比之下,训练后应用的“遗忘”技术仅能压制知识——通过少量微调很容易就能恢复。

第三,我们在从 5000 万到 50 亿参数的七种模型规模上进行了实验。GRAM 在每种规模下都与数据过滤的性能相匹配,并且随着模型变大,“模块开启”与“模块关闭”之间的差距也变得更宽。就计算成本而言,随着我们扩大规模,试图绕过我们防护措施的难度和成本也相对增加。

随着 AI 公司训练出能力更强的模型,限制对双重用途能力访问的需求将会增加。如今,公司通过分类器和拒绝训练来限制访问。然而,在不降低对无害请求的性能的情况下,这些防护措施很难做到稳健。像 GRAM 这样的方法提供了一条通往更稳健访问控制的潜在路径。

这是早期研究,存在明显的局限性。我们尚未在前沿规模或生产训练流程中测试 GRAM。(如上所述,它尚未应用于我们的任何 Claude 模型。)我们的评估是从下一 token 预测能力的角度量化性能,而非在真实下游任务上的表现。此外,还有一个更深的开放性问题,同样适用于数据过滤和像 GRAM 这样的方法:某些双重用途能力可能与通用知识纠缠得如此紧密,以至于没有任何方法能够将它们干净地分离。

关于我们实验的更多细节,请阅读我们 Alignment Science 博客上的文章。

译自 Anthropic · 研究 · 录于 二〇二六年七月九日