Anthropic · 产品发布

改进《神鬼寓言5》安全防护措施

Improving Fable 5 Safeguards

二〇二六年八月七日 · 英文原文

Anthropic更新了Claude Fable 5的生物学安全防护,将各产品界面上的生物学相关回退减少约85%。更新重写了分类器章程,细化良性用途并重新训练模型,使Fable 5能处理更广泛的生物学任务,如解读实验室结果、理解症状及教育场景。但涉及病毒学、毒理学和分子设计等双重用途请求仍回退至Opus 5,专业研究和药物开发暂不支持,Anthropic正通过可信访问途径缩小差距。

我们正在对Claude Fable 5的生物学安全防护进行更新,以大幅减少误报。Fable 5用户现在将经历更少的“回退”——即系统在用户提出生物学相关查询后切换到能力较弱的模型。在我们的测试中,此更新将各产品界面上的生物学相关回退减少了约85%。¹

因此,Fable 5将能够协助处理更广泛的生物学任务。

实际上,用户在日常健康和教学问题上应看到显著更少的回退——例如,解读实验室结果、理解症状,以及在教育环境中学习生物学。医疗专业人员将能在临床任务上从Fable 5获得更多支持。

我们相信,AI对世界产生积极影响的最大机会在于生物学和医学领域,我们正在大力投资,以负责任的方式为生物学家提供前沿访问权限。目前,对于我们认为具有双重用途的请求——包括病毒学、毒理学和分子设计——Fable仍会回退到Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问途径缩小这一差距。

我们的目标是尽快将Fable 5的前沿能力交到尽可能多的用户手中。然而,要做到这一点,我们需要管理伴随如此强大模型而来的日益增长的风险。其中一个风险领域是生物学:Fable 5现在能在某些高度复杂的生物任务上超越专家,并在其他任务上提供操作支持。这意味着它能为开发新疗法的研究人员提供真正的帮助(这也是我们如此热衷于通过分类器改进和可信访问计划扩大模型访问范围的原因)。但在不当之人手中,同样的能力可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5可能为这类行为者提供显著提升——即提供他们在其他任何地方都无法获得的能力。

在生物学中,区分AI的有益和有害用途往往很困难。例如,在某些情况下,研究某种疾病的治疗方法需要科学家首先生产出导致该疾病的危险化合物。这在活疫苗中最为明显,因为科学家需要培养他们旨在预防的同一病原体。某些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家分离了蛇毒中能导致人体血压骤降的有毒成分。随着AI前沿新生物能力的发展,我们需要谨慎,确保这些能力带来的新风险不会先于其潜在科学益处而显现。

那些希望利用我们的模型作恶的复杂行为者知道如何利用这种模糊性来掩盖其意图,使危险任务看起来像普通的研究活动。美国情报界2026年年度威胁评估明确指出,此类行为者确实存在,生物技术(包括合成生物学和基因组编辑)的进步“可能导致新型生物威胁”。报告指出,多个国家行为者可能维持着积极的进攻性生物和化学武器计划——这些计划可能因获得前沿AI模型的原始能力而加速。

由于我们对这些“双重用途”能力(即可能用于有益或有害目的,且两者界限不易划分的能力)的担忧,我们特意在推出Fable 5时屏蔽了几乎所有生物学查询。这使我们能够为其他领域的用户提供该模型。我们知道这会让合法生物学用户感到沮丧:短期内会出现大量误报,用户提出生物学相关问题时会遭到拦截并被转至能力较弱的模型。尽管如此,我们选择做出这一权衡,因为Fable在生物学等双重用途领域被滥用的代价可能是灾难性的。

我们防范生物学滥用的核心方式之一是安全分类器:较小的自动化AI系统,用于检测Fable 5是否被要求执行受保护的生物学任务或产生有害输出(我们此前曾撰文介绍过我们在网络安全领域的类似分类器)。

对于Fable 5,当分类器触发时,模型会将用户请求重新路由至Opus 5——这是一个能力较强但不具备Fable 5同等生物学能力的模型,无法为恶意用户提供同等程度的协助。这就是用户请求被拦截时看到的回退。

开发精确且稳健的分类器并非易事。要使分类器快速且一致地工作,它必须学会区分我们认为“范围内”和“范围外”的主题和查询。调整分类器需要时间和反复迭代,以避免误报(分类器对范围外内容触发)和漏报(漏掉范围内内容)。我们还要求分类器能抵御绕过尝试(即越狱),这需要进一步的研究和测试。

从非常宽泛的生物学分类器入手,意味着我们可以在继续研究以完善它的同时,让用户访问Fable 5。另一种选择——在安全防护取得更大进展之前暂缓发布模型——会将模型的普遍访问及其对用户的潜在益处推迟数周或数月。

在过去几周里,我们仔细重写了分类器的章程(由一系列规则组成,帮助模型区分受保护内容和允许内容),并详细列出了良性用途。我们征求了Anthropic内外多位专家的反馈。随后,我们基于该章程为分类器开发了更新的训练数据,重新训练了模型,并验证了新分类器仍能对有害和双重用途的研究生物学内容触发,但如今能支持更广泛的良性及有益用途。

如下图所示,这些更新意味着——与Fable 5发布时相比——分类器对良性生物学相关请求的触发将显著减少。

在完善安全防护方面,仍有大量工作要做。误报将不可避免地存在——即请求落在分类器的安全边际内,风险极低但分类器仍会触发。如上所述,由于潜在的双重用途风险,Fable将继续拦截专业生物学和药物开发查询。我们完全致力于通过可信访问途径,为研究人员开发一条安全、可扩展的使用我们最强大模型的路径。

我们希望您继续与我们分享反馈,以便我们进一步改进安全防护。

译自 Anthropic · 产品发布 · 录于 二〇二六年八月七日