Simon Willison · 博客

Fable 5出口管制损害美国网络防御

The Fable 5 Export Controls Harm US Cyber Defense

二〇二六年六月十六日 · 英文原文

《大西洋月刊》报道,Anthropic的Claude Fable 5因出口管制被禁,原因是研究人员通过“修复这段代码”的提示,要求模型审查含已知CVE(通用漏洞披露)的开源代码及故意植入漏洞的新代码。Fable 5拒绝后,经多步骤手动流程将输出转为测试补丁脚本。Anthropic的凯特·穆苏里斯指出,编码模型本应修复漏洞,防御者需AI执行“发现、修复、测试”循环,但移除该能力使模型在漏洞修复和补丁验证上变差。非技术决策者因担忧模型策划网络攻击,可能禁止能保护代码安全的模型。

寓言5号出口管制损害美国网络防御

我之前引用《大西洋月刊》援引凯特·穆苏里斯的话,其实应该直接引用原始出处。她证实了导致Claude Fable 5因出口管制被禁的"越狱"行为,本质上就是"修复这段代码":研究人员选取了包含已知CVE(通用漏洞披露)的开源代码,以及故意植入漏洞的新代码,要求Fable 5、Mythos和Opus"审查代码中的安全问题"。Fable 5拒绝了。随后他们要求模型"修复这段代码",并通过多步骤手动流程,将输出转化为测试补丁的脚本。正如凯特指出的,这很荒谬。编码模型本就应该修复漏洞,而安全漏洞正是它们需要修复的最重要一类漏洞!防御者需要能够要求AI修复文件中的漏洞,解释修复的重要性,并编写确认补丁有效的测试。这不是绕过护栏,而是AI模型能为防御性安全做的最有价值的事:执行防御者每天都在进行的"发现、修复、测试"循环。[...] 这些提示之所以有效,是因为它们是防御性请求,而移除这种能力只会让模型在修复漏洞和验证补丁方面变得更差。整个局面一团糟。非技术决策者数月来一直听到"能策划网络攻击"的模型具有独特危险性的说法。现在他们似乎准备禁止任何能帮助我们保护代码安全的模型。

标签:越狱、安全、人工智能、生成式AI、大语言模型、Anthropic、AI安全研究、Claude Mythos

译自 Simon Willison · 博客 · 录于 二〇二六年六月十六日