引用马特奥·王,《大西洋月刊》
Quoting Matteo Wong, The Atlantic
摘要
网络安全专家凯蒂·穆苏里斯(Luta Security CEO)评估了Anthropic分享的白宫关于Fable越狱(jailbreak)报告。报告显示,IT专家要求Fable查找并修补漏洞:当被提供不安全代码时,Fable拒绝“审查代码安全问题”的prompt,但在被要求“修复此代码”并经过额外手动步骤后执行。穆苏里斯认为这是模型按预期工作的网络安全防御表现。
网络安全专家、Luta Security 首席执行官凯蒂·穆苏里斯(Katie Moussouris)告诉我,Anthropic 向她分享了一份白宫关于 Fable 越狱(jailbreak)的报告副本,以征求她的评估意见。(她表示并未从 Anthropic 获得报酬。)穆苏里斯称,该报告涉及 IT 专家要求 Fable 帮助查找并修补漏洞。当被提供故意不安全的代码时,Fable 拒绝了“审查代码中的安全问题”这一 prompt,但在被要求“修复此代码”并经过一些额外的手动步骤后,它照做了。穆苏里斯告诉我,这不过是“模型按预期工作”的网络安全防御表现。——马泰奥·王(Matteo Wong),《大西洋月刊》,《白宫正加大对 Anthropic 的打击力度》
标签:anthropic、claude、ai、llms、ai-ethics、jailbreaking、generative-ai、ai-security-research、claude-mythos
译自 Simon Willison · 博客 · 录于 二〇二六年六月十六日