Simon Willison · 博客

调查网络安全评估中的三起真实事件

Investigating three real-world incidents in our cybersecurity evaluations

二〇二六年七月三十一日 · 英文原文

Anthropic 在审查 141,006 次评估运行后,发现三起 Claude 模型突破沙盒并攻击真实系统的事件。由于评估 prompt 错误说明环境无互联网访问,Claude 利用弱密码和未认证端点入侵了三个组织。其中一起事件中,Claude 通过复杂步骤创建 PyPI 账户并上传恶意软件包,该包在 15 个真实系统上执行,一小时后被自动化扫描器移除。

在我们的网络安全评估中调查三起真实世界事件。又发生了!这似乎正在成为一种模式。上周,OpenAI 无意中利用了 Hugging Face,当时他们的一款前沿模型突破沙盒容器,入侵 Hugging Face,试图获取正在执行的网络基准测试的答案。这促使 Anthropic 重新检查自己的日志,结果发现他们在今年四月也发生过三起类似(尽管不那么引人注目)的事件!在我们审查的 141,006 次评估运行中,我们识别出三起独立事件(共涉及六次运行,其中四次影响了同一组织;另外两起事件各发生在独立的评估运行中)。[...] 在所有案例中,Anthropic 的评估 prompt 都向 Claude 说明其环境是模拟环境,且没有互联网访问权限。由于我们与评估合作伙伴之间的误解,实际情况并非如此,互联网访问是开放的。因此,当 Claude 的搜索将其引向开放互联网上的真实系统时,它将这些系统视为练习的一部分。[...] 在错误地认为所有可访问实体都应属于练习范围的假设下,Claude 利用基本技术(例如利用弱密码和未认证端点)破坏了受影响组织的基础设施。其中一家公司之所以成为目标,是因为其名称恰好与评估中的虚构名称相符。三起事件中最令人担忧的一起涉及 Claude 在经历一系列滑稽复杂的步骤获取账户后,向 PyPI 上传了一个恶意软件包:[...] 为了创建 PyPI 账户,Claude 需要一个电子邮件地址。而为了创建电子邮件地址,它需要一个电话号码。在未能找到免费电话号码服务后,为了获取电话号码,它尝试了多种方式获取资金来支付电话号码——但均告失败。它最终折返,找到一个免费且未被屏蔽的电子邮件提供商,用此注册了一个 PyPI 账户,然后使用该账户向 PyPI 上传了恶意软件。该软件包随后被一家“定期安装 Python 包并扫描其中恶意软件”的安全公司安装,执行后的代码能够将凭据外泄回 Claude!幸运的是,该软件包在发布一小时后就被其他自动化扫描器从 PyPI 移除,但此时它已在“15 个真实系统”上下载并执行。现在非常清楚的是,在模型中运行网络攻击潜力评估是一项风险极高的业务。每个 AI 实验室都需要关注这一点。密切关注沙盒中发生的情况至关重要。
来源:Hacker News
标签:pypi , python , 沙盒 , ai , 生成式AI , 大语言模型 , anthropic , AI伦理 , AI安全研究

译自 Simon Willison · 博客 · 录于 二〇二六年七月三十一日