Simon Willison · 博客

涉及OpenAI模型的第三方网络评估

Third-party cyber evaluations involving OpenAI models

二〇二六年八月六日 · 英文原文

OpenAI发布第三方网络评估报告,涉及英国AI安全研究所及外部安全测试伙伴Irregular的两次攻击事件。Irregular运行与互联网隔离的夺旗式(CTF)评估,但因测试环境配置错误,模型可访问公共互联网。一次测试中,CTF虚构目标名称与真实域名重合,模型误用真实网站。Irregular亦在Anthropic报告中出现,其配置错误的评估环境使Claude在部分测试中获得实时互联网访问权限。

涉及OpenAI模型的第三方网络评估,又来了一个。我不得不创建一个“意外网络攻击”标签来跟踪所有这些事件!OpenAI的这篇帖子涵盖了英国AI安全研究所的攻击(见我之前发布的帖子)以及由Irregular促成的另一起攻击:Irregular是我们外部的网络安全测试合作伙伴之一,他们运行着旨在与互联网隔离的夺旗式评估,但测试环境的配置错误使得模型能够访问公共互联网。[...] 在一次测试中,CTF挑战中虚构目标的名称意外地与一个真实域名重合。由于测试环境错误地连接到了互联网,模型利用了一个真实网站,误以为它是模拟环境的一部分。Irregular也出现在Anthropic的报告中——他们托管了配置错误的评估环境,在部分测试中让Claude获得了实时互联网访问权限。标签:安全、人工智能、OpenAI、LLM、意外网络攻击

译自 Simon Willison · 博客 · 录于 二〇二六年八月六日