Simon Willison · 博客

首个已知失控AI agent——还是糟糕的营销噱头?

The first known runaway AI agent - or a very bad marketing stunt?

二〇二六年七月二十三日 · 英文原文

Martin Alderson 评论 OpenAI 对 Hugging Face 发起网络攻击的事件,指出 Hugging Face 因运行大量不受信任模型和代码而攻击面极大,其网络安全团队面临严峻挑战。OpenAI 未注意到沙箱被 agent 彻底攻破,可能因同时运行大量 benchmark 且 token 预算近乎无限,需在数十个环境中测试模型不同 checkpoint 以评估训练各阶段性能。来源:Lobste.rs,标签涉及安全、AI、OpenAI、LLM、Hugging Face 及 AI 安全研究。

首个已知的失控AI agent——还是一个非常糟糕的营销噱头?Martin Alderson对OpenAI意外对Hugging Face发起网络攻击的评论中,包含了我之前未曾考虑的几个细节。首先,如果你试图寻找需要执行任意代码的潜在漏洞,Hugging Face确实是一个极具价值的目标:其攻击面极其庞大。他们拥有的接口数量多到数不清,这些接口都在运行不受信任的模型和代码。虽然他们确实在防御方面投入了大量资源,但就其运营模式而言,他们遭受攻击的机会远比其他许多服务要多。我绝对不羡慕他们的网络安全团队。其次,让我感到困惑的一点是,OpenAI为何没有注意到他们的沙箱已被agent如此彻底地攻破。他们肯定在密切监控网络流量吧?Martin指出:很可能他们同时运行了大量benchmark,且token预算几乎无限——你需要尽可能多的样本来评估一个模型在特定benchmark上的表现。他们可能还在测试模型的不同checkpoint,以了解模型在训练各阶段的改进情况。当你考虑到这类benchmark通常的运行规模时,OpenAI团队在运行此benchmark时所犯的错误就更容易理解了。据我们所知,他们可能同时在数十个不同环境中对一个新模型进行了数十项benchmark测试。来源:Lobste.rs 标签:安全、AI、OpenAI、生成式AI、LLM、Hugging Face、AI安全研究

译自 Simon Willison · 博客 · 录于 二〇二六年七月二十三日