Hugging Face · Daily Papers

OpenART:通过开放式环境演化扩展Agent红队测试

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

Yunhao Chen, Xin Wang, Yixu Wang, Yi Liu, Jie Li, Yan Teng, Xingjun Ma, Xia Hu 等 9 位
二〇二六年八月十三日 · arXiv:2608.00677 · PDF · Code

AI代理在持久化环境中运行,早期状态变化可能影响未来很远的决策。与传统语言模型交互不同,代理行为通过共享状态进行中介,该状态在长周期工作流中被反复修改和复用。当前的安全基准往往无法捕捉这些累积风险,因为它们聚焦于短时、静态的任务。为解决这些局限,我们引入了OpenART,一个通过环境演化实现可扩展代理红队测试的开放式竞技场。OpenART提供跨越50个领域的超过10,000个经过验证的有状态场景,源自超过500,000个工具和技能的池子。这些任务中位数需要97次工具调用,并支持在75种不同代理模型配置上进行统一评估。

为系统探索这些不断演化的攻击面,我们提出了演化马尔可夫超图攻击(EMHA)。EMHA是一种黑盒策略,通过协调授权状态转换执行反馈驱动的环境演化,无需参数更新。在整个评估过程中,任务目标保持不变,仅环境状态发生变化。在所有配置中,EMHA实现了85.0%的汇总攻击成功率(ASR)。其相对于仅指令演化的优势从简单环境中的约2%增长到最复杂环境中的超过17%,表明随着任务复杂度增加,环境演化日益暴露安全失败。此外,我们的分析显示,代理的具体运行时实现解释了超出底层模型能力之外的安全差异的显著部分。这些结果确立了OpenART作为研究复杂演化环境中代理安全的可扩展基础。

译自 Hugging Face · Daily Papers · arXiv:2608.00677 · 录于 二〇二六年八月十三日