保障AI agent的未来安全
Securing the future of AI agents
2026年6月18日,Google DeepMind发布AI Control Roadmap,用于保护内部系统免受能力增强但对齐不完美的AI agent威胁。该框架将未对齐agent视为潜在内部威胁,基于MITRE ATT&CK框架进行威胁建模,通过受信AI系统作为监督者实时监控agent推理与行动,并衡量覆盖率、召回率和响应时间三个指标。团队已分析百万条编码agent轨迹,为Gemini Spark等系统构建实时监控器,并发布面向政策制定者的《AI Agent安全的三层架构》技术框架。
2026年6月18日 责任与安全
Rohin Shah 与 Four Flynn
我们如何保护内部系统,以应对能力日益增强且对齐不完美的 AI
AI agent 正在改变我们与技术的关系。通过自主执行复杂任务——从网络防御到科学发现和产品开发——这些系统正在开启一个生产力新时代。仅在美国,到 2030 年,AI agent 就能创造 2.9 万亿美元的经济价值。
随着这些 agent 能力增强,它们也需要更复杂的防护措施。这就是我们制定 AI Control Roadmap 的原因:一个用于构建和管理我们在 Google 内部部署的先进 AI 的框架。这种“纵深防御”方法,可作为更广泛行业的参考模型,超越了传统的模型对齐,增加了一层关键的系统级安全,即使对齐不完美也能提供保障。
理解 AI Control
我们的安全方法始于一个坚实的基础,融合了沙箱、端点安全和 prompt 注入防御等传统防护措施。在此基础上,AI Control Roadmap 将模型对齐(即训练 AI 使其天生安全且有用)作为主要防线。它通过将内部 agent 视为可能未对齐的,提供了一层额外的安全保障,即使对齐不完美也能提供保证。
可以把它想象成一位拥有双重控制装置的驾驶教练。教练信任学员,但随时准备在出现错误时接管方向盘或踩下刹车。类似地,我们的 AI control 系统根据已验证的行为授予 AI agent 权限,使我们能够通过受控、渐进式的访问建立信任。
我们的路线图建立在一个简单但谨慎的假设之上:如果一个能力极强的 AI agent 与我们的目标不一致,并做出意外行为,该怎么办?为解决此问题,我们的计划聚焦于三个关键领域。
首先,遵循网络安全最佳实践,我们为 AI 开发了一个新颖的威胁建模框架。该路线图将不受信任的 AI agent 视为潜在的“内部威胁”——类似于公司对待可能已进入办公室的潜在恶意员工的方式。通过建立在行业标准 MITRE ATT&CK 框架(一个基于真实世界观察、全球可访问的对手战术和技术知识库)之上,我们将潜在攻击分解为更小的战术和技术。这使我们能够有条理地追踪风险,在造成损害前发现不良行为,并安全地进行演练以测试我们的防御是否真正有效。
其次,我们制定了一个部署 AI control 缓解措施的计划,以应对这些风险。
- 识别问题(检测):监控是 AI control 的支柱。我们使用其他受信任的 AI 系统作为“监督者”,持续审查工作 agent 的推理、行动和计划,以判断其是否偏离轨道。
- 管理问题(预防与响应):如果监督者发现 agent 试图做出有害行为,它可以在损害发生前介入阻止该行动。
最后,为确保系统正常运行,我们持续衡量三个关键指标的性能:覆盖率(被监控流量的比例)、召回率(被捕获的未对齐行为的比例)和响应时间。
随着 AI 变得更智能,扩展安全性
随着 AI 模型不断进步,我们的防御也必须同步加强。在我们的 AI Control Roadmap 中,我们将安全协议映射到 AI 能力在两个关键方面的可衡量里程碑:
- 规避检测的能力: 目前,我们监控模型可见的思维链。然而,随着模型学会隐藏其推理——无论是通过 oversight awareness(知道被监控)还是 opaque reasoning(不使用可见文本进行推理)——仅仅读取其口头化的推理将不够。我们需要分析其行为,并可能检查模型的内部运作。
- 潜在危害的能力: 对于低风险和可逆的行动,我们可以依赖延迟审查记录并在问题发生后快速修复(异步响应)。对于特别高风险的行动,例如重大网络攻击,我们必须转向实时预防,在有害行动执行前阻止它们(同步响应)。换句话说,我们的响应策略必须随威胁的严重程度而扩展。
AI Control Roadmap 根据部署模型的能力推荐安全措施。模型的检测规避能力决定了检测级别(D1-D4),模型的攻击执行能力决定了预防与响应级别(R1-R3)。
分析百万条 agent 轨迹以指导实时监控
为了构建这些系统,我们需要数据。我们的团队构建了一个异步监控系统的内部原型,该系统审查编码 agent 的轨迹,并将发现结果上报以供人工审查。每个被标记的事件都根据我们路线图中的威胁分类法进行分类。
我们已经分析了百万条编码 agent 任务,这为我们提供了宝贵的见解来完善安全协议,并使我们能够超越简单的关键词过滤,识别出高信号的行为模式。例如,这项研究对于为 Gemini Spark agent 构建实时监控器至关重要,使我们能够实时响应新出现的问题,如意外数据删除。
需要指出的是,我们的数据显示,大多数被标记的事件并非源于对抗性意图;相反,它们通常源于 agent 的误解或过度积极 以实现用户目标。理解这些细微差别对于完善我们的安全协议至关重要。
保护 agent 生态系统是共同责任
AI Control Roadmap 是我们多层 agent 安全方法中的一个关键要素。通过将这些协议与我们的更广泛基础设施集成,我们正在扩展内部安全性,以安全管理我们最先进的 AI 模型。
此外,这种多层 agent 安全方法应成为行业、政策制定者和学术界的合作重点。通过围绕最佳实践和标准协调生态系统,我们可以赋能网络防御者并构建社会韧性。因此,今天我们还将发布一份面向政策制定者的技术框架,《AI Agent 安全的三层架构》。该论文详细说明了我们如何在单个 agent 层面、多 agent 系统中提升安全性,以及如何赋能网络防御者并在更广泛的生态系统中构建韧性。
我们计划在这些框架的基础上继续发展,以便在当下自信地部署能力强大的 AI,同时为未来构建安全的基础。
在此处阅读完整技术报告:
研究作者
Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, and Scott Coull.
致谢
Four Flynn, Anca Dragan, Alan Cooney, Bilal Chughtai, Buck Shlegeris, Cody Wild, David Lindner, Julian Stastny, Kevin Klyman, Li Ding, Myriam Khan, Raluca Ada Popa, Roland Zimmermann, Ryan Greenblatt, Senthooran Rajamanoharan, Victoria Krakovna and Xerxes Dotiwalla.