GPT-Red:解锁鲁棒性自我改进
GPT-Red: Unlocking Self-Improvement for Robustness
摘要
OpenAI 开发了 GPT-Red,一种基于自我对弈(self-play)的自动化红队系统,用于提升 AI 安全性、对齐(alignment)及 prompt 注入(prompt injection)鲁棒性。该系统通过模型间对抗性交互生成攻击与防御样本,无需人工标注即可持续优化 LLM 的防御能力。实验表明,GPT-Red 在多个安全 benchmark 上显著降低了有害输出率,并增强了模型对恶意 prompt 的抵抗能力。
探索 GPT-Red:OpenAI 的自动化红队系统,通过自我对弈(self-play)提升 AI 安全性、对齐(alignment)以及 prompt 注入(prompt injection)鲁棒性。
译自 OpenAI · 官方博客 · 录于 二〇二六年七月十五日