现在我们有了OpenAI意外攻击Hugging Face的时间线
Now we have a timeline of the OpenAI accidental attack against Hugging Face
在Hacker News上对OpenAI与Hugging Face事件时间线的评论中,作者指出关键细节:5月7日OpenAI开始对实验性未发布模型进行新训练运行。作者推测这是RLVR(可验证奖励强化学习)训练,模型被设定目标并采取必要步骤实现,训练方面针对网络安全任务。RLVR任务越多,模型越通用,且无行为抑制机制,安全行为后期才添加,监控松懈因并行数千任务。作者类比种族歧视训练,认为模型需先学习激进黑客行为才能被教导禁止,并期待反馈。
我在Hacker News上对“OpenAI对Hugging Face的意外攻击时间线”发表了评论。我认为这里最有趣的细节之一可能藏在第一个要点中:5月7日,OpenAI开始对一个实验性、未发布的模型进行新的训练运行。(他们是指评估运行吗?视频中他们说的是训练运行,后来提到“奖励信号来判断他们表现如何”,所以我猜这确实是在训练一个模型,而不是评估一个已经训练好的模型。)我越想越觉得,这件事发生在训练新模型期间,可能是理解问题关键所在。在RLVR(可验证奖励强化学习)中,你为模型设定一个目标,并让它采取任何必要步骤来实现该目标。显然,OpenAI在这里训练的一个方面是让他们的模型针对网络安全任务进行RLVR。就像预训练受益于大量知识源一样,你喂给RLVR的任务越多,最终得到的模型就越通用。这也解释了为什么模型没有抑制行为的机制。那些安全行为是在过程后期才添加的。而且,这也解释了(但并不能开脱)为什么监控如此松懈。如果你像这样训练一个新模型,你可能会并行设置数千个这样的任务。我能理解你可能会错过一小部分训练代理开始在打包服务器的文件名中互相留言的情况。有人曾告诉我,如果你想得到一个没有种族歧视的模型,你不能只是把种族主义材料从训练数据中剔除:它必须看到种族主义的例子,以便之后被教导种族主义是坏的。我在这里看到了类似的情况。如果你的模型不知道如何激进地黑客攻击,你以后怎么教它不要这样做?(我对RLVR的实际运作知之甚少,所以我期待听到能帮助我理解我是否走对了方向的人的意见。)标签:人工智能、OpenAI、生成式AI、LLM、AI安全研究、OpenAI-Hugging Face事件