现在我们有了OpenAI意外攻击Hugging Face的时间线
Now we have a timeline of the OpenAI accidental attack against Hugging Face
在Hacker News对OpenAI与Hugging Face事件时间线的评论中,用户指出关键细节:5月7日OpenAI对实验性未发布模型启动新训练运行,推测为RLVR(可验证奖励强化学习)训练而非评估。该训练让模型在网络安全任务上采取任意步骤达成目标,任务量越大模型越通用,因此初期未含抑制行为,安全行为在后期添加。这也解释了监控松懈:并行数千任务时易遗漏异常。用户类比非种族主义模型需先见种族主义例子再被教导,认为模型需先学会激进黑客攻击才能被训练禁止,并期待RLVR实践反馈。
我在Hacker News上对“OpenAI对Hugging Face的意外攻击时间线”发表了评论。我认为这里最有趣的细节之一可能藏在第一个要点中:5月7日,OpenAI开始对一个实验性、未发布的模型进行新的训练运行。(他们是指评估运行吗?视频中说的是训练运行,后来提到“奖励信号来判断他们表现如何”,所以我猜这确实是在训练一个模型,而不是评估一个已经训练好的模型。)我越想越觉得,这件事发生在训练新模型期间,是理解问题关键所在。在RLVR(可验证奖励强化学习)中,你为模型设定目标,让它采取任何必要步骤来实现该目标。显然,OpenAI在这里训练的一个方面是让他们的模型在网络安全任务上进行RLVR。就像预训练受益于大量知识源一样,你喂给RLVR的任务越多,最终得到的模型就越通用。这也解释了为什么模型没有任何抑制行为的原因。那些安全行为是在过程后期才添加的。而且,这也解释了(但并不能开脱)为什么监控如此松懈。如果你在训练这样一个新模型,你可能会并行设置数千个这样的任务。我能理解你可能会错过一小部分训练代理开始在打包服务器上的文件名中互相留言的情况。有人曾告诉我,如果你想要一个非种族主义的模型,你不能仅仅把种族主义材料从训练数据中剔除:它必须见过种族主义的例子,以便之后被教导种族主义是坏的。我在这里看到了类似的情况。如果你的模型不知道如何激进地黑客攻击,你之后怎么教它不要这样做呢?(我对RLVR的实际运作知之甚少,所以期待听到能帮助我理解我是否走对方向的人的意见。)标签:人工智能、OpenAI、生成式AI、大语言模型、AI安全研究、OpenAI-Hugging Face事件