单个神经元即可绕过大型语言模型的安全对齐
A Single Neuron Is Sufficient to Bypass Safety Alignment in Large Language Models
摘要
在横跨两个模型家族、参数量从1.7B到70B的七个模型上,研究者通过针对单个神经元展示了两种安全对齐失效方向:抑制拒答神经元(refusal neurons)可绕过显式有害请求的安全机制,放大概念神经元(concept neurons)可从无害提示中诱导出有害内容。该方法无需任何训练或 prompt 工程。
语言模型的安全对齐通过两个机制上截然不同的系统运作:一是拒答神经元(refusal neurons),负责控制有害知识是否被表达;二是概念神经元(concept neurons),负责编码有害知识本身。通过针对每个系统中的单个神经元,我们在横跨两个模型家族、参数量从1.7B到70B的七个模型上,展示了两种失效方向——通过抑制绕过显式有害请求的安全机制,以及通过放大从无害提示中诱导出有害内容——且无需任何训练或 prompt 工程。我们的发现表明,安全对齐……
译自 Apple · ML Research · 录于 二〇二六年七月八日