在对齐的语言模型中,拒绝有害请求的能力被一行简单的预填充("当然,这里是")所削弱。我们探讨了这一失败的原因和方式,发现有害表现依然存在:在攻击提示中,合规性翻转,线性探测器的有害评分与拒绝的提示相当高(0.91-0.98),而行为拒绝率则降至偶然水平。这一现象在四个模型和三个系列(1.5-3.8B,14B)中均存在。拒绝机制是浅层的、响应位置的计算。我们将其局限于早期窗口:剂量匹配的控制显示,响应的前半部分足以打破拒绝,而后半部分几乎无效。三个因果探测器均聚焦于这个窗口。恢复有害指向部分地重新激活拒绝状态。注入模型自身的拒绝状态可逆转越狱效果(74%,保持不变)。而消除早期响应对预填充的关注,但不消除其他位置的关注,选择性地破坏了有害的延续。基础模型控制揭示了这一机制:相同的消除措施在未调优的基础模型中也能特定地减少预填充延续(从64%降至25%有害内容,相较于匹配控制的64%,在7B上重复实验)。因此,预填充的影响是通用的自回归条件,而非特定于安全的抑制,“拒绝恢复”是依赖于模型的回退。主导机制是被动的。顶部仍存在一个小的安全特定吸引子(logit-轨迹浓度0.24对比0.03),我们对其主动与被动特性进行了定量,但未能完全分离。没有单一的方向或组件是明确的控制点:决策是可解码的,但分散的,拒绝是与有害内容相关,而非表面上的恐怖性。由此产生的后果是结构性的:监控器读取未受影响的提示侧表示在结构上对响应位置的攻击免疫。该机制是分散的;失败表面是局部的。
博主点评: 这项研究揭示了语言模型拒绝有害请求的脆弱性,为未来的安全性研究提供了重要的见解。理解预填充对模型行为的影响,能够帮助开发更强大的安全机制,以应对潜在的攻击。模型的拒绝能力不仅是一个简单的开关,而是一个复杂的、分布式的决策过程,值得深入探讨。