摘要
大型语言模型(LLMs)越来越多地作为开放权重模型发布,并具备防止有害请求的保障措施。然而,句子完成仍然容易受到不完整有害提示的影响。在本研究中,我们将这一现象正式化为不完整提示越狱(IPJ),并系统性地对何时以及如何不完整提示引发有害延续进行了实证特征分析。
我们分析了与不完整句子延续相关的多种吸引子类型,并表明 LLMs 系统性地延迟拒绝,直到句子结束。我们进一步证明,通过参数调优来训练模型拒绝不完整有害提示是不够的,无法在内容领域和吸引子类型之间实现泛化。
为了实现更精细的控制,我们识别了两个功能神经元:终止神经元和延续神经元。通过阐明它们在句子完成中的角色,我们强调了神经元级干预在更精准和稳健的 IPJ 防御中的潜力。
博主点评: 这项研究揭示了大型语言模型在处理不完整提示时的脆弱性,并提供了针对性防御的方向。通过深入分析神经元的角色,未来可能会开发出更强大的防护机制,以应对潜在的安全威胁。对于模型开发者而言,这是一个值得关注的警示,强调了对模型行为的全面理解的重要性。