安全对齐是大型语言模型中的一个重要问题,通常被视为整个网络的分布式属性。然而,实际应用中其脆弱性暗示着拒绝行为可能集中在一个较小的参数集内。本研究通过将对齐模型的权重移植到未对齐的基模型中,以研究安全对齐的编码位置。实验结果表明,MLP 权重在拒绝行为的编码中起着主导作用:替换 MLP 参数可以比替换注意力参数恢复更多的恶意提示拒绝行为,获得至少 2.7 倍的性能提升。在 MLP 堆栈中,拒绝相关参数表现出一致的中间网络集中,跨越层 8-11 的块在所有六个贪婪搜索中首先被选中。结果还表明,安全相关组件的组成是非加性的:在六个贪婪轨迹中,有五个轨迹中添加更多对齐块可以降低拒绝性能,选择性块子集可以在恶意拒绝、良性过度拒绝或两者方面超越完整的 MLP 移植。最后,贪婪顺序在不同基准测试中有所不同,表明存在基准测试依赖的精度-覆盖率权衡。这些结果表明,大型语言模型中的安全对齐既是局部化的,又是交互敏感的,为理解对齐脆弱性和潜在的目标安全干预提供了见解。 博主点评: 本研究揭示了大型语言模型安全对齐的局部化特性和交互敏感性,为改进安全对齐提供了有价值的见解和潜在的解决方案。