激活引导为控制大型语言模型提供了一种轻量级机制,但引导向量可能产生意想不到的外部效应:效用向量可能削弱安全行为,而拒绝向量可能在良性提示上导致过度拒绝。我们引入了OPIUM(通过效用流形优化保护注入),这是一种无训练的方法,通过表示匹配来净化引导向量。
给定两组提示上的参考行为,OPIUM优化出一个新的引导向量,该向量在保持所需干预引导的下游表示的同时,在原向量失效的提示上匹配更安全的参考行为。在引导外部效应和过度拒绝的设置下,OPIUM相较于传统引导和方向性消融,改善了安全性与效用的权衡,表明激活引导的有害副作用通常可以直接在激活空间中得到缓解。
博主点评: OPIUM的提出为大型语言模型的安全性提供了新的思路,通过优化引导向量的方式,有效地解决了引导过程中的潜在风险。这种方法不仅提升了模型的安全性,也为后续研究提供了重要的实践参考,值得深入探索其在不同场景中的应用效果。