我们提出了一种无监督的安全增强方法,旨在对大语言模型(LLMs)进行对齐,而无需进行监督微调或依赖人类反馈的强化学习。我们的核心思想是提供一种稳健的即插即用方法,以防止在模型适应下游任务时出现阴影对齐问题。
具体来说,我们利用知识蒸馏从已对齐的LLMs中提取对齐信号,并通过模型融合将其注入到阴影对齐模型中,从而实现即插即用的对齐修正。
在我们的方法中,我们采用增量调试技术来识别有效蒸馏所需的关键知识组件。在有害问题数据集上,我们的方法显著提升了平均防御成功率,约提升14.42%,在17个受影响的LLMs中最高可达51.39%,且未影响模型性能。我们的代码可在 GitHub 上获取。
博主点评: 本文提出的无监督对齐方法为大语言模型的安全性提供了新思路,特别是在适应复杂下游任务时,能够有效降低潜在风险,具有实际应用价值。