摘要
Fine-Tuning-as-a-Service (FTaaS) 平台允许用户在定制任务上训练大型语言模型(LLMs),但这种流程可能会削弱模型的安全对齐。服务提供商需要在不重新运行完整对齐或破坏定制任务所获得的效用的情况下恢复模型的安全性。
现有工作中有一条思路是模型参数合并,这种方法在微调模型参数上添加安全补丁,以使模型远离不安全的倾向。然而,这种基于合并的范式在任务安全更新的纠缠上存在根本瓶颈:下游任务更新与安全补丁往往在其主导方向上重叠,因此合并强度的校准本质上是困难的。如果安全向量的缩放过弱,有害成分可能仍然占主导,阻止模型回到安全区域;如果缩放过强,则会抑制与任务相关的方向,降低效用。
为了解决这个问题,我们将基于合并的方法的重点从设计在线合并操作转向离线补丁学习,寻求一个对任务相关方向干扰最小的安全补丁,同时保持对不安全行为的决定性控制。我们提出了 TRACE,一个基于轨迹的安全补丁学习框架,(i) 模拟有害的调优轨迹以生成逐步损坏的状态,(ii) 优化一个插件补丁以在保持效用的同时恢复安全性,适用于不同的损坏基础状态。在六个基准测试和两个模型中,TRACE 一直在安全-效用边界上表现优异。TRACE 在所有设置下几乎达到了 100% 的安全性,同时保持与未防御微调模型相当的效用。
博主点评: TRACE 方法通过轨迹模拟与补丁学习的结合,成功解决了模型安全性与效用之间的矛盾,为 LLM 的安全对齐提供了新的思路,展现了在 AI 安全领域的重要应用潜力。其在多个基准测试上的优异表现,值得业界关注与深入研究。