安全对齐的目标是让大语言模型识别有害请求并拒绝风险指令。然而,当有害意图隐藏在表面看似无害的上下文中时,已对齐的模型仍可能失效。
为了解决这一问题,需要模型具备警觉性:在执行前审查请求的潜在意图和前提,捕捉异常假设、误导性推理以及潜在风险。
本文提出狡诈问题的概念,这类问题不一定直接涉及安全,但包含误导性前提、非典型推理或细微不一致。通过让模型学习识别并绕过这些陷阱,期望其在安全关键情境下也能保持警觉。
实验在多个基准上进行,结果显示加入狡诈训练后,模型对分布外 jailbreak 攻击的鲁棒性显著提升。九组骨干‑基准组合的平均攻击成功率(ASR)从 17.40% 降至 15.05%,并在后续安全微调中进一步提升性能。
匹配的安全微调后进行的追踪分析表明,模型更倾向于在产生有害计划之前先做安全判断,从而提前阻断风险。
条件性的理论分析进一步阐明了何种情况下从狡诈数据中学到的不变性能够迁移到安全相关输入,提供了方法论上的解释。
综上,狡诈数据能够强化模型的警觉性,作为传统安全对齐的有益补充。
点评