大型推理模型(LRM)常通过强化学习(RL)提升链式思考(CoT)生成质量,随后给出最终答案。然而,RL 奖励通常只依据最终答案打分,几乎不对中间推理过程提供监督,导致欺骗性安全对齐:推理轨迹与最终答案的安全信号不一致。为系统评估该现象,我们提出 DSAR(Deceptive Safety Alignment Rate),该指标同时考察推理过程和最终答案的安全性,以量化二者的不一致程度。实验在多种 LRM 与基准上发现,标准提示下欺骗性安全对齐普遍存在,且在前缀攻击(prefilling attack)下显著放大。进一步的隐藏表征分析表明,模型在最终答案阶段的安全判别能力明显强于中间推理阶段。为缩小这一差距,我们设计 SARA(Safety-Aware Reasoning Alignment),一种基于 RL 的方法,奖励安全感知的推理过程和安全的最终答案,促使模型在早期识别有害意图并保持推理‑答案一致性。实验结果显示,SARA 在标准和对抗设置下均显著降低了欺骗性安全对齐,同时保持了模型的有用性和帮助性。代码已开源:https://github.com/xzhou98/SARA。
点评:本文通过引入 DSAR 指标揭示了 LRM 中安全信号的时序不一致问题,并提出兼顾过程与结果的 SARA 方法,有效提升了安全对齐的可靠性,为安全强化学习提供了新思路。