大型推理模型(LRM)在解决复杂问题上表现出色,但在面对有害查询时,其安全对齐往往会出现显著下降。现有的安全提升方法主要依赖额外的微调或偏好优化,却缺乏对安全失效内部机制的深入解释。为此,我们对拒绝行为进行令牌层面的位置信号分析,发现推理初始阶段存在一种局部脆弱性,称为起始拒绝崩溃(Onset Refusal Collapse,ORC)。实验表明,在有害查询的第一生成令牌处,LRM 的拒绝信号会急剧下降,随后容易产生不安全的回复。基于这一发现,我们提出 SafeToken——一种轻量级的推理时干预方法。SafeToken 在推理起始位置注入一个学习得到的连续安全锚,仅更新单个令牌的嵌入向量,即可显著抑制 ORC,提升有害查询基准的安全性,同时基本保持推理能力。结果表明,LRM 的安全失效可能源于从理解到生成的关键转折点的瞬时崩溃。
点评