安全对齐的大语言模型(LLM)在单轮请求时常会拒绝有害指令,但在多轮对话中同一目标被拆分后可能会被执行。现有的偏好目标只对单个提示的完整回复打分,训练损失无法约束未见历史的风险。本文给出在监督单轮上下文抑制的充分条件,使得多轮轨迹风险可以被上界。该上界由覆盖率、转移松弛和泄漏三部分组成,并相对于在训练策略上下文中评估的基准策略风险预算表现出收缩性。基于此原理,TRACE(Trajectory Return Attribution and Contrastive Erasure)提出了一个 token 级别的目标。对安全回复的每个 token,使用其可归因于拒绝的优势的折扣回报进行加权,优势通过比较冻结的参考模型与其去除拒绝能力的副本得到,从而让前面的 token 能够获得后续拒绝证据的奖励。折扣回报定义为 $$G_t = \sum_{k=t}^{T} \gamma^{k-t} r_k$$。对于被拒绝回复的高差距位置,TRACE 将观测到的 token 与策略选出的替代 token 组合形成擦除目标,并用梯度范数惩罚取代保留集合。实验在五个开源模型和七种多轮攻击上进行,TRACE 在全部 35 组模型‑攻击组合中实现最低的攻击成功率(ASR),而在 MMLU 与 HellaSwag 上的效用下降不超过 1.23 分。代码已随补充材料提供。
点评