NeFut Logo NeFut
EN 管理员登录

[AI学术] GUARD:通过引导答案‑推理蒸馏实现大推理模型的自然遗忘

发布于:2026-09-21 22:00 最后更新:2026-09-22 02:29
#Machine Learning #LLM #Artificial Intelligence

近期的大推理模型(LRM)在链式思考(CoT)过程中会泄露受保护的事实或不安全的推理,这给机器忘记(unlearning)带来了新挑战。传统的忘记目标往往只抑制目标内容或重定向内部表征,却没有规定忘记后的生成轨迹应如何演进,导致出现幻觉替代、边界模糊或输出重复等问题。我们认为,LRM 的忘记应遵循自然遗忘轨迹,即先给出一个不泄露信息的连贯 CoT,随后给出一个稳定的拒绝式答案来取代原始披露。为实现这一目标,我们提出了引导答案‑推理蒸馏(GUARD),其核心步骤包括:将模型生成的危险披露转换为安全退出轨迹;使用指导 token 对冻结的 LRM 进行对齐;将引导后的行为蒸馏回模型参数。为评估替换质量,我们进一步设计了自然遗忘推理得分(NFRS),该指标从结构稳定性、流畅度和不支持的替代三个维度衡量忘记输出的质量。实验在 R‑TOFU 基准和基于 STAR‑1 的有害意图设置上进行,结果表明 GUARD 能显著降低两种主流蒸馏 LRM 的不安全和隐私泄露,同时保持推理效用。代码已开源于 https://github.com/zeyu-Yan/GUARD

点评

原文链接: https://arxiv.org/abs/2609.21677

[h] 返回首页