NeFut Logo NeFut
EN 管理员登录

[AI学术] 反学习与分布恢复:控制性反事实研究的极限探索

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #Machine Learning #optimization

摘要

机器反学习通常通过与训练探针匹配的重训练oracle进行评估。在一个受控的非事实测试环境中,我们发现这一标准可能偏向于保留已知知识的方法:这些方法的评分在未学习水平下,持有的遗忘事实为 $-2.82$ nats(聚类置信区间 $[-3.16,-2.48]$)。我们将反学习重新定义为恢复到匹配参考,并审计无oracle的筛选和证书样式标准,涵盖五种开放架构家族中的45个模型种子单元。

参考本身否定了绝对保留/往返证书:按构造保留保留集的注入模型在45个单元中有41个未能通过固定的保留阈值,且在其自身的往返中有31个未能通过,而参考仅在45个单元中的1个完全认证。基于基准的持出筛选作为选择性必要测试仍然强劲:在一个密封挑战套件中,它在45个单元中拒绝注入模型,在44个单元中接受参考,并部分检测到实体路由抑制(35/45);这是一个必要的测试,具有测量的灵敏度,而非充分的证书。

一个相对于损害的重新校准,基于参考的自身操作点,在15个单元中认证了一个小子集;在未弃权的情况下,其选择位于其优化的轴上的重训练噪声(0.80 nats)之内,而常见的训练探针标准距离为5.17 nats(支持性比较,而非面对面基准)。一个固定幅度的logit抑制攻击在12个单元中击败了完整的前向电池,因此仅前向认证并不可靠;我们的方法是对生产方法的经验选择性测试。一个可识别性定理界定了哪些事实允许完全无oracle的遗忘阈值,TOFU作为预测的边界情况。

博主点评: 本文深入探讨了机器反学习的评估标准,提出了无oracle的筛选方案,挑战了传统的重训练方法。其结果表明,现有的评估标准可能无法准确反映模型的反学习能力,尤其是在处理复杂模型时。对反学习的理解将推动未来模型设计的改进与优化。

原文链接: https://arxiv.org/abs/2607.19442

[h] 返回首页