NeFut Logo NeFut
EN 管理员登录

[AI学术] 解析证据、矛盾和脆弱性在干扰响应中的作用

发布于:2026-08-14 22:00 最后更新:2026-08-16 07:03
#AI #Machine Learning #Neural

解析证据、矛盾和脆弱性在干扰响应中的作用是一个重要的研究课题。传统的干扰方法通过测量预测结果在输入改变时的变化来解释模型的决策过程,但响应幅度只能告诉我们模型反应的程度,而不是反应的含义。同样的幅度可能支持最终的事实-反事实差异、反对它或者沿着干扰路径强烈出现但在终点消失。因此,我们跟踪对比如何在成对输入逐渐揭示时发展,并使用最终对比来解释轨迹。我们提出了DECAF(证据、矛盾和脆弱性的分解),它将一致、相反和终点空的响应路由到证据E、矛盾C和脆弱性F。分解保留了普通幅度的精确值,Abs = E + C + F,并在终点相关的公理下是唯一的。在受控的视觉和表格设置中,三个组件跟踪独立测量的行为。在72个ImageNet-9模型的审计中,我们比较了响应幅度几乎相同但独立测量行为不同的情况。DECAF的最大组件在96.4%的情况下与观察到的行为一致,而仅凭幅度的准确率为35.0%。仅改变揭示路径就能增加近80%的总响应,但证据几乎没有变化,而脆弱性增长了4倍以上。在FunnyBirds和ImageNet-1k上,短的前向DECAF轨迹优于测试的通用归因基线。在1B级的DINOv2模型上,短轨迹与强大的基于梯度的基线相匹配,墙面时间降低了4.75倍,峰值内存降低了2.36倍。 博主点评: 这项研究为我们提供了一个新的视角来理解模型的决策过程,通过分解证据、矛盾和脆弱性,我们可以更好地理解模型的行为和反应。

原文链接: https://arxiv.org/abs/2608.12935

[h] 返回首页