NeFut Logo NeFut
EN 管理员登录

[AI学术] 我们在估计哪种影响?反事实规范在数据归因中的作用

发布于:2026-09-29 22:00 最后更新:2026-09-30 01:41
#AI #Machine Learning #LLM

估计训练样本对模型行为的影响是数据调试、价值评估和归因的核心任务。现有影响估计器往往给出不一致的排序,常被归因于近似误差。我们指出,更根本的分歧来源于规范不匹配:影响取决于(1)被归因的行为、(2)对每个训练样本施加的干预、以及(3)将干预映射到模型响应的反事实训练过程。尤其当目标行为需要可计算的代理(如查询损失、logit 或 margin)时,这些选择尤为关键。我们将影响形式化为一个反事实估计量,区分不同估计量之间的规范不匹配与对固定估计量的近似误差,并依据各自暗含的规范对代表性估计器进行归类。进一步地,我们推导出一个局部分解式,揭示行为信号、训练信号和反事实参数响应的相互作用。受控实验表明,不同规范下的精确估计量会产生不同的排序,而近似误差随扰动远离线性化点而增大。噪声标签检测和大语言模型归因实验显示,规范选择显著影响归因质量,尤其是行为代理的选取。行为对齐的规范能够发现默认基于损失或相似度的规范所掩盖的目标特定训练样本。上述结果表明,规范分析是解释和比较数据影响估计器的必要第一步。

点评

原文链接: https://arxiv.org/abs/2609.31214

[h] 返回首页